Forum

Whisper czyli nowe fajne do rozpoznawania mowy

Oprogramowanie

Pitef

#141 ·

sprubowałem zrobić sobie z tego skrypt, na dysku C mam folder Whisper, w nim folder Robota i plik .bat z treścią twego wpisu. Dopisałem jedynie language pl, model i task. Nie działa.
Sygnatura? A co to jest i do czego :D

zywek

#142 ·

Zostaw to task, wpisz samo --language pl i wsio.

Pitef

#143 ·

nie działa. wklejam to, co mam w pliku.bat:

for %%a in (Robota\*.*) do (whisper "%%a" --language pl --model medium)
Sygnatura? A co to jest i do czego :D

papierek

#144 ·

1 likes
A piosenki mają melodię, churki i wiele innych zabiegów, przez które AI szaleje.
-- (mateponczas):
Ja rozumiem, ale są takie języki, gdzie, szczególnie w mowie potocznej, głoski są ucinane. Przecież nikt nie będzie się wysilał i mówił hiperpoprawnie tylko po to, by ulżyć temu narzędziu

--
po co mi sygnatura?

mateponczas

#145 ·

Ale mi nie chodzi o piosenki. Przykładem niech będzieszwedzki, gdzie nie zawsze fonetyka jest zgodna z pismem, no i klapa.

zywek

#146 ·

Ale cośkolwiek się wyświetla?

Pitef

#147 ·

Nie. Terminal na moment, i znika.
Sygnatura? A co to jest i do czego :D

zywek

#148 ·

Ale katalog robota w ogóle istnieje gdzie masz ten plik bat i na pewno niejest pusty?

zywek

#149 ·

jeśli jest pusty, znaczy, jeśli istnieje i ten plik bat gdzieś masz to jeszcze musisz tam ffmpeg.exe jak nie masz w wavach.

tomecki

#151 ·

Z tym jest jak z OCR. Bez błędów nigdy raczej nie będzie, ale pytanie, czy jest wystarczająco dla konkretnego celu.

balteam

#152 ·

No i pamiętajcie, że cały czas te algorytmy się poprawiają, więc jak nie teraz, to za 5 czy 10 lat będzie wystarczająco.
Zapraszam osoby posiadające piesy, lub chcące je posiadać, do dołączenia do grupy o psach przewodnikach.

papierek

#153 ·

1 likes
Czy z każdym poprawionym tekstem narzędzie jest lepsze? Chyba to tak nie idzie, bo nie jest to narzędzie chmurowe.
po co mi sygnatura?

pajper

#154 ·

1 likes
Nie, bo modele są statyczne. To nie jest samoorganizująca się sieć neuronowa.
#StandWithUkraine

Shoot for the Moon. Even if you miss, you'll land among the stars.

tomecki

#155 ·

A nawet jeśli to jeden teskt nie zmieniłby zbyt wiele, bo tam ponoć już ponad pół miliona godzin weszło.

papierek

#156 ·

1 likes
Dlatego modele oparte na chmurze i samouczeniu się zawsze będą miały przewagę.
po co mi sygnatura?

pajper

#157 ·

1 likes
Tak i nie. Np. w Eltenie nigdy nie moglibyśmy rozważyć wykorzystania Amazonu do transkrypcji wiadomości głosowych, kwestia prywatności.
W Eltenie też to odpada z powodu zasobów, ale już jest hipotetycznie możliwe.

I to nie jest wydumany przypadek, bo śledzę dyskusję na temat Whispera i interesuje on właśnie także programistów platform, które ze względu na prywatność użytkowników nie korzystają z chmury.
#StandWithUkraine

Shoot for the Moon. Even if you miss, you'll land among the stars.

zywek

#158 ·

No ale np taki tacotron jest narzędziem do czego innego, ale im więcej mu materiału wrzucisz tym lepiej sobie potem poradzi.

tomecki

#159 ·

Owszem, ale zakładając, że ten tacotron ma już 30 godzin materiału to minuta w tę czy we w tę nie robi różnicy. Dlatego pisałem, że w momencie, gdy tych godzin Whisper dostał ponoć ponad pół miliona to trzeba byłoby na prawdę dużo żeby była jakaś znacząca różnica zwłaszcza, że od pewnego momentu ten skok jakościowy jest niewielki i coraz więcej trzeba danych żeby coś się poprawiło. Podobnie jest z RHvoice. Różnica między 60 a 180 zdań jest ogromna. Między 180 zdań, a 600 zdań jest zauważalna, a między 600 a 1800 to już dopinanie ostatnich błędów i kosmetyczne poprawki.

zvonimirek222

#160 ·

Tylko tomecki zauważ jedną rzecz:
RHVoice pomiędzy 600 i 1800 znaków to są istotne kosmetyczne poprawki, bo ewentualne łamanie syntezy, dopieszczanie różnych współgłosek, więc nie byłbym taki pewny.
Student studentowi wszystko