Po pierwsze puki co wymaga instalacji9 Pythona i w ogóle grzebania się w konsoli. Po drugie niby nie wymaga, ale dobrze jest mieć solidną grafikę. Solidną znaczy w przypadku, gdy chcemy mieć najlepsze wyniki ponoć co najmniej 12gb Vram. Z tego, co widziałem w demówkach to po angielsku umie rozpoznać tekst piosenki, a to już dużo, bo Google się na tym konkretnie wywala. Umie to to duużo języków, w tym polski, a wisienką na torcie niech będzie fakt, że próbuje wstawiać interpunkcję, prostować pomyłki i nie przejmować się eee... yyy... Na RTX 3090 działało to to mniej więcej półtora raza szybciej niż czas rzeczywisty czyli godzinę zrobi w niecałe 50 minut. Na potworze, jakim jest a5000 to już ponad trzy razy szybciej czyli godzinkę audio ogarnie w niecałe 20 minut. To są staty dla najmocniejszego modelu, a takowych jest chyba pięć. Ciekawe czy w Eltenie nie dałoby się czegoś takiego zaimplementować. Wiem, przeszkodą brak porządnego GPU więc albo ściepa narodowa, która, znając życie średnio wyjdzie albo jakiś projekt np. na pomoc głuchym lub głuchoniewidomym w życiu coby se mogli podcasty poczytać.
Gdyby to była zrzuta, to najpewniej by trzeba było zrobić to typowo po usługowemu, czyli np. miesięczna subskrypcja ceną zależna od liczby ludzi, którzy by się na to składali. No ale cóż, to by trzeba było od razu wiedzieć, ile ludzi jest potencjalnie zainteresowanych, tylko żeby się nie okazało że będzie jak ze zlotem.
Oddzielna zbiórka to raczej nie wchodzi w grę, ja sobie mam sponsora i na pewno nie chce mi się dopłacać, asponsorów jest ponad 50. Moim zdaniem miało by to tylko sens jeśłi by dodać do sponsora, albo do tego pakietu za 160 zł. Też pod warunkiem, że zdeklarowało by się ileś ludzi bez sponsora, że go wtedy kupi. Innymi słowy szansa mała, ale pomysł na jakiś projekt może by miał sens, z tym, że niewidomi i głusi na apce bez obrazu trochę się wykluczają.
Ale to nie musi być wyłącznie w Eltenie. Dla głuchych może być jakaś oddzielna usługa. Do tego może coś do automatycznego tworzenia napisów, bo to też potrafi wskazać dokładny czas więc dałoby się nie tylko takie napisy tworzyć, ale np. wyszukać konkretne sformułowanie w pliku i od tego miejsca słuchać.
No i głuchoniewidomi by mieli jakikolwiek sposób na odbiór audio, jeśli oczywiście znają brajla. Inna sprawa, że chyba prościej by było sobie wynająć maszynę wirtualną na chwilę.
Serwer Eltena nie ma żadnego GPU, bo nigdy nie było potrzeby. Na modelu large dwie pierwsze minuty Tyfloprzeglądu rozpoznawały się ponad godzinę, więc w tym przypadku to nie ma sensu.
Patrzyłem na koszty i możliwości. Generalnie projekt jest bardzo fajny, ale z racji ogromnych wymagań, jego możliwości są bardzo ograniczone. Żeby go wdrożyć do Eltena np. do natychmiastowej transkrypcji wiadomości audio, musielibyśmy zapłacić za serwer nawet 5 razy tyle, co obecnie. :(
Podrzucam jako przykład transkrypcję ostatniego Tyfloprzeglądu, wykonaną na jednym z najniższych profili dokładności, czyli base. Później podrzucę dla porównania na wyższym. :)
4 godziny, ale ja to robiłem na MacBooku bez GPU, bo nie mam przy sobie XPS-a. Dzisiaj wracam do Bolszewa i przerzucę na Dellu, który ma dość dobrą grafikę, więc efekt będzie prawdopodobnie nieporównywalny.
Jaką? pytam, bo mi się to też może przydać, bo sam mam 3070ti w Asusie i chętnie też dołączę do testów. Muszę tylko przegryźć się przez użycie Cuda w WSL2 chyba, że można to na Win.
You've set a course to go On a one in a million flight Taken by the one Who brings the morning light It was time for you to leave There's nothing we can do Except feel a sense of courage And play this song for you Here's a message to you Let us all sing out your names Sing them very loud We're all so proud Here's a message to you Life's all with us every day The next step won't be long We must go on We've answered all our prayers You're bound to hear us now Heroes for your country You tried to teach us how But the sun will always shine And souls will always live All our breathing hearts Is what we have to give Here's a message to you We're calling out your name Here's a message to you The whole world feels the same Here's a message loud enough There is no one to blame Here's a message to you Let us all sing out your names Sing them very loud We're all so proud Here's a message to you Life's all with us every day The next trip won't be long We must go on Here's a message to you We've saved a course to go On a one in a million flight Taken by the one Who brings the morning light It was time for you to leave There's nothing we can do Except feel a sense of courage And play this song with you Here's a message to you Let us all sing out your names Sing them very loud We're all so proud Here's a message to you Life's all with us every day The next trip won't be long We must go on Here's a message to you Let us all sing out your names Sing them very loud We're all so proud Here's a message to you Life's all with us every day The next trip won't be long We must go on We will go on
Zainstalowałem to sobie i mam kilka problemów. Tak w ogóle to to działa, ale co zrobić żeby używało to GPU, bo domyślnie na CPU jedzie? mówię o exeku dostarczanym w paczce. Druga rzecz to czas na początku każdej linijki. Jest możliwość wywalenia tego? do testów to niepotrzebne, a trochę denerwuje.