Technik

Alles über Sprachausgaben

Założony przez karmienmedias 242 wpisy ostatni wpis 28 dni temu Strona 12 z 13

#221

Genau das mit dem r, was du gerade nachgemacht hast, habe ich hier ja eigentlich korrigiert, denn das hat mich ja gestört, genau wie diese viel zu kurzen Längen bei Vokalen.

#222

Transkrypcja

Ja, hallo Leute, zu den Embolastimmen, das ist schwierig gewesen. Also ich sage mal so, ich habe es nicht hingekriegt und ich glaube auch nicht, dass es jemals funktionieren wird, NVIDIA, also diese Embolastimmen in NVIDIA zu integrieren, in die eSpeak NG, die NVIDIA ist. Also dass das jetzt mit eSpeak NG geht, prinzipiell, das ist das eine. Und selbst wenn das funktionieren sollte irgendwann mal, stellt sich als zweites Problem immer noch der Lizenzvertrag. Denn das Ding ist, sobald man eSpeak M-Roller aktiviert, erscheint ein Lizenzvertrag, den man mit I Agree abnicken muss und erst wenn man das gemacht hat, funktionieren die Stimmen. Das heißt, es ist eine blöde Idee, diese Stimmen in NVIDIA zu integrieren. Ich glaube, das geht auch gar nicht, da wird NVIDIA abstürzen. Warum? Weil sich die Katze in den Schwanz beißt. Um den Lizenzvertrag anzuzeigen, will NVIDIA das nicht. Warum? Weil sich die Katze in den Schwanz beißt. Um den Lizenzvertrag anzuzeigen, will NVIDIA das nicht. Und um den Lizenzvertrag anzuzeigen, will NVIDIA die M-Roller Stimmen anschmeissen. Aber bevor die M-Roller Stimmen überhaupt funktionieren können, erscheint der Lizenzvertrag. Wie kommt man da raus, oder kann diesen Henna-Ei Effekt umgehen? Indem man die M-Roller eSpeak Stimmen nicht integriert. Indem man die M-Roller eSpeak Stimmen nicht integriert. Indem man die M-Roller eSpeak Stimmen nicht integriert. E-Speak-Stimmen nicht in NVDA fest integriert, sondern in SAPI. Diese SAPI-Stimmen kann man dann nämlich mit jedem anderen Programm bedienen, zum Beispiel mit Baller-Volka. Da kann man dann NVDA mit irgendeiner anderen Stimme erst mal betreiben oder von mir aus mit keiner Sprachausgabe. Dann Baller-Volka starten, die Ambrola-E-Speak-Stimmen kurz anpingen, mit einem Testtext oder so. Dann erscheint der Lizenzvertrag, den nickt man ab und dann funktionieren die Stimmen auch mit NVDA. Dann kann man nämlich auf SAPI gehen und auf die E-Speak-Ambrola-Stimmen schalten und dann wird es funktionieren. Aber der Lizenzvertrag will einmal pro Sitzung abgenickt werden. Da kommt man nicht hin. Jedenfalls wüsste ich nicht, wie.

#223

Euch ist doch wohl aufgefallen, dass die Software, die den Audiobeitrag in Text umsetzt, unseren allseits geliebten Screenreader "NVDA" nicht kennt. Statt NVDA steht dort ja immer NVidia, was ja etwas ganz Anderes ist. Könnte man dieser Software so etwas beibringen?
Stefan; pr@sehbeeintraechtigt.de

#224

Nein, dass der Lizenzvertrag in Dauerschleife kommt, bis man "I agree" gedrückt hat, ist zumindest aus meiner Erfahrung nicht der Fall. Das kommt einmal und bringt Nvda zum Absturz, aber auch, wenn man ihn nicht bestätigt hat, funktioniert es dann trotzdem beim zweiten Anlauf. Meine Erfahrung. Ich weiß ehrlich gesagt auch gar nicht mehr, ob ESpeak-NG überhaupt immer noch auf Mbrola Tools angewiesen ist. Aber kann schon sein.

#225

Transkrypcja

Ja, dann muss ich mir das mal angucken. Also soweit wie ich weiß, war es so, dass man einfach die Stimmen bei NVEA, Speech Drivers, eSpeak-NG, Data oder eSpeak-Data im Roller reinkopiert hat. Also zumindest war das bei dieser SAPI-Version von eSpeak so, dass man bei Programme eSpeak, eSpeak-Data im Roller die Stimmen da reinkopiert. So, und das reichte ihm. Was man noch machen musste bei dieser SAPI-Version von eSpeak war, ausdrücklich diese mb-blablabla-Stimmen zu registrieren. Also mb-de1, mb-de2 und und und und und. Und wenn die Stimmen dann da waren, dann hat eSpeak die auch gefunden. Ob der jetzt im Hintergrund auch noch im Roller Tools benutzt hat, weiß ich auch nicht. Und wie man das dann in den... ...in NVEA integrieren soll, keine Ahnung. Muss ich mal ausprobieren. Sowohl jetzt mit der 2026.1 als auch dann mit der kommenden 2026.2. Da bin ich auch mal gespannt.

#226

Transkrypcja

Was ich auch mal interessant finden würde, wann, ob und wann NVDA mal so ein Phoneme-basiertes Wörterbuch bekommt. Es ist ja so, dass sehr viele Sprachausgaben eine Syntax haben, mit der man direkt Phoneme als Aussprachekorrektur übergeben kann. Sei es ein XML oder sei es irgendwie so eine Syntax in einfachen oder doppeltnäckigen Klammern und dann die Phoneme in irgendeinem Phoneme-Alphabet oder sowas. Da gibt es ja mehrere, wie hieß denn das, Sampa oder so? Ich weiß es nicht mehr. Jedenfalls gibt es da verschiedene... ...Syntax-Konventionen für Phoneme und jede Sprachausgabe hat irgendeine. Und es gibt aber blöderweise noch keine Syntax, wo man dann sagen könnte, so, das was ich jetzt da in diese Klammern reinschreibe oder in diese Tags, in dieses Tag, ist jetzt ein Phoneme. Dass das dann sozusagen wirklich ungefiltert und uninterpretiert an die Sprachausgabe weitergereicht wird. Und damit könnte man Wörter ganz einfach korrigieren. Also es ist einfach, es ist eleganter, weil man einfach den Phonem-Fundus benutzen kann, direkt benutzen kann, den die Sprachausgabe hat. Man muss da nicht irgendwelche, irgendwelche orthografischen Verrenkungen machen, über die dann andere Sprachausgaben wiederum stolpern. Ich meine, wozu haben wir denn die Stimmenwörter-Bücher? Genau für sowas, dass man eben für jede Stimme auch, also nicht nur eigene Korrekturen einpflegen kann, sondern die Korrekturen auch so einpflegen kann, dass die Stimmen das... Richtig elegant aussprechen. Und das ist im Optimalfall so, das ist im Optimalfall eine Möglichkeit, auf die Phoneme dieser Sprachausgabe direkt zuzugreifen und die dann auch direkt zu verwenden. So, und dazu brauchen wir aber eine Vereinbarung im NVDA, die sagt, alles was zwischen Tag bla bla bla und bla bla bla oder zwischen Klammer bla bla bla und Klammer bla bla bla steht, ist ein Phoneme. Und wenn die Sprachausgabe das kann, dann kriegt sie das zu fressen und dann spricht sie das. Und da ist das, da muss man dann eben wissen, Sprachausgabe sowieso beherrscht XML, also schreibe ich bla bla bla Klammer auf, XML-Tag bla bla bla Klammer zu und dann interpretiert sie das als Phoneme. Also bei SAPI ist das zum Beispiel oder bei OneCore. So, und wenn ich jetzt so eine Sprachausgabe habe wie eSpeak oder so, die beherrscht... Ja, irgendeine, ich glaube, die beherrscht irgendeine Phonem-Syntax mit Klammern, mit eckigen Klammern oder geschweiften Klammern oder irgendwie sowas. Dann kann ich sagen, bla bla bla Klammer auf, eckige Klammer auf, Phoneme, eckige Klammer zu, bla bla bla Klammer zu, also Tag Klammer oder irgendwas. Und dann spricht die das, wie die das kann. Und welche Sprachausgabe jetzt was? Beherrscht. Das muss man dann wissen. Und diese Möglichkeit fehlt aber noch. Anhänge. Aufnahme abbrechen. Senden.

#227

Ja, für die Sapi5-Version ist das alles korrekt. Die Datenbanken werden natürlich auch bei ESpeak-ng weiterhin benötigt. Ich frage mich nur, ob MBrola-Tools auf der jeweiligen Plattform vorhanden sein muss. Bei der originalen eSpeak auf jeden Fall. Es gab mal eine Erweiterung, die hat einen NVDA-Treiber genutzt, der auch über Mbrola Tools gearbeitet hat, also als NVDA noch die originale ESpeak benutzt hat. Jetzt hat sich da in ESpeak-ng ja einiges geändert.

#228

Für uns als VoiceOver gab’s ja immer nur die Standard oder Halt die e-speek Aber jetzt gibt es da auf Beta also wer Beta testen will. Wer nicht ist da erst mal raus noch neue Stimmen. Ich finde die eigentlich ganz spannend. Müsst ihr mal gucken ob ihr die cool findet. Ich nutz die ganz gerne. Mir ist im Moment nicht weiter bekannt, auf welchen Systemen diese Stimmen noch verfügbar sind. Bis auf iPhone. Aber schaut selber. Ihr müsst die Stimmen einfach downloaden, die ihr braucht und könnt die dann ganz einfach per VoiceOver hinzufügen. hier der Link. https://testflight.apple.com/join/bJQ5UpWQ

#229

Transkrypcja

Es gibt etwas, was sehr lustig ist, wenn man mit dem Linux-Client von Elton rumspielt. Man könnte jetzt sagen auch Spielkind, aber das ist echt witzig, was man da erzeugen kann. Der ruft nämlich immer nach einem Monat, wenn man in einer bestimmten Art und Weise die Taste drückt. ... Ja gut, das 17 nicht, aber das ... ... Also, die ... den Monat Mai ruft er immer wieder. Mai, Mai, Mai, Mai, Mai, Mai, Mai, Mai. Dabei haben wir doch fast September. ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ... ...

Werwoelfchens Blog: https://werwoelfchenstestecke.blogspot.com TG-Kanal: https://t.me/werwoelfchensblog Mail: wolfruht@mail.deTelegram: telegram.me/werwoelfchen85

#230

Ok, wirklich etwas random, aber woher kommt das? Was drückst du da, um das auszulösen? Und es klingt so, als würdest du da eine Äußerung unterbrechen, die noch weiter ghet.

#231

Transkrypcja

Richtig, gut erkannt. Das ist eigentlich die Äußerung, genau, und ich drücke immer wieder die Taste Cursor nach oben. Genau, und, äh, ähm, richtig, das ist das, was ganz oben ist im Menü und was man immer mit dem Cursor nach oben neu auslösen kann, ist zwar eine, naja, sagen wir mal, dumme Spielerei, aber irgendwie macht sie Spaß. Manchmal macht das schon Spaß. Ich hab's eigentlich so oft eigentlich nie gemacht, mir ist es nur heute aufgefallen. Weil ich jetzt gerade noch warten muss, bis der Filri, den ich gucken will, beginnt auf Nitro und, äh, ja.

Werwoelfchens Blog: https://werwoelfchenstestecke.blogspot.com TG-Kanal: https://t.me/werwoelfchensblog Mail: wolfruht@mail.deTelegram: telegram.me/werwoelfchen85

#232 Edytowano

Ok, verstehe jetzt. Ja, sowas kann Spaß machen. Bei mir wird das nicht gehen, weil bei mir "Was gibt's neues" in den Schnellaktionen oben ist.

#233

Transkrypcja

Ja, es ist mal ganz witzig, ich meine klar, irgendwann hat diese Witzigkeit auch mal ein Ende, das stimmt schon, aber ja, die Benachrichtigungen, das ist im Linux-Client ganz interessant, die kommen nämlich nur zum Vorschein, wenn wirklich Benachrichtigungen da sind, ansonsten gibt es die nämlich nicht und dadurch habe ich immer meine Kontakte ganz oben stehen. Wahrscheinlich könnte ich das mit dem untersten Eintrag auch machen, aber der ist, glaube ich, nicht so spektakulär, weil Premium-Pakete, da kann man nicht wirklich viel machen draus.

Werwoelfchens Blog: https://werwoelfchenstestecke.blogspot.com TG-Kanal: https://t.me/werwoelfchensblog Mail: wolfruht@mail.deTelegram: telegram.me/werwoelfchen85

#234

Ja, die Schnellaktion ist standardmäßig verborgen. Ich habe sie bei mir wieder eingeblendet.

#235

hi, kann ich eigendlich auch die Stimmen von samsung auf meinem Enbernig rg 405m installieren?

#236

Transkrypcja

Also ich denke nicht, weil die Samsung Stimmen gehören ja dem Samsung Galaxy Store und dann müsstest du den Galaxy Store schon da installieren drauf und dann könntest du, weil die Samsung Stimmen gehören wirklich nur Samsung, das ist nicht mit dem Play Store zu vergleichen. Das ist nicht mit dem Play Store zu vergleichen.

Werwoelfchens Blog: https://werwoelfchenstestecke.blogspot.com TG-Kanal: https://t.me/werwoelfchensblog Mail: wolfruht@mail.deTelegram: telegram.me/werwoelfchen85

#238

Transkrypcja

War das nicht so, dass diese, ich nenne sie jetzt mal Ultra HD Stimmen, also diese neuen, die jetzt über den HD Stimmen noch liegen sollen von der Qualität her, dass die irgendwie Probleme damit hatten, englische Wörter richtig auszusprechen? Da war doch was. Ich kann mich erinnern, dass es damals mit der Anna so ein Problem gab, dass die irgendwie ein Problem hatte Dropbox richtig auszusprechen und sowas. Na gut, das kann jetzt hier im Elton Client egal sein, aber vielleicht gibt es ja im Elton Client in der UI auch nochmal ein paar Wörter, die von diesen Ultra HD Stimmen falsch ausgesprochen werden. Was? Ich weiß nicht, ob die da drauf reagieren würden, wenn man sagt, naja, wir haben da so ein paar Probleme mit so einer nischigen Elton Software, die es nicht mal in eurem Store gibt. Wäre geil, wenn ihr euch da drum kümmern könntet. Ich glaube nicht, dass die... Aber naja, wenn das Problem tatsächlich auch Mainstream-Apps betrifft oder auch iOS-Komponenten sogar, dann glaube ich eher, dass sich Apple darum kümmert.

#239

Transkrypcja

Nochmal kurz zurück zu Samsung TTS. Das würde mich auch interessieren, ob ich das auf meinem Pixel 10 installieren könnte. Ich meine, theoretisch müsste das ja ein normales Android-Synthesizer sein. Die Frage ist nur, wie wir da an den Galaxy Store kommen und ob da noch irgendwelche Systemkomponenten von One UI drinnen hängen. Weil meine Stimmen an sich wären ja ganz cool. Also, wenn dir jemand was weiß, dann ja.

Check out my projects: https://jokyboy129.github.io/

#240

Transkrypcja

Ja, bei den Samsung-Stimmen, da kenne ich jetzt die aktuelle Situation nicht. Ich hatte ganz früher mal einen Samsung Galaxy S3 und da waren die S-Box-Stimmen drin. Da waren die S-Box-Stimmen drin in dem Samsung Galaxy S3. Die hatten aber ganz komische Namen. Also die hießen dann nicht S-Box, sondern Samsung TTS und dann gab es noch andere, die klangen so ähnlich, waren aber schneller und vom Spektrum her ein bisschen enger. Die hießen dann glaube ich irgendwie Samsung TTS. Kompakt oder sowas. Und ja, also dass die S-Box-Stimmen da drin sind, fand ich schon cool irgendwie. Und ich weiß auch nicht, ob die jetzt aktuell auf Pixel-Geräten laufen würden. Selbst wenn man sich die APKs irgendwie abfischen könnte und die runterladen könnte, keine Ahnung, ob die laufen würden. Ich könnte es mir vorstellen, wenn die APIs zu den Stimmen doch irgendwie vereinheitlicht sind. Ich meine, Talkback muss ja auch in der Lage sein, eben sowas wie Vocalizer oder A Cappella oder so zu finden. Also die Art, wie man Stimmen für Talkback so exponiert. Wie man Talkback sie findet, muss irgendwie offen liegen. Und da kann ich mir vorstellen, dass sich Samsung da drauf gehängt hat. Also kann man sich schon vorstellen, dass die laufen. Also ich weiß es nicht. Keine Ahnung. Die aktuelle Situation kenne ich nicht. Die aktuellen Stimmen von Samsung kenne ich jetzt auch nicht. Naja. Aber es wäre schon interessant. Aber es ist durchaus auch möglich, dass sie nicht funktionieren, weil Samsung dann doch sein eigenes Süppchen kocht. Das habe ich zwar nicht bei Sprachausgaben erlebt, sondern bei einem anderen Teil von Samsung-Apps. Ich kann ja mal einen kleinen Exkurs machen. Ja. Wir gleichzeitig mal abgesetzt werden. Und wir werden ja mal, die Zeit ist wieder jeden Tag weit weg. Also sprechen wir mal nach. Das ist eigentlich aber ziemlich... Ich weiß jetzt nicht, ob das ein wenig zu spannend ist. Ich sag ja, du hast ja auch keine mythslos. Sonst wäre ich unbedingt über die Texte-Konferenz kommen lassen. Und das ist irgendwie auch nicht so einfach. Ich weiß nicht. Ich habe ja auch gerade schon ein paar Sachen vorgeschlagen. Oder ich mache ein paar Sachen. Ich habe eine kurze Frage. Ja. Wir haben schon ein paar Fragen. Du hast ja schon so ein paar Fragen. Und ich habe ja nur ein paar Fragen an. Es ist einfach wirklich einfach. Aber das ist wirklich einfach. Es ist einfach so. Ich weiß nicht. Ich weiß nicht. Es ist einfach nicht so einfach.