Technik

Alles über Sprachausgaben

Started by karmienmedias 221 posts last post 5 days ago Page 11 of 12

#201

Transcription

Hi, Florian. Ich erzähle jetzt mal, was ich hatte. Zumindest habe ich das auch vom Händler bekommen. Wahrscheinlich kennst du die Firma noch, die gibt es aber nicht mehr. Es war die PEF Bildung, Büro für barrierefreie Bildung in Hertha. Gibt es aber nicht mehr. Auf jeden Fall hatten die mir mal Laptop mit allen ganzen Kramen gegeben, Jaws und so weiter und auch eine CD, wo Cobas Beach 3 drauf war. Ich weiß gar nicht mehr, wo ich die rumliegen habe, aber das ist ziemlich alt. Genau. Und ja, wie du gesagt hast, Sappi-Stimme und so. Also das konnte man wirklich als Sappi-Stimme nutzen und so. Aber irgendwann gab es einen bestimmten Error und ich habe diesen Error nicht verstanden. Da habe ich sie einfach runtergeschissen. Zumindest habe ich das mal als Ziel gemacht. Aber ich denke nicht, dass das jetzt als CD ausgeliefert wird. CD ist ja schon wieder mal hinter Gittern. Oder alt. Genau. Genau. Ja. Genau. Weiß jetzt nicht, wie das ganze Ding ist, aber ich wollte es mal so nennen.

Olcay

#202

Transcription

Hierzu Eloquenz 22 AAZ mit eigenem externen Algorithmus für die höhere Sample-Rate, weil Eloquenz das ja nicht von sich aus kann. Es handelt sich dabei um eine NVDA-Erweiterung. Die ist auf meinem YouTube verfügbar, den Link stelle ich gerne rein, wenn es euch interessiert.

#203 Edited

Gut, der Elten-Encoder hat das ganze leider etwas verhunzt, in echt klingt das nochmal besser.

#204

Transcription

Also Eloquenz mit 22 kHz klingt sehr interessant, obwohl hier konnte man das nicht so gut hören. Also wenn du einen Link reinstellen würdest, damit man sich das Add-on mal holen kann, wäre echt prima. Vielen Dank.

Stefan; pr@sehbeeintraechtigt.de

#206

Transcription

Also ich habe es ein paar Mal mir angehört, auch tatsächlich mit dem Add-on. Und ich muss aber sagen, also mir persönlich gefällt es nicht, weil es sehr künstlich hoch gesampelt klingt. Also so klingt die Eloquenz halt einfach nicht. Also sie konnte nie 22 Kilohertz und das merkt man. Und da werden einfach irgendwelche Algorithmen versucht, um die Höhen ein bisschen anzuziehen. Und das klingt dann aber wie eine schlecht gesampelte Wave-Datei, die man irgendwie ohne Anti-Aliasing-Filter bearbeitet hat. Also ich glaube, davon kriege ich mehr Kopfschmerzen als von der normalen Eloquenz irgendwie. Aber auf jeden Fall ein nettes Experiment, ja.

Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#207

Transcription

Ja, geht mir ähnlich, wäre jetzt die Frage, ob das auch noch auf etwas älteren NVDA-Versionen läuft. Ich betreue ja immer noch eine Blindenschule in Jordanien und da laufen noch etwas ältere Rechner. Da läuft Windows 7 und Windows 10, allerdings im Intranet, insofern passiert da auch nichts. Also wäre die Frage, ist das ein reines 64-Bit-Add-on, das also nur auf einem 64-Bit-NVDA läuft. Also 26.1 ist ja ein 64-Bit-NVDA. Ja, das wäre meine erste Frage und das zweite ist, wenn man das wirklich ändern wollte, dann müsste man die SYN-Datei ändern. Und das dürfte nicht so einfach sein, denn da braucht man sehr wahrscheinlich spezielle Editoren. Also indem man da im Prinzip nur einen Höhenregler hochreißt und das dann irgendwie versucht höher zu samplen. Es bleibt im Letzten bei dem Frequenzgang. Es gibt in manchen Soundprogrammen Algorithmen, die wirklich echte Oberwellen sozusagen dazu bauen. Aber so klingt das nicht.

Stefan; pr@sehbeeintraechtigt.de

#208

Transcription

Ja, ich finde, also ich weiß nicht, vielleicht habe ich das falsch gemacht, aber auch jetzt, sag ich mal, in echt klingt es nochmal, ja, wie schon die Vorredner gesagt haben, es klingt ziemlich unnatürlich und das ist auch, glaube ich, nee, also ich persönlich finde das nicht so angenehm. Ähm, es ist halt auch so, wenn man schnell durch Sachen tappt, dass es dann einfach, also ich bin bei der Geschwindigkeit 95 und wenn ich schnell durch Sachen tappe, dann cracket es und crackt es die ganze Zeit rum, das kommt noch hinzu und ja, prinzipiell, also es klingt schon sehr viel unterschiedlicher als die 11-Kilo-Herz-Variante und ich glaube auch nicht, ehrlich gesagt, also ich will auch nichts irgendwie gegen den Aufwand oder so sagen, weil natürlich ist das irgendwo immer ein Aufwand, aber ich persönlich finde natürlich, dass es, ähm, nicht so angenehm klingt und dass die 11-Kilo-Herz-Variante da auch, sag ich mal, deutlich bassiger und, also ich finde, das klingt irgendwie sehr, ich weiß nicht, es klingt irgendwie sehr, ich weiß nicht, es klingt irgendwie sehr, es klingt ziemlich compressed und sehr in den hohen Bereich und nicht mehr so im unteren, also ich, äh, ja, ich würde sagen, meins ist es auch nicht, aber, ja.

#209

Transcription

ey krass, das ist tatsächlich jetzt, also finde ich schon spannend, dass das jetzt von tatsächlich gar nicht mal so wenigen jetzt hier, also gut, es waren jetzt gerade nur eine Handvoll Leute, aber trotzdem, alle Feedbacks jetzt negativ waren, ich höre hier, muss ich mich ja schon fast fragen, was mit meinen Ohren falsch läuft, aber ich höre da schon eine Verbesserung, ähm, weil, also es ist so, ich habe halt mit Audacity auch viel rumexperimentiert, ähm, ich habe erst mit dem rohen Hochsampling angefangen, das ist aber wirklich nicht zumutbar, das ist wirklich schrecklich, aber ich habe halt, also ich habe halt verschiedenes probiert, auch mit Audacity, wie kann man filtern und so, und das dann mit, von KI in Code übersetzen, lassen, aber ich habe mit ihr halt viel rumdiskutiert und so, bis es für mich gepasst hat, also ein bisschen Aufwand steckt ihr da schon dahinter, wenn auch nicht Programmieraufwand, sondern eher so Diskussionsaufwand, aber es hat Spaß gemacht für mich und ich persönlich höre eine Verbesserung, ich kenne auch eine andere Person, die es genauso geht auf jeden Fall und es gibt wohl auch viele Mastodon-Nutzer, denen es ähnlich geht, äh, aber ja, krass, äh, ich meine, ich wäre ja auch für eine echte Oberwellenrekonstruktion, also eine echte Oberwellengenerierung offen, ist halt die Frage, wie gut das machbar ist, ne, und, äh, ja, die Sinterzeilen editieren, äh, ich, so, ich weiß nicht, ob das überhaupt geht und ich glaube, wenn, dann wäre die eci.dll wahrscheinlich die bessere, äh, die bessere Anlaufstelle, sag ich jetzt mal so, ähm, ja, finde es auch eigentlich echt schade, dass Eloquenz nicht Open Source gemacht wurde und immer noch Geld dafür verlangt wird, also, das als Abo-Modell anzubieten, finde ich ja richtig schräg für Android, ähm, zumal die ja nicht alle Einstellungen hat, die ich, die ich gerne hätte, wie zum Beispiel Betonung, ähm, pff, also, das ist schon komisch, naja, äh, tja, naja, gut, war ja schon wert, es geteilt zu haben, und wer vielleicht doch noch Ideen hat, da, was, ähm, ja, wie gesagt, an so viele Ideen, denke ich, wäre ich sehr offen, das noch zu verbessern, aber wie gesagt, für mich klingt das irgendwie schon besser so, ähm, aber ja, ich kann euch gerne die Original-Version ohne Sample-Raten-Einstellungen noch mal geben, das ist auch ne, also, weil meine Repository stammt ja von ner anderen ab, ähm, dann kann ich euch das noch mal geben, und ja, diese Version funktioniert auch, obwohl sie jetzt 64-Bit, ähm, ähm, halt, ausdr, ausdrücklich unterstützt, also, als, als sich eine Version ausgibt, die nen Weg gefunden hat, 64-Bit-NVDA zu unterstützen, und wird sie trotzdem noch auf 32-Bit-NVDA laufen, also, ähm, ich mein, auf Windows 10 kann man ja die aktuellste NVDA-Version sogar nutzen, aber auf, ähm, Windows 7, äh, geht's ja nur bis 2023, ich weiß nicht, ob's jetzt so weit zurückgeht, aber, 2025.3.3, die letzte 32-Bit-NVDA-Version wurde auf jeden Fall unterstützt, also, ich würd's halt einfach mal probieren. Wie gesagt, grundsätzlich wird das noch unterstützt. Genau, und was dann vielleicht euch mehr interessiert, äh, in dem Fall sind die benutzerdefinierten Wörterbücher, das kann diese Erweiterung nämlich auch, Eloquenz-interne eigene Wörterbücher, da gibt man dann in NVDA-Einstellungen, gibt's diese Kategorie Eloquenz, und da wählt man dann sein Wörterbuch aus, da wählt ihr am besten IBM-TTS-Dictionaries, nicht die alternativen, sondern halt die ohne, also die normalen, und dann, geht ihr da auf mein Update suchen, und dann habt ihr die Wörterbücher. Da hab ich auch ein deutsches Wörterbuch eingeführt, das einige Aussprachen korrigiert, also das könnt euch vielleicht mehr interessieren. Ja, soweit erstmal meine, meine Antwort dazu.

#210

Transcription

nämlich auch noch ein Ding gewesen, mir hat dieser 11 Kilo Herz Sound von Eloquence halt irgendwann gestunken, also das war mir einfach zu dumpf und deswegen bin ich überhaupt drauf gekommen, weil ich finde Eloquence an sich keine schlechte Sache, also die macht manchmal schon so Aussprache Sachen, wo ich mich frage, warum macht die das so, aber oft kann sie ja schon, ist ja schon besser dran als zum Beispiel E-Speak und deswegen also ich finde das eigentlich eine gute Sache, aber dieser 11 Kilo Herz Sound, der hat mir halt das war mir zu dumpf und da bin ich dann drauf gekommen, das zu machen und ich persönlich finde es halt so besser, aber tja muss man mal schauen ob das überhaupt noch zu verbessern geht, wahrscheinlich eher nicht mit den mit den limitierten Möglichkeiten, die wir hier haben, weil Eloquence ja Closed Source ist also das war die erste Idee mit dem Closed Source, also ich denke das war die einzige würde ich auch sagen, aber ich bin jetzt auf dem Rest und ich finde es auch sehr gut, dass das so gut ist, dass die ich kann schon kann ich ja auch schon so viele ja und ich habe für die auch der von E-Speak machen ich war eigentlich ganz ein sehr gut und das war

#211

Transcription

Mann, da gibt es ja wirklich viele Posts zum Skippen und Durchgehen, ich kümmere mich erstmal um den ersten Post, weil, ja, ich habe das schon gelesen, was es da gibt, was mich so ein bisschen abhält ist, ich hatte mir das einmal installiert, dennoch scheint es nicht so, als ob, ich muss kurz das machen hier, sorry, als ob, als ob, na, das Speech Dictionary Dingsbums included ist, sprich dieses Community Dictionary, was die für die englische Eloquenz haben, das schien mir nicht drin zu sein, ich weiß jetzt auch nicht gerade wirklich, wie man das implementieren kann, in dem Add-on, ob das überhaupt möglich ist, weil sonst bin ich erstmal bei IBM Eloquenz und dann reicht mir das, ich bin es halt auch echt gewöhnt mit der 11KZ, oder was das hier ist, 16 wäre schon mal interessant, wenn das vernünftig laufen würde, weil ich glaube 22KZ, ich weiß nicht, ob das eigentlich möglich ist, ich meine, es gab ja die 16er und die haben manche leider ein bisschen kaputt gemacht, sei es mit Code Factory oder sonst welche, Apple, aber zum Beispiel in gewissen Games, wie Mistworld, da gibt es Eloquenz Support in-Game und da haben sie tatsächlich standardmäßig so eine 16KZ Version, würde ich meinen, und die klingt sehr angenehm zu nutzen tatsächlich, also da habe ich dann teilweise NBA angemacht, kam zurück zur 11KZ und dann war das mir irgendwie viel zu, viel zu, raff könnte man sagen deswegen da gefiel mir das dann schon aber ich habe jetzt auch irgendwie von adams gehört das 22 kz dingen dann noch mal so ein bisschen verbessert haben aber vom post jetzt hierher mit deutsch und einfach was man so hört klingt das jetzt nicht schlecht klang fast besser als wo ich das mit nba selbst ausprobiert habe würde ich sagen eigentlich

McOi

#213 Edited

Inwiefern geht es nicht, also wie äußert sich das? Die Sapi Eloquence ist dafür keinesfalls nötig.

#214

Transcription

Bei Infovox Desktop Standard kann man übrigens die Ambrula Datenbanken einfach ersetzen. Das habe ich gemacht und ich finde, diese hier klingt besser, als die, die sie original verwendet haben.

#215

Transcription

Ja, ich weiß jetzt gar nicht, wie du darauf kommst, aber das ist lustig. Ich hatte nämlich gerade mal die Chats durchgelesen, irgendwann vor ein paar Wochen oder so. Da habe ich unseren entdeckt, vor fünf Jahren oder was, wo ich desperately probiert habe, das zu ersetzen und zu installen. Und da ging es irgendwann und ich war so happy und dann mit den Dings rumgespielt. Ich finde, persönlich finde ich die E6 jetzt nicht so hammerend. Ich finde fast den ersten besser. Die hatten doch auch einen Namen. Wie hieß denn der? Frank? Und dann ist der erste Gerhard? Irgendwie so war das doch, ja. Ich finde den originellen besser. Also D6 finde ich jetzt nicht. Ich finde die erste Ambrose hat irgendwas an sich. Ja, bestimmt. Random Note, aber ja, kann man. Ich hätte nicht gedacht, dass das Leute noch nutzen. Schönwässer, wenn man es auf dem Mac haben könnte. Das wäre wirklich cool. Es gab ja irgendwie... Wie damals mal irgendwelche Ambrola-Integrations oder was? Keine Ahnung, wie das damals ablief.

McOi

#216

Transcription

Ja, ich bin halt irgendwie drauf gekommen, hier von, weiß nicht, war ich das, irgendwie kam das mit Infovox auf, auch, dass jemand eine NVDA-Erweiterung für diese ganz alte, formantbasierte Infovox gemacht hat und dann bin ich da wieder drauf gekommen, dass ich die auch gerne nutze, aber ja, gut. Und was die Datenbank betrifft, jedem das Seine. Ich finde es halt irgendwie, gerade mit Infovox, finde ich, passt die E6 schon. Und ja, wenn das am Mac funktionieren würde, das wäre schon geil. Ja, stimmt, da musste ich auch an unseren privaten Nachrichten-Chat denken, wo ich dir gezeigt habe, wie man das zum Laufen bringt. Genau, das war schon crazy. Aber... Ja, ich will jetzt gleich nochmal was zeigen, was ich gemacht habe mit hier E-Speak und Embrola. Das ist noch eine gute Sache. Kommt dann gleich.

#217

Oh, ich muss das nochmal neu machen, habe vergessen, die Soundkarte umzustellen. Bitte misslungene Beiträge löschen.

#218

Transcription

Das hier ist eSpeak mit Embrola, in einem für Embrola viel natürlicheren Klang. In dem Code für die Längenberechnung der Laute ist einiges schief gelaufen, das habe ich mit KI-Assistenz erfolgreich behoben. Testen konnte ich das bisher nur mit binärem Badgen, da mir die Werkzeuge und die Expertise zum Kompilieren des Source-Codes fehlen. Allerdings ist das schon mal ein sehr guter Weg. Die Vokale und Konsumenten sind jetzt richtig ausbalanciert in ihrer Länge. Was das R angeht, so ist das eine Sache, auf die ich sogar schon in Zeiten vor KI gekommen bin und behoben habe. In eSpeak-Version 1.44.x hatten die Entwickler eine gute Idee für den R-Laut, die ich jetzt auch wieder übernommen habe. Dabei haben sie aber bei Embrola einen Fehler gemacht. Auch bei Embrola ist das vokalisierte R wie in 4 Uhr und so weiter und der R als Konsument wie in Raum zwei getrennte Phoneme. Das wurde übersehen. Jetzt, wo das korrigiert ist, klingt es sehr viel besser. In eSpeak-NG ist zumindest das mit den Längen schon mal eingereicht, bei dem R muss ich mal schauen, inwiefern sich das für eSpeak-NG eignet. Ich hoffe, da findet sich ein Weg. Ich habe es jetzt in der originalen eSpeak getestet, aber soweit erstmal der Stand dazu. Älte! Aufbereit! Ich habe es jetzt in der originalen eSpeak getestet, aber soweit erstmal der Stand dazu. Älte! Aufbereit!

#219

Transcription

Das klingt jetzt aber mal überhaupt nicht wie die E-Speak. Das klingt eher als, äh, ja, hätt's der Infobox gehart getan. Geil. Witzig. Ja, nicht schlecht. Ja, ich hatte damals auch so alte Sprachausgaben. Fragt mich jetzt aber nicht, wie die hießen. Also, als der eine, da hab ich mal eine Hörprobe von einem alten Kumpel gehört. Genau, Wotrax hieß die eine. Vielleicht dachte ich das noch was. Die eine vom Kumpel hieß Wotrax und die konnte ein paar Sachen auch nicht richtig gut aussprechen. Das klang auch sehr lustig. Äh, und da hatte ich mal eine, aber da weiß ich echt nicht mehr, wie die hieß. Die konnte die englischen Laute nicht. Das war nicht Eloquenz oder so, das war keine aktuelle, das war aus 2007, 2008. Und dann sollte ich in der... Off-Air-Sendung sollte ich dann, ähm, Boom Boom Pow von Black Eyed Peas spielen. Weil sich das einer aus unserem Dings gewünscht hat und ich hatte dann aber irgendwie... Ja, hatte nicht Black Eyed Peas, sondern Black Eyed Peas. So ganz komisch. Ja, ist überhaupt nicht englisch. Ist schon total lustig, ich schwör's euch. Naja, auf jeden Fall, äh, hatte das nur so grausam ausgesprochen. Dass ich den ersten Song gespielt hatte. Und das war halt nicht Boom Boom Pow oder wie ihr gedacht habt, ey, Boom Boom Pow. Sondern das, das war halt ein geiles Feeling. Und dann hab ich nur so gesagt, ja gut, Leute, das war jetzt zwar so nicht mehr absichtlich, aber dann gibt's halt ein Black Eyed Peas Doppelpack. Ah, meine alten Zeiten, ey. Küsst dich. Das war das Zeit, ne. Ja, wir sind in ganz alten Sprachgärmen, hab ich jetzt, da hab ich dich wirklich aus dem Hut. Also ich bin damals in die Sprachgärme reingestaltet mit Jaws 8. Mit Steffi, Yannick und Elo. Und das war so meine Welt, ja. Und ab da bin ich dann drin, also. Genau. Und bei der Vortrags, also ich hab da, wie gesagt, ne Hörpumpe geholt. Und dann hatte da mein Kumpel in Euler meistens so ein 2.5. Aber die konnte nicht 5 sagen, die hat mir gesagt, Vortrags 2.5 ist bereit. Hehehe.

#220

Transcription

Das erinnert mich so ein bisschen an dieses NVDA-Add-on, was es damals gab, dieses eSpeak with Ambrola oder so. Ich weiß nicht, entweder war es eine eSpeak-Integration oder ich glaube, das war ein Add-on. Da hattest du dann die normalen eSpeak-Stimmen und dann hattest du aber doch diese Ambrola-Stimmen. Die waren so ähnlich wie eSpeak-Voice-Dateien, nur die waren dann auf Ambrola basiert und die klangen dann, die haben genauso gesprochen wie eSpeak, waren dann halt nur Ambrola-Varianten. Das war dann ganz lustig, aber ich mag halt, ich würde es vielleicht sogar nutzen, aber ich mag einfach diese eSpeak-Aussprache da nicht wirklich. Also, das ist hier schon sehr... Sehr komisch... Keine Ahnung, also irgendwie... Ja, weiß nicht. Na, was man halt machen könnte, ich meine, es gibt ja schon eSpeak für Mac und iOS, glaube ich. Ich weiß nicht, ob man da irgendwelche Ambrola-Integrations oder... Ich weiß nicht, ob du da vielleicht noch eine App-Vibe coden kannst, dass man Ambrola auf Mac und Dings... Wäre bestimmt lustig. Also, unmöglich ist es nicht, denke ich mal. Ist jetzt zwar nicht Infovox, weil das ist ja Acapella-Material, denke ich, aber... Äh, lustig wäre es definitiv. Machen wir da irgendwas Swipe-Coders.

McOi