Technik

Piper für NVDA, eine Offline-Neural-TTS

Started by radiorobbe 85 posts last post 2 years ago Page 1 of 5

#1 4 likes

Transcription

Es gibt da für NVDA eine interessante neue Sprachausgabe, die nennt sich Piper oder PIPA, beziehungsweise es ist ein Rapper für diese Sprachausgabe. PIPA ist eine Offline Neural TTS, das heißt die Stimmdaten kann man sich runterladen und auf dem eigenen Rechner speichern, was so in der Form aktuell nicht üblich ist. Üblicherweise wird das ja mit Cloud Verbindungen gemacht, beispielsweise Amazon Poly oder Microsoft Azure TTS oder die Google Cloud TTS und das hat auch seinen guten Grund, denn diese Daten sind natürlich im besten Fall, damit die Stimmen auch gut klingen, sehr sehr sehr umfangreich und der Versuch mit dieser PIPA TTS eine Offline Version zu machen, der geht zumindest, was die deutschen Stimmen angeht. Ziemlich in die Hose. Es gibt die deutschen Stimmen leider nur in einer sehr Low Variante. Prinzipiell hat dieses PIPA Sprachsystem auch die Möglichkeit hochqualitative Stimmen anzubieten mit 22 KHz und entsprechendem Trainingsmodell. Für die deutschen Varianten gibt es Low und eine ist sogar X-Low und die zeige ich euch gleich mal. Als Stimmprobe wurden da die LibriVox Sprecher genutzt teilweise und auch dieser Thorsten Müller, der auf Github seine Stimmproben zur Verfügung stellt. Und einige der LibriVox Sprecher, die wird man vielleicht kennen, wer bei LibriVox mal reingehört hat, unter anderem der Carlson oder auch der Die, Die Eva. Klinge original gar nicht mal übel und man hört auch, dass es sofort, man hört auch sofort, dass es von LibriVox kommt, denn die Mikrofone sind wieder zu erkennen. Also man hört das unterschiedliche Recording Setup von den Stimmproben, was ich jetzt aber persönlich auch gar nicht schlimm finde, wenn diese Stimmen mal funktionieren würden, aber sie tun es nicht. So. So. So. So, wir hören den Carlson und der Carlson ist eigentlich noch mit die beste Stimme von allen, die es als deutsche Stimme gibt. Steffen Schulz, 1 von 38. Notpad plus plus. Notpad plus plus, der hat auch eine seltsame Betonung. Rekord. Schule 4 O. Höhe wie an Elten. Elten. Äh, ich guck mal, ob hier irgendwo mein Editor ist. Ausführung. Editor. So. Ähm. Wir können mal beispielsweise so einfache Sachen machen wie buchstabieren. A, B, C, D, E, F, G, H, I, J, K, L, M, N, O, P, Q, R, S, T, U, V, W, X, Y, Z. So. A, B, C, D, R, K, A, I, J, K, L, M, N. Und so weiter. Der kriegt das sogar noch relativ gut hin. Aber alle anderen. Alle anderen Stimmen haben damit so ihre Problemchen. Ich schalte mal eben um. Variant. Beschwö... Stimme K, Z und D. Stimme K, D, F, A, W. Genau, das soll die Dame namens Eva sein. Und die hat tatsächlich ein bisschen Probleme. Das hören wir schon am Desktop. Sie kriegt das nicht hin, Zahlen richtig auszusprechen. Beispielsweise das C, H fehlt ihr. Das hört man hier ganz deutlich. Desktop. West. Steff. Schulz. Eins von Achtunddreißig. Achtunddreißig, ja. So. Oder, was auch spannend ist, wenn man sich eine Zeile vorlesen lässt, betont sie die jedes Mal anders. Spotify. Zwei und Dreißig von Achtunddreißig. Genau, Spotify haben wir hier. So, und wenn ich mir diese Zeile nochmal vorlesen lasse, kommt eine andere Betonung. Spotify. Spotify. Sie quält sich ordentlich ab. Spotify. Spotify. Und klingt als hätte sie irgendwie ihr Gebiss nicht drin. Spotify. Spotify. Spotify. Spotify. Spotify. Spotify. Spotify. Spotify. Jetzt habe ich sie Spotify buchstabieren lassen. Wir machen das nochmal. Spotify. Klingt ein bisschen obszön irgendwie, ne? Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Ja. Das ganze Alphabet in einer Reihe macht sie natürlich, wie alle Sprachausgaben, nicht besonders aufschlussreich, aber man erkennt was es ist. Abdefki, Knobx, Doziet. Genau, also ABC und so weiter in einem Wort. Aber wenn ich mir dann einzeln die Buchstaben ansagen lasse, dann passiert eigentlich nur Folgendes. ... ... ... Ja, wir haben ja nochmal ein paar andere Varianten. Stimme Karlsson, D. Stimme Kerstin, D. Die Kerstin hat ein etwas schrottiges Mikrofon, aber klingt von der Sache her. Stefan Scholz, 1 von 38. Dieser Pizze, 2 von 38. Weser, 3 von 38. Steffen Scholz, 1 von 38. Er hat eine sehr nüchterne Stimme, wenig Emotionen drin. Könnte man sogar mitarbeiten, wenn es so gut klingen würde. Stimme Pavuk, D. Irgendwas mit Pavuk, irgendwas. Ja, kann ich jetzt gerade nicht lesen. Dieser Pizze, Steffen Scholz, 1 von 38. Dieser Pizze, 2 von 38. Also auch die klingt bedeutend besser als die Eva. Stimme Ramona, D. Die klingt ein bisschen heiser und kaputt. Steffen Scholz, 1 von 38. Dieser Pizze, 2 von 38. Netzwerk, 3 von 38. Den Thorsten Müller, oder wie er heißt, den habe ich jetzt gerade nicht installiert. Die Erweiterung für NVDA bekommt man auf... GitHub. Ich kann es gleich nochmal als Text reinlinken. Finde ich eine sehr interessante Idee, aber für den Arbeitseinsatz, sowohl zum generellen Arbeiten als auch zum Vorlesen, sind diese Stimmen aktuell nicht zu gebrauchen. ...editor, euer Delden, record, record, verfolgen, der Luft fehlt, unbekannt. Genau. Also, absoluter... ...Mistpunkt getan, aber trotzdem rein forschungstechnisch betrachtet ein sehr interessantes Projekt. Ich bin gespannt, was sich daraus noch entwickelt.

Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#3 3 likes

Ui, diesen Beitrag von dir anzuhören hat echt Mordsspaß gemacht. Mal schauen, wann ich mir die mal selbst runterlade.

#4

Die englischen Stimmen klingen übrigens um ein Vielfaches besser, ich sende gleich mal ein Beispiel (nicht von mir erstellt). Vermutlich müsste da einfach ein Native-Speaker mal Hand an die korrekte Umsetzung der deutschen Stimmen legen.
Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#5

Transcription

Select Synthesizer Dialog. Synthesizer. Combo Box Windows 1 Core Voices Collapsed Alt Plus S. Piper Neural Voices. Bookworm Bookshelf. Local Bookshelf. Tree View. Currently Reading 2. 1 of 1. Level 0. Currently Reading. Ness. The Best Short Stories 2021. 1 of 2. The Pragmatic Programmer. Your Journey to Mastery. 2 of 2. Tree View. Want to Read 3. 1. Want to Read. Ness. Culture and Empire. Digital Revolution. 1 of 3. Opening Document. Culture and Empire. Digital Revolution by Hinchins. Piper-Bookworm. Table of Contents. Document Content. Edit. Read on. The First. A Brief History of the Internet. Heading Level 2. I will summarize the history of the internet thus. A generation that. Grew up with computers in college and university went out into. The real world and colonized it with their freaky and ultimately. Accurate vision of what was possible with ever more cheaper. Volume 8. Rates have. Variant low. Voice less at N-US. Voice Danny N-US. And faster communications. It took only 4 decades to go from. 3 terminals on a local network to almost 7 billion mobile. Phones, of which 2 billion are smartphones, on a global. Network. In the 1960, mainframes ruled, these were huge extensive. Machines run like private empires, people were experimenting. With simple networks. In 1962, I was born, and someone also. Voice. N-US. Invented network packets, these are like envelopes of. Information that could be sent around different routes to get to. Their destination, the military began developing packet-switched. Networks that could survive a lot of damage, around 1965. People invented mainframe electronic mail, in 1969, the first RFC. Was written, and in 1971, the at sign was born.

Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#6

Man von dieser art Seiten wie githhub kriegt man ja Kopfschmertzen, eher man den Link mal findet...
McOi

#7

Hahahahahah, danke für die Beispiele, ich liebe es!

#8 Edited

Ich meine, die TTS ist, naja, , aber damit zu experimentieren muss sooo dumm aber irgendwie geil sein!

#9

Transcription

Gut, das ist jetzt der Source, was genau muss ich da jetzt zippen, dass das zu einem NVDA-Add-on wird bzw. könntest du einfach mal das Add-on irgendwie, also du hast das ja wahrscheinlich zu einem Add-on gemacht, weil sonst geht es ja nicht, könntest du das irgendwie mal anhängen oder keine Ahnung, ich weiß jetzt nicht, wie ich das am schlauesten noch machen soll.

#10

Ihr müsst nach dem Link Releases suchen und öffnen, da findet man fertige NVDA-Dateien. Hier ist die bis dato neueste Version:

https://github.com/mush42/piper-nvda/releases/download/v1.0-alpha2/piper_neural_voices-1.0-alpha.nvda-addon

Dann braucht ihr von hier noch die Stimmen, die werden nicht vom Addon mitgeliefert. Einfach eine der Tar.gz-Dateien laden und unter NVDA-Einstellungen im Abschnitt Piper den Installieren-Button nutzen um sie zu öffnen.

https://rhasspy.github.io/piper-samples/#de
Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#11

Vielen Dank!

#12

Transcription

Hallo zusammen. Ja, also ich muss sagen, ich finde die Idee auch super und gerade Beitrag 1, der klingt sehr, sehr amüsant. Doch, ich habe durchaus gelacht. Vor allem beim Buchstabieren namens, nein, der, der Eva. So ist es richtig. Ja, ich bin mal gespannt, was daraus wird. Da kann mit Sicherheit noch einiges draus werden. Und wenn das dann noch höher qualitativ, also qualitativ hochwertiger wird, dann ist das bestimmt eine brauchbare Geschichte, die man dann durchaus auch zum Arbeiten benutzen kann. Doch, das klingt auf jeden Fall recht spannend.

#13

Transcription

Ja, wunderschönen guten Abend. Also, ganz lustig ist es auf jeden Fall. Was GitHub angeht, mit GitHub muss man sich halt abfinden, wenn man manche Projekte, gerade Open Source Projekte, muss man sich halt abfinden. So einfach ist das. Ja, aber was die TTS angeht, ist eigentlich ganz gut. Also, ich finde es ganz lustig tatsächlich. Ich habe davon auch schon gehört, aber selbst getestet habe ich das bis jetzt noch nicht. Und ja, dass die deutschen Stimmen noch nicht so gut funktionieren, dauert. Aber das wird bestimmt auch noch.

#16

Eher man da mal den brauchbahren Link hat, neh ich hasse es.
McOi

#17 1 like

Das ist eigentlich relativ simpel, wenn man mal raus hat, was man wo findet. Gut, nutze github auch sehr regelmäßig.
Religion ist Opium fürs Volk!

#18

Transcription

Ja, ich habe mir das Ganze auch mal ausprobiert. Das ist eigentlich... Ich meine, ich würde es jetzt nicht als Sprachausgabe normal persönlich verwenden, aber ich finde es eigentlich cool. Also, ja. Ich würde es jetzt, wie gesagt, persönlich nicht als Sprachausgabe verwenden, weil es dafür irgendwie nicht so passend ist. Irgendwie, es klingt dann doch nicht so gut. Und ja, aber es ist trotzdem lustig für Testdinger zu machen und so. Das finde ich schon lustig.

#19

Ohne die Zischlaute ist das nicht zu gebrauchen. Ich hoffe, da kommen noch verbesserte Varianten nach. Technisch ist es allerdings beachtlich.

#20

Transcription

Ja, also ich bin da sehr optimistisch, Steffen, was das angeht, zumal die deutschen Stimmen noch kein weiches CH können, das ist mir beim Thorsten aufgefallen, ich hoffe das ändert sich bei den High Varianten Low, haben wir ja jetzt, Low und X Low, und ja, ich hoffe da wird noch einiges besser und ausgereifter. Was diese Stimmen aber auf jeden Fall auch reizvoll macht, ist, dass man die mit sich rumtragen kann. Die OneCore Stimmen, die Microsoft ausrollt, sind zwar auch gut, aber die müssen ja auf jedem System installiert sein, auf dem man NVDA dann einsetzen will. Aber die Piper Stimmen, die könnte man im Zweifel auch auf dem USB-Stick mit sich rumtragen. Und wenn man nicht gerade eSpeak verwenden will, dann sind die Piper Stimmen vielleicht schon jetzt, aber wenn sie dann irgendwann auch nochmal ein weiches CH kriegen sollten, auf jeden Fall eine Alternative zur eSpeak. Schon alleine vom Spektrum her.