Technik

Piper für NVDA, eine Offline-Neural-TTS

Started by radiorobbe 85 posts last post 2 years ago Page 4 of 5

#61

Wir haben eine neue Piper-Stimme auf Deutsch: Sie Heißt LMS und ist zum Kotzen (noch mehr wie die alten).
Check out my projects: https://jokyboy129.github.io/

#62 2 likes

#64

Transcription

Es war doch gedacht, gewollt und so weiter, dass man doch RVC-Modelle trainieren kann oder anders gesagt unkonvertieren kann, Hilfe, jetzt habe ich es, unkonvertieren kann, dass die eigenen RVC-Modelle, also wenn ich jetzt eine Stimme trainiert habe, jetzt mal im privaten Sinne, wenn ich genügend GPU und dann Hintern habe und würde jetzt als Privatnutzer, weil ich ein Hörbuch habe, Rufus Beck jetzt hier, Harry Potter, ich glaube, der zweite oder dritte Band hat jetzt keine Musik. Jetzt mal als Beispiel, nehme ich jetzt den, ich würde das mit Basis dieses Materials trainieren, hätte jetzt eine Rufus Beck Stimme und hätte jetzt ein RVC-Modell und ich meine, es ist ein RVC-Modell, es ist ein RVC-Modell, es ist ein RVC-Modell, es ist ein RVC-Modell, es ist ein RVC-Modell, es ist ein RVC-Modell, es ist ein RVC-Modell, es ist ein RVC-Modell. Es ist möglich, es zu konvertieren, sodass man das in Pipa, Piper nutzen könnte, weiß ja jemand mehr, ich habe davon halt gehört und...

Es hat sich ausgeseidelt.

#65

Piper wurde mittlerweile umbenannt in Sonata, da man in Zukunft auch weitere Sprachausgaben unterstützen möchte. Version 3.0 ist als erste Beta verfügbar und läuft offiziell mit NVDA 2024.1. Neu ist die Unterstützung für die Fast-Voices von Piper, das sind die gleichen Stimmen, nur mit angeblich verbesserter Geschwindigkeit.

https://github.com/mush42/sonata-nvda/releases/download/v3.0-beta.1/sonata_neural_voices-3.0-beta.nvda-addon
Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#66

Transcription

Ihr habt das gerade mal geguckt. Ziemlich interessant. Ich wollte ja nicht gar nicht auf 2024 updaten, musste ich dann aber doch. Ja, hat was. Ich bin der Meinung, besonders was Englisch angeht, manche Stimmen sind doch hier von der RH Voice oder von diesem Festival. Es gab das doch mal damals, dieses, oder RH Voice gibt es ja immer noch, und diesen Festival Speech Synthesizer, das gab es damals, diese Addons, die seit Python 3 aber auch alle nicht mehr kompatibel waren. Außer RH Voice, das hat es dann irgendwie nur durchgeschafft. Und das Arktik heißt das, glaube ich, wenn ihr bei Amerikanisch und Englisch mal geht. Da seht ihr nämlich ein paar Formate. Von diesen Varianten. Das ist ganz interessant, wie die das jetzt irgendwie inkludiert haben. Das ein bisschen umgebaut haben, oder was auch immer das ist.

McOi

#67

Transcription

Also, zum einen, wenn ich irgendeine Fast-Variante, zum Beispiel von der Ramona, nehmen würde wollen, ich kriege nichts runtergeladen und zweitens klingen die Stimmen immer noch so schäbig wie vorher. Also, ich merke da keine Änderungen in den Previews.

Werwoelfchens Blog: https://werwoelfchenstestecke.blogspot.com TG-Kanal: https://t.me/werwoelfchensblog Mail: wolfruht@mail.deTelegram: telegram.me/werwoelfchen85

#68

Transcription

Nee, an den Stimmen hat sich ja auch nichts verändert. Der Entwickler hat nur sein Add-on aktualisiert. Die Stimmen, dafür ist er ja nicht verantwortlich. Er baut nur den Treiber dafür. Und die Stimmen kommen ja woanders her, aus einem ganz anderen Projekt. Und wenn da die deutschen Stimmen keine vernünftigen Vorlagen haben, als die LibriVox-Ausschnitte, die sie da genommen haben. Eva K. beispielsweise ist eine LibriVox-Leserin. Und der Thorsten Müller, der hat ja seine Stimme quasi als Open-Source-Datensatz zur Verfügung gestellt. Die Thorsten Müller-Stimme ist HQ, klingt aber irgendwie auch... Also ich würde mir mit der nichts vorlesen lassen wollen. Und die Fast-Varianten, also das ist ganz furchtbar. Ich bekomme da nur Gebröckel raus. Also entweder ist mein Rechner zu langsam oder es funktioniert einfach nicht richtig gut. Aber nee, das funktioniert noch nicht so ganz, wie es soll. Aber trotzdem, interessantes Experiment auf jeden Fall. Bin gespannt, was dieses Add-on dann noch können wird, irgendwann mal.

Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#69

Transcription

Das wäre schon lustig, ich glaube das wird jetzt nicht passieren, aber wenn irgendwann irgendwie Eleven Lab Support oder sowas kommt und dann man sich die, nicht die geknoten hat, aber zumindest von den Presets oder irgendwie sowas, von den was waren das, 30 Stimmen, die du mittlerweile zur Auswahl hast, da irgendeine wählen könnte, das wäre schon mal interessant, oder zumindest von der Voice Library oder etc., das wäre mal sauinteressant. Oh ja. Ich finde das wirklich interessant, weil ich immer nicht immer weg sitze, ähm, so in A dran, ich hätte fast P gedrückt, ähm, ich finde das wirklich interessant, wie er es immer ständig neu generiert, was er sagt, das heißt, es wird nie gleich, hundertprozentig gleich klingen. Ja. Das ist sehr interessant, äh, wie gesagt, diese einen, äh, Speaker, äh, Voice Arctic, ja, wie gesagt, äh, Variant Standard, ja, da sind sehr viele Speaker von diesem RH Voice drin, schon irgendwie interessant, mal schauen, nachher, nachher packen sie ja vielleicht noch Vocalizer rein. Aber ein Vocalizer mit Regenerierung, hm, ja, das wäre schon lustig.

McOi

#71

Transcription

Naja, aber 11Labs Support, 11Labs ist ja dann wieder eine API, das hat ja erstmal nichts mit 11Labs zu tun. Es wäre cool, wenn du RVC Models reinladen könntest, weil Imagine einfach so ein Muscle da ist als TTS oder so. Weil ich weiß gar nicht, ich habe mich mit dem Thema nie groß auseinandergesetzt, was das da jetzt für Daten verwendet oder wie man da eine Stimme macht oder was. Erschien mir irgendwie noch sehr schwierig, deswegen...

#72

Transcription

Auch stelle ich mir das ziemlich schwierig vor, über eine API Live-Generation in einer gescheiten Geschwindigkeit zu machen und dann auch mit Verbrauch von wenig Tokens, vor allem wenn man seine Sprachaufgabe auf wenig hat. Also das könnte ich mir jetzt nicht wirklich vorstellen, selbst wenn es die Stimmmodelle offiziell geben würde, was ich nicht denke, aber was cool wäre, wenn Eleven Labs mal Open Source machen würde. Naja, ich weiß nicht.

#73

Transcription

so ich habe mir das jetzt auch gerade mal wieder geholt nachdem ich mit github gekämpft habe also diese releases seite finde ich schon echt dumm manchmal aber na gut es ist schon interessant vor allem diese englischen stimmen sind ja gar nicht mal so schlecht also ich habe mir jetzt da mal eine high runter geladen mal gucken ob ich hier die fast variante irgendwie rein kriege weil das habe ich nicht ganz verstanden weil ich habe eigentlich auch die fast variante davon runtergeladen oder sind es dieselben dann das überschreiben die sich naja also interessant ist auf jeden fall wenn man interessant wie man das tatsächlich also wie das da mit den stimmen läuft also wie die trainiert werden aber ansonsten muss ich schon sagen ja man merkt natürlich schon es ist teilweise noch richtig langsam aber schlecht ist es keinenfalls na NVDA lass mich raus ich komme nicht mehr aus den settings

#74

Naja, viele der Stimmen sind doch von diesem cloud tts system von Microsoft dachte ich? Das basiert nach meinem Wissensstand auch auf API
McOi

#77

Hier ist die Seite mit allen Releases, das jeweils aktuellste ist immer oben. Die Downloads finden sich unter der Ausklappschaltfläche Assets.

https://github.com/mush42/sonata-nvda/releases
Steffen

The man with the big fett Bauch, caught in the back of a Knallerbsenstrauch!

#78

Transcription

stop recording button start assist dare mac alex off windows s notepad x assist dare mac alex off windows say you're interesting hello hello alton oh please cake the zero point nvda settings speech normal configuration friends discord whatsapp data start assist alton alton alton kitty button

#80 Edited

Naja, das ist eine sonata voice. Gabs auf ner web seite die ich auf mastodon gefunden habe, kann ich später mal hier rein posten.
*edit, wen es interessiert, ich glaube das wurde mit google labs getraint, glaube das heißt so.