Техническая ветка

Речевые синтезаторы

Started by Fenix 130 posts last post 4 years ago Page 6 of 7

#101

Попробовал тут кстати поставить Alexander HQ. Заметил такую штуку: все свистящие и шипящие звучат так, будто бы надерганы из нового Александра и предыдущего, т. е. часть звучит с большим количеством высоких частот, а часть - также, как в старом варианте. Это у меня такое восприятие неправильное или все-таки голос еще будет допиливаться?

#102

Нет, не у одного вас такое ощущение.
У меня от голоса сложилось ощущение, что это старый Александр, у которого очень повысили высокие частоты, из-за чего они стали свистеть очень сильно.
--
Seva
https://github.com/sevapopov2

#103

Transcription

Всем привет! У Акапелла недавно вышло несколько голосов, премиум-версии, основанные на нейронных сетях. Там для испанского языка вышли голоса, для русского вышел голос, для других языков тоже. К сожалению, из-за плохой доступности сайта... Ну как, там не совсем удобно это делается, можно темпки послушать. То есть, не все голоса я смог протестировать, но это достаточно интересно. Здесь есть плюс и минус. Минус заключается в том, что мы эти голоса использовать не сможем. То есть, я пользователь платной Акапеллы для людей, и она мне очень помогает, как выяснилось, для чтения испанского, например. Вот эти вот новые голоса мы использовать не сможем. А с другой стороны, голоса получились неплохими. Русский голос, в частности, он прям очень прикольный. И, учитывая опыт с нейронными сетями от Яндекса, это прям очень неплохо звучит. Не знаю, куда нас все это приведет. Мне кажется, скринрейдеры никогда не будут задействованы с работой с такими синтезаторами. Потому что это машинное обучение. Фактически, я даже не знаю, кто что по этому поводу думает. В VoiceDream эти голоса вряд ли будут использоваться. Но то, что такое есть, оно неплохо. Но с Яндексом тоже да.

--
Seva
https://github.com/sevapopov2

#104

Transcription

Ну, тут можно пошутить на тему того, что Rache OSN тоже, по сути, нейронная сеть, и тем не менее, она у нас работает не только на компьютерах, но и на смартфонах, что, в общем-то, сегодня неудивительно совсем. Что же касается этих голосов, да, наверное, на сегодня это в первую очередь B2B сегмент, но я думаю, что в ближайшие десятилетия случится одно из двух событий, либо мы постепенно переберемся на модель облачных уже операционных систем. Либо, даже если мы этого не сделаем в ближайшие лет 20-30, то, как минимум, у нас с вами появится какой-нибудь там 5G с высокими скоростями и низкой задержкой. И, возможно, каким-то образом со стороны производителей и речевых движков, и со стороны производителей скринридеров может быть простимулирована такая модель потребления. Типа там вот этот онлайн, да, какой-нибудь онлайн ТТС, в котором как раз можно будет задействовать эти голоса. Поэтому, ну, с одной стороны, жалко, что сейчас это использовать нельзя. Хотя, в общем, как бы жалко или не жалко, я не знаю, я голоса еще не смотрел, сейчас попробую найти и посмотреть. Но, с другой стороны, будущее таких голосов, ну, лично мне понятно. Вопрос только во временных каких. Во временных дистанциях, да, во временных промежутках, на которых это будет внедряться.

#105

Transcription

Почему-то у меня не получилось ничего с этой акапеллой. То есть у меня получилось сделать объявление о посадке в самолет на английском языке, а по произвольному тексту на русском у меня почему-то не получилось. То есть я выбираю язык, выбираю голос, ввожу текст, нажимаю кнопку synthesize, но не появляется вот этой кнопочки listen, да, которая там вот этого плеера, который появляется в других случаях, да и без плеера как бы тоже ничего не играет. А кнопку я нажимал и джозом, и nvidia, и щелчками, и энтером, и всяко-разно. Это что-то у меня не работает или там все-таки какая-то... Хитрость есть в том, как эту кнопку нажать.

#106

а интересно! чем тренируются голоса?
именно синтезатора rh voice

#107

а то яб побаловался. хех

#108

Подробностей не знаю, но это делается в облаке.
Алексей

#109

Вот насчёт RHVoice не думаю, что это в облаке, хотя всё может быть...
А что касается нейронных голосов то да, в облаке.
--
Seva
https://github.com/sevapopov2

#111

когда я выбераю SAPI4 из списка синтезаторов на NVDA, он даёт ошыбку и я не могу использовать голосы SAPI 4 с NVDA. что можно сделать чтобы исправить эту ошибку?

#112

Transcription

Привет, Фатих. Вот так. Что касается этой ошибки с АПИ-4, можешь поподробнее дать какие-то конкретные сведения, потому что без журнала, например, я не могу сказать, в чём это связано. Может быть, какой-то голос сломанный не даёт заработать синтезатору какому-то. Надо просто посмотреть на голоса, и надо просто журнал посмотреть. Если не хочешь здесь, то можешь мне личку написать, чтобы именно помочь с этим. Спасибо.

Student studentowi wszystko

#113

Transcription

Для начала немножечко банальный вопрос, а ставился ли сам пакет СА-54, потому что изначально он идёт не на десятки, а по-моему на XP даже только по умолчанию, а больше он нигде не ставится.

#114

вот здесь журнал NVDA:
кстати, зпасибо за помощ

#115

Transcription

привет фатих привет всем ну вот я почитал журнал извини что вообще очень поздно отвечаю на твой вопрос но как я понял из этого журнала к сожалению там только видно что есть какой-то голос нужно бы реально посмотреть у тебя на реестр по ремонте каком-то и увидит что за проблема и какой там косячный синтезатор там все может быть если ты человек который любит очень тестировать разные синтезаторе экспериментировать видео не удивлен надо бы посмотреть что и как и почему так что рекомендую созвонимся на это не здесь скажешь мне когда у тебя время будет и можем посмотреть

Student studentowi wszystko

#116

Transcription

Всем привет! В новом Испике добавлены голоса Speech Player. Я никак не могу понять, что такое Speech Player. Ну, как бы, в чем преимущество? Почему все так на этом акцентируют внимание? В англоязычном сообществе, в польском сообществе я тоже читал, я пытался задать там вопрос по этому поводу. Ну, дает ли какие-то это преимущества, непонятно, но вот на Linux я пробовал эти голоса, и в NVIDIA, в Alpha Snapshot они доступны. Я специально поставил Alpha Snapshot для того, чтобы посмотреть, есть ли новые голоса. Да, они там есть, и, ну, лично на мой взгляд, очень специфические они. Оригинальные голоса Speech Player звучат похоже на дикток, а голоса Speech Player от Испика звучат как... Примерно все варианты Испика, только измененными. Какое-то преимущество дает непонятно, и почему все на этом так акцентируют внимание тоже, особенно вот. Если акцентируют, значит, видимо, дает. Но я могу сказать, что все голоса от Speech Player неправильно, ну, имеют ошибки в произношении русских слов. Например, то, что мне бросилось в глаза, они неправильно произносят цифру 50. С другими голосами Испика, со старыми, таких проблем нет. Но дальше я тестировать отказался, потому что Alpha версии NVIDIA, и тем более Snapshot, пользоваться мне не хочется. Но если кто-то может мне объяснить, в чем как бы дело, или это просто варианты новые для Испика, и все. Ну, просто мне хотелось бы разобраться, а то я вижу, что люди акцентируют внимание, и мне прям интересно стало. Всем спасибо.

--
Seva
https://github.com/sevapopov2

#117

Все просто. Дело в том, что Speech Player - это действительно хоть и не полноценный порт, но все-таки родственник Dectalk, а последний еще относительно недавно, ну, скажем лет 10 назад, был довольно популярен, причем даже не столько в программном виде, сколько в аппаратном. Лично знал нескольких американцев, которые еще в 2010-х работали на компьютере, подключая к нему аппаратный Dectalk, благо Джоз в то время, не знаю как сейчас, поддерживал все инкарнации этого синтезатора. Поэтому сам факт добавления куда-то хотя бы чего-то похожего уже имеет для людей какое-то значение. Ну представь, если завтра например скажут, что в NVDA появилась мышь Волкова. Даже при том, что таких любителей мышатинки, как я сегодня наверное сильно меньше, чем раньше, подобное заявление произведет некий ажиотаж, и люди будут об этом говорить. Ну а особенности реализации, если таковые будут, обнаружатся уже потом, когда инфоповод отработает. А кстати, такое у нас даже уже было. Когда-то, Cobra, выходя на наш рынок, имела из коробки имплементацию мыши Волкова, но работала она там совсем не так, как в Джозе. Однако, первые дни разговоров было много. И многие ставили демку, просто из любопытства.

#118

а чем ньюфон тот же отличается от мышки?
вроде как 1 и тот же голос с такой же интонацией.

#119

Мышь и ньюфон - это 2 робота, спору нет, но роботы эти абсолютно разные. У мыши более скупая интонация, четче согласные и есть какие-то внутренние алгоритмы разгона. Засчет этого ее можно разогнать реально до невообразимых величин. Там, где Ньюфон разбирать сложно, мышь вполне читаема.
Что до клавиатурного отлика, то у Ньюфона с NVDA он быстрее, это факт, но, как не странно, к этой быстроте я привыкнуть так и не могу. Такое ощущение, как будто работаешь на какой-то дешевой клавиатуре, у которой хода клавиш почти нет.
Например с тем же RHVoice в NVDA лаг между нажатием и голосом более естественный для меня. Это все конечно субъективно, и Ньюфон совсем неплох, и я даже его использую каждый день на Android и на PC, когда работаю в Reaper с NVDA но они с мышью разные. Даже тембры разные, черт возьми, хоть и можно Ньюфон приблизить к мышке.

#120

Transcription

всем привет здравствуйте дмитрий на самом деле адептов мышки волкова прибавится на один кроме вас это я я обожаю мышь волкова с самого детства я мечтал чтобы у меня была мышка волкова и я помню как мне родители подарили на день рождения и и мне тогда исполнилось 13 лет это было 8 лет назад но это лирическое отступление а вот даже интересно стало как она была реализована в кобре потому что я помню что я ставил кобру и там тоже было что-то похожее на мышку волкова и как она там была реализована но если появилась бы мышка волкова для nvidia я бы наверное был бы одним из первых кто купил бы ее вот до мышка волкова до день людей это мечта джоз к сожалению я из-за нее использую сейчас не могу потому что мне придется покупать мышь волкова на 3 карте компьютер а учитывая то что как сам автор рассылает это все дело это процесс довольно таки не быстрый поэтому я ограничиваю себя nvidia и и с пиком пока на речевой сам тоже

--
Seva
https://github.com/sevapopov2