pimenov.ai

Fish Audio Drama 3: голосу можно объяснить, как сыграть фразу

Fish Audio показала Drama 3 — предварительную версию модели синтеза речи с управлением подачей обычными словами. Вы описываете характер голоса, темп и интонацию: например, персонаж торопится, а в конце фразы переходит на испуганный шёпот.

Drama 3 позволяет менять подачу внутри предложения, создавать сцены с несколькими персонажами и исправлять отдельное слово. Именно точечная правка здесь особенно интересна: если в готовой озвучке не устраивает один фрагмент, хочется поправить его и сохранить удачный дубль.

В демонстрации Fish Audio показаны реплики на английском, японском и французском с указаниями для исполнения. Можно задавать характер всей реплики и отдельно выделять слова, которые должны прозвучать иначе.

Демонстрация Fish Audio, 40 секунд.

Такой подход может пригодиться для рекламных роликов, игровых диалогов и озвучки видео. Вместо перебора новых дублей появляется возможность дать конкретную режиссёрскую задачу. Насколько точно модель сохранит окружающую речь при замене слова, нужно проверить на собственном материале.

Drama 3 пока обозначена как preview. В анонсе разработчикам предлагают оставить комментарий DRAMA, чтобы получить API-ключ. Цена, лимиты и условия коммерческого использования этой версии в посте не указаны; бесплатность и открытый код других моделей Fish Audio автоматически на неё не распространяются.

Сайт проекта — Fish Audio. Для первого теста достаточно короткой реплики со сменой настроения и одним словом на замену: так проще услышать, насколько управляемой получается озвучка.

Следующий шаг

Fish Audio S2-Pro — локальное клонирование голоса и синтез речи

Связанные материалы

Если вы делаете ролики или озвучиваете материалы, можно обсудить, где полезны точечные правки голоса и как проверять качество результата.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov