Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS
Google представила Gemini 3.8 Flash TTS и Flash-Lite TTS — две модели синтеза речи. По заявлению компании, можно создать голос по текстовому описанию или выбрать из библиотеки более 2000 готовых голосов, а затем управлять подачей каждой реплики: темпом, интонацией, акцентом, паузами и короткими реакциями вроде смеха. Модели поддерживают более 100 языков.
Flash TTS рассчитана на аудиокниги, подкасты и игровые диалоги, где важна тонкая настройка персонажа и сцены. Flash-Lite TTS предназначена для поточной озвучки, дубляжа и голосовых агентов, где важны скорость и стоимость генерации.
Видеодемонстрация Google AI.
В первом комментарии к анонсу Google уточнила доступность: обе модели появляются в Google AI Studio и Gemini API. Flash TTS также запускают в Gemini Notebook, Flash-Lite TTS — в Google Vids. Для Gemini Enterprise обе модели обещаны позже.
Для рабочего проекта полезно прогнать один и тот же короткий русский фрагмент через обе модели и послушать, как они держат ударения, эмоцию и длинные реплики. Заявленная поддержка языка сама по себе не отвечает на вопрос, подойдёт ли голос для вашего сценария.
Следующий шаг
Посмотрите, как мы научили Mac mini читать весь сайт моим голосом: это практический пример использования синтеза речи для большого объёма материалов.
Связанные материалы
- Статья: Весь pimenov.ai теперь можно слушать: 365 аудиоматериалов
- Блог: VoiceStudio: озвучка и дубляж на своём компьютере
- База знаний: OmniVoice — локальный синтез речи и клонирование голоса на 600+ языков
Если вы выбираете модель для аудиоверсий или голосового интерфейса, обсудить стоит и качество речи, и стоимость длинных записей.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov