pimenov.ai

База знаний

Fish Audio S2-Pro — локальное клонирование голоса и синтез речи

Открытая модель синтеза речи (TTS) с клонированием голоса по короткому образцу, поддержкой эмоций и 80+ языков. Разбор возможностей, запуск на Mac (Apple Silicon) и практические сценарии.

Fish Audio S2-Pro — открытая модель синтеза речи (TTS) с клонированием голоса по короткому образцу. Понимает эмоции через инлайн-теги, говорит на 80+ языках и запускается офлайн на своём железе. Ниже — что это такое, как поднять модель на Mac и где её реально применять.

📌
Коротко: для похожего голоса чаще всего хватает zero-shot-клонирования по 10–30 секундам записи — без дообучения. Полное дообучение всех весов, о котором любят писать в чатах, разработчики как раз не рекомендуют. Подробнее — в разделе про клонирование.

Что это такое

Fish Audio S2-Pro — флагманская модель синтеза речи от команды Fish Audio, выложенная в открытый доступ в марте 2026 года. Под капотом — архитектура Dual-AR с этапом обучения с подкреплением (RL) и более 10 млн часов обучающего аудио. Параметров суммарно около 4,4 млрд: Slow AR на 4 млрд (основной семантический кодбук) и Fast AR на 400 млн (акустические детали); в карточках модели это часто округляют до 5 млрд. Веса в формате bf16 — порядка 11 ГБ, 8-битная версия — заметно меньше.

Главная особенность — zero-shot-клонирование: модель копирует тембр и манеру по короткому образцу без отдельного обучения. Поддерживается больше 80 языков (у обновлённой версии S2.1-Pro — 83), включая русский. Речь можно размечать эмоциями прямо в тексте и собирать многоголосые диалоги.

💡
Zero-shot-клонирование — модель воспроизводит голос по короткому образцу (10–30 секунд) без обучения. Дообучение (fine-tune) нужно только тогда, когда важно выжать максимум сходства и стабильности.

Основные возможности

ГруппаЧто умеет
КлонированиеZero-shot по образцу 10–30 секунд; опциональное дообучение для максимального сходства
ЭмоцииИнлайн-теги прямо в тексте: [whisper], [laugh], [angry] и другие
Языки80+ языков (S2.1-Pro — 83), русский поддерживается
ДиалогиНесколько голосов и многоходовые реплики в одной сцене
ДообучениеFine-tune на своём датасете (с оговорками, см. ниже)
РазвёртываниеЛокально на своём железе или через облачный API Fish Audio

Требования и совместимость

СценарийЧто нужно
Официальный запускLinux, NVIDIA GPU от 24 ГБ VRAM, CUDA
WindowsС NVIDIA GPU и CUDA — нативно или через WSL2
macOS (Apple Silicon)Через сборки сообщества на MLX или MPS; нативной официальной поддержки нет
Без своего железаОблачный API Fish Audio
⚠️
Внимание: официальный репозиторий не поддерживает macOS напрямую — он рассчитан на NVIDIA и CUDA. На Mac модель запускают через сторонние сборки сообщества. Это работает, но требует аккуратности и сверки с актуальным README.

Установка и работа на Mac

Почему официальный путь не подходит

Официальный запуск завязан на CUDA — технологию NVIDIA. У Apple Silicon (M1–M4) графика другая, CUDA там нет. Поэтому на Mac идут через MLX — фреймворк Apple для машинного обучения на своих чипах — либо через форк сообщества на MPS (графический бэкенд Apple).

Запустится ли на Mac mini M4 Pro (48 ГБ)

Да. 48 ГБ объединённой памяти хватает с большим запасом: сборка в bf16 весит около 11 ГБ, 8-битная MLX-сборка — заметно меньше. Узкое место здесь не память, а скорость и зрелость сборок под Mac. На чипах M-серии через MPS-форк сообщества получают порядка 12 токенов в секунду в bf16 и до ~23 токенов в секунду в int8 — для офлайн-озвучки этого достаточно, для настоящего реалтайма впритык.

💡
Объединённая память (unified memory) у Apple Silicon общая для процессора и графики. 48 ГБ означают, что модель целиком помещается в память GPU без привычных для дискретных видеокарт ограничений по VRAM.

Шаги установки через MLX

Команды выполняются в приложении «Терминал». Каждую строку копируйте отдельно и жмите Enter.

  1. Установите менеджер пакетов Homebrew, если его ещё нет:
    /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
  2. Поставьте Python-менеджер uv и git:
    brew install uv git
  3. Создайте рабочую папку и виртуальное окружение:
    mkdir fish-s2 && cd fish-s2
    uv venv
    source .venv/bin/activate
  4. Установите MLX и утилиту загрузки моделей:
    uv pip install mlx huggingface_hub
  5. Скачайте сборку под Apple Silicon (8-битная — легче и быстрее; вариант bf16 даёт качество выше, но требует больше памяти):
    huggingface-cli download mlx-community/fishaudio-s2-pro-8bit-mlx --local-dir ./s2-pro-mlx
  6. Запустите инференс по инструкции из README скачанной сборки.
⚠️
Внимание: точные команды запуска зависят от конкретной сборки. Всегда сверяйтесь с README на странице модели — сообщество активно обновляет MLX- и MPS-порты, и способ запуска может меняться. Как альтернатива MLX существует форк на MPS (McFish) — если одна сборка не заведётся, пробуйте другую.

Клонирование голоса и дообучение

  • Образец. Нужна чистая запись 10–30 секунд: без музыки, шума и эха. От качества образца сходство зависит сильнее, чем от любых настроек.
  • Zero-shot. В большинстве случаев этого достаточно для узнаваемого голоса — обучать ничего не надо.
  • Дообучение. Для максимального сходства модель дообучают на своём датасете (10–15 минут речи). На Apple Silicon есть готовые LoRA-пайплайны на MLX — дообучать можно и без NVIDIA.
  • Реалистичные ожидания. Качество сильно зависит от образца и тегов: на слабом референсе речь может звучать роботизированно. Прогоните несколько образцов, прежде чем делать выводы.
⚖️
Важный нюанс: документация Fish советует дообучать только LLAMA-часть модели и не трогать RL-этап. Полное дообучение всех весов технически возможно, но повышает риск деградации качества. Так что популярный в чатах тезис «только полное обучение весов, не LoRA» — не то, что рекомендуют сами разработчики.

Полезные сценарии использования

  • Озвучка контента своим голосом. Видео, YouTube, подкасты и рилсы без записи в микрофон каждый раз.
  • Приватная локальная озвучка. Всё считается на вашем Mac — тексты и голос не уходят в чужое облако.
  • Аудиокниги и диалоги. Несколько голосов и многоходовые реплики в одной сцене.
  • Голосовой двойник для клиента. Тот самый кейс «обучаю двойника» — но с оглядкой на лицензию (см. ниже).
  • Прототип голосового ассистента. Офлайн-агент, который отвечает голосом без обращения к внешним API.
  • Локализация. Один и тот же голос на 80+ языках — удобно для мультиязычного контента.

Тарифы, лицензия и лимиты

  • Self-host. Веса открыты, запуск на своём железе бесплатный.
  • Облачный API Fish Audio. Платный, есть бесплатный тариф (строка модели s2.1-pro-free) для тестов.
🔴
Критично: открытые веса распространяются под Fish Audio Research License — только для исследований и некоммерческого использования. Обучать и продавать голосового двойника «для клиента» на собственных (self-hosted) весах — нарушение лицензии. Коммерческий путь есть, но другой: платный API или подписка Fish Audio, где коммерческое использование разрешено. За отдельной лицензией на веса — business@fish.audio.

Ссылки

По теме

Если вы собираете локальный ИИ-стек на Mac и хотите запускать модели у себя, а не в чужом облаке, — Fish Audio S2-Pro закрывает голосовой слой.

Захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov