Fish Audio S2-Pro — открытая модель синтеза речи (TTS) с клонированием голоса по короткому образцу. Понимает эмоции через инлайн-теги, говорит на 80+ языках и запускается офлайн на своём железе. Ниже — что это такое, как поднять модель на Mac и где её реально применять.
Что это такое
Fish Audio S2-Pro — флагманская модель синтеза речи от команды Fish Audio, выложенная в открытый доступ в марте 2026 года. Под капотом — архитектура Dual-AR с этапом обучения с подкреплением (RL) и более 10 млн часов обучающего аудио. Параметров суммарно около 4,4 млрд: Slow AR на 4 млрд (основной семантический кодбук) и Fast AR на 400 млн (акустические детали); в карточках модели это часто округляют до 5 млрд. Веса в формате bf16 — порядка 11 ГБ, 8-битная версия — заметно меньше.
Главная особенность — zero-shot-клонирование: модель копирует тембр и манеру по короткому образцу без отдельного обучения. Поддерживается больше 80 языков (у обновлённой версии S2.1-Pro — 83), включая русский. Речь можно размечать эмоциями прямо в тексте и собирать многоголосые диалоги.
Основные возможности
| Группа | Что умеет |
| Клонирование | Zero-shot по образцу 10–30 секунд; опциональное дообучение для максимального сходства |
| Эмоции | Инлайн-теги прямо в тексте: [whisper], [laugh], [angry] и другие |
| Языки | 80+ языков (S2.1-Pro — 83), русский поддерживается |
| Диалоги | Несколько голосов и многоходовые реплики в одной сцене |
| Дообучение | Fine-tune на своём датасете (с оговорками, см. ниже) |
| Развёртывание | Локально на своём железе или через облачный API Fish Audio |
Требования и совместимость
| Сценарий | Что нужно |
| Официальный запуск | Linux, NVIDIA GPU от 24 ГБ VRAM, CUDA |
| Windows | С NVIDIA GPU и CUDA — нативно или через WSL2 |
| macOS (Apple Silicon) | Через сборки сообщества на MLX или MPS; нативной официальной поддержки нет |
| Без своего железа | Облачный API Fish Audio |
Установка и работа на Mac
Почему официальный путь не подходит
Официальный запуск завязан на CUDA — технологию NVIDIA. У Apple Silicon (M1–M4) графика другая, CUDA там нет. Поэтому на Mac идут через MLX — фреймворк Apple для машинного обучения на своих чипах — либо через форк сообщества на MPS (графический бэкенд Apple).
Запустится ли на Mac mini M4 Pro (48 ГБ)
Да. 48 ГБ объединённой памяти хватает с большим запасом: сборка в bf16 весит около 11 ГБ, 8-битная MLX-сборка — заметно меньше. Узкое место здесь не память, а скорость и зрелость сборок под Mac. На чипах M-серии через MPS-форк сообщества получают порядка 12 токенов в секунду в bf16 и до ~23 токенов в секунду в int8 — для офлайн-озвучки этого достаточно, для настоящего реалтайма впритык.
Шаги установки через MLX
Команды выполняются в приложении «Терминал». Каждую строку копируйте отдельно и жмите Enter.
- Установите менеджер пакетов Homebrew, если его ещё нет:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)" - Поставьте Python-менеджер
uvиgit:brew install uv git - Создайте рабочую папку и виртуальное окружение:
mkdir fish-s2 && cd fish-s2 uv venv source .venv/bin/activate - Установите MLX и утилиту загрузки моделей:
uv pip install mlx huggingface_hub - Скачайте сборку под Apple Silicon (8-битная — легче и быстрее; вариант
bf16даёт качество выше, но требует больше памяти):huggingface-cli download mlx-community/fishaudio-s2-pro-8bit-mlx --local-dir ./s2-pro-mlx - Запустите инференс по инструкции из README скачанной сборки.
Клонирование голоса и дообучение
- Образец. Нужна чистая запись 10–30 секунд: без музыки, шума и эха. От качества образца сходство зависит сильнее, чем от любых настроек.
- Zero-shot. В большинстве случаев этого достаточно для узнаваемого голоса — обучать ничего не надо.
- Дообучение. Для максимального сходства модель дообучают на своём датасете (10–15 минут речи). На Apple Silicon есть готовые LoRA-пайплайны на MLX — дообучать можно и без NVIDIA.
- Реалистичные ожидания. Качество сильно зависит от образца и тегов: на слабом референсе речь может звучать роботизированно. Прогоните несколько образцов, прежде чем делать выводы.
Полезные сценарии использования
- Озвучка контента своим голосом. Видео, YouTube, подкасты и рилсы без записи в микрофон каждый раз.
- Приватная локальная озвучка. Всё считается на вашем Mac — тексты и голос не уходят в чужое облако.
- Аудиокниги и диалоги. Несколько голосов и многоходовые реплики в одной сцене.
- Голосовой двойник для клиента. Тот самый кейс «обучаю двойника» — но с оглядкой на лицензию (см. ниже).
- Прототип голосового ассистента. Офлайн-агент, который отвечает голосом без обращения к внешним API.
- Локализация. Один и тот же голос на 80+ языках — удобно для мультиязычного контента.
Тарифы, лицензия и лимиты
- Self-host. Веса открыты, запуск на своём железе бесплатный.
- Облачный API Fish Audio. Платный, есть бесплатный тариф (строка модели
s2.1-pro-free) для тестов.
Ссылки
- Модель: huggingface.co/fishaudio/s2-pro
- Код: github.com/fishaudio/fish-speech
- Документация: speech.fish.audio
- Сборка под Mac (MLX): huggingface.co/mlx-community/fishaudio-s2-pro-8bit-mlx
- API и цены: docs.fish.audio
По теме
Если вы собираете локальный ИИ-стек на Mac и хотите запускать модели у себя, а не в чужом облаке, — Fish Audio S2-Pro закрывает голосовой слой.
Захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.