Fish Audio S2-Pro — открытая модель синтеза речи (TTS), которая клонирует голос по короткому образцу, управляет подачей через инлайн-теги и поддерживает многоголосые диалоги. Модель можно запускать локально, однако официальный маршрут и сторонние порты установки нужно различать.
Что представляет собой Fish Audio S2-Pro
S2-Pro — мультиязычная модель синтеза речи от Fish Audio. Официальный репозиторий описывает её как модель на 4 млрд параметров, обученную более чем на 10 млн часов аудио на 80+ языках.
В основе лежит двухуровневая авторегрессионная архитектура Dual-AR. Медленная часть предсказывает основной смысловой кодбук по временной оси, а быстрая восстанавливает остальные кодбуки с акустическими деталями. На этапе постобучения модель дополнительно выравнивали с помощью обучения с подкреплением.
S2-Pro поддерживает управление просодией и эмоциями через инструкции внутри текста, несколько говорящих и многоходовые диалоги. В актуальной линейке Fish Audio эта версия остаётся доступной, но новым производственным проектам разработчики рекомендуют S2.1-Pro с улучшенными качеством, задержкой и пропускной способностью относительно S2-Pro.
Основные возможности
| Возможность | Что подтверждают актуальные источники |
| Клонирование голоса | Использование короткой записи, обычно продолжительностью 10–30 секунд, без дополнительного дообучения |
| Управление подачей | Инструкции внутри текста, например [whisper], [excited], [angry], а также свободные описания манеры речи |
| Языки | Более 80 языков по данным официального репозитория |
| Диалоги | Несколько говорящих и многоходовая генерация с учётом предыдущего контекста |
| Потоковая генерация | Выдача аудио по мере генерации; официальный репозиторий отдельно описывает серверные маршруты через SGLang и vLLM Omni |
| Способы доступа | Открытый репозиторий для локального развёртывания, веб-приложение, REST API и официальный SDK |
Как выбрать между S2-Pro и S2.1-Pro
Используйте S2-Pro, если вам нужны открытый локальный стек, многоголосая генерация или управление выражением естественными инструкциями и вы готовы самостоятельно поддерживать окружение.
Для нового приложения через облачный API разумнее сначала проверить S2.1-Pro. Fish Audio указывает его как рекомендуемую производственную модель с улучшенными качеством, задержкой и производительностью относительно S2-Pro.
S2-Pro остаётся полезным для локальных экспериментов и самостоятельного развёртывания, но закладывать его в новый проект как текущую флагманскую облачную модель уже не следует.
Доступ через веб-приложение, API и SDK
Fish Audio указывает три способа использования основных возможностей платформы: веб-приложение без кода, REST API и официальный SDK — набор библиотек для программного доступа. В проверенной обзорной странице перечислены эти маршруты, но не приведены конкретные адреса методов API, параметры авторизации или команда установки SDK.
Для подключения откройте в официальной документации разделы API Reference и Get Your API Key и следуйте инструкции выбранной версии. Не переносите параметры из примеров для другой версии модели или другого интерфейса.
Официальные способы локального запуска
В официальном репозитории предусмотрены отдельные инструкции для нескольких вариантов:
- командный интерфейс;
- WebUI;
- серверный режим;
- Docker;
- серверы на базе SGLang Omni и vLLM Omni.
Точные команды зависят от выбранного режима и текущей версии репозитория. Перед установкой откройте соответствующий раздел документации из README и проверьте требования к Python, ускорителю и весам модели.
Минимальный порядок работы
- Выберите интерфейс: командная строка, WebUI или сервер.
- Проверьте аппаратные требования выбранного маршрута.
- Установите зависимости по актуальной официальной инструкции.
- Загрузите совместимые веса S2-Pro.
- Сначала синтезируйте короткую фразу без клонирования.
- После успешной базовой генерации добавьте референс голоса.
- Сохраните версии кода, зависимостей и весов, чтобы окружение можно было воспроизвести.
Запуск на Mac с Apple Silicon
Официальная документация и репозиторий, проверенные 12 сентября 2026 года, не описывают отдельный официальный маршрут S2-Pro для Apple Silicon и не дают команд для MLX или MPS. Поэтому совместимость конкретной сборки под Mac нужно проверять по её собственному README.
Если вы используете Mac:
- проверьте в README выбранного порта, что он явно поддерживает S2-Pro;
- убедитесь, что версия весов совпадает с версией кода;
- начинайте с короткой генерации без клонирования;
- измеряйте скорость на своём устройстве вместо ориентира по чужим тестам;
- не переносите команды из CUDA-инструкции в MLX- или MPS-окружение без адаптации.
Конкретные показатели скорости, объём памяти и качество квантованных вариантов в свежих приложенных источниках не подтверждены, поэтому фиксированные цифры для Apple Silicon здесь не приводятся.
Подготовка образца для клонирования
Официальный репозиторий указывает типичную продолжительность референса 10–30 секунд. Модель извлекает из него тембр, стиль речи и эмоциональные особенности.
Для первого теста подготовьте запись со следующими свойствами:
- один говорящий;
- разборчивая речь;
- отсутствие фоновой музыки;
- минимум эха и постоянного шума;
- ровная громкость без перегрузки;
- текст референса известен, если выбранный интерфейс требует транскрипцию.
Сначала сравните несколько чистых образцов одного человека. Если результат заметно меняется между запусками, проверьте качество записи, транскрипцию, язык текста и совместимость весов до экспериментов с дополнительным обучением.
Управление эмоциями и подачей
S2-Pro принимает инструкции в квадратных скобках непосредственно в тексте. В официальном репозитории приведены, среди прочих, такие варианты:
[whisper] Говорите тише.
[excited] У нас хорошие новости.
[angry] Я с этим не согласен.
[short pause] Продолжим после паузы.Модель также поддерживает свободные описания подачи, например тихий голос или профессиональную манеру диктора. Начинайте с одной инструкции на коротком фрагменте. Если тегов много, труднее определить причину неудачной интонации.
Как проверить результат
После установки выполните три последовательных теста.
1. Базовый синтез
Сгенерируйте короткую нейтральную фразу в базовом режиме выбранного интерфейса, без добавления референса, если этот режим допускает генерацию без него. Успешный результат — интерфейс завершает генерацию без ошибки, а выходной аудиофайл открывается и содержит разборчивую речь.
2. Клонирование
Добавьте чистый образец продолжительностью 10–30 секунд и повторите тест с новым текстом. Прослушайте тембр, произношение и стабильность громкости. Один удачный фрагмент ещё не подтверждает устойчивость: проверьте несколько фраз разной длины.
3. Управление выражением
Сгенерируйте одну фразу без инструкции и ту же фразу с одним тегом, например [whisper]. Сравнение должно показать заметное изменение подачи без потери разборчивости.
Полезные сценарии
Локальная озвучка своим голосом
Исходные данные: чистый образец и подготовленный текст. Пользователь запускает модель локально, генерирует несколько коротких фрагментов и собирает их в выпуск. Наблюдаемый результат — аудиофайлы с устойчивым тембром на разных фразах. Сценарий не подходит, если сторонняя сборка нестабильна на выбранном оборудовании или лицензия не разрешает предполагаемое использование.
Многоголосый диалог
Исходные данные: сценарий с репликами нескольких персонажей. S2-Pro поддерживает несколько говорящих и использует предыдущий контекст для следующих реплик. Результат проверяют по различимости голосов, правильному порядку реплик и сохранению интонации на протяжении сцены.
Прототип голосового ассистента
Модель подключают к приложению, которое передаёт текст и принимает потоковое аудио. Успешный прототип начинает воспроизведение до завершения всей генерации и корректно обрабатывает несколько последовательных запросов. Реальная задержка зависит от оборудования и серверного стека, поэтому её нужно измерять в целевом окружении.
Мультиязычная озвучка
Подготовьте тексты на нескольких поддерживаемых языках и проверьте генерацию отдельно для каждого. Результат оценивают по разборчивости, сохранению тембра и правильности произношения. Заявленная поддержка 80+ языков не гарантирует одинакового качества для каждой языковой пары. Если требуется сохранить один голос между языками, это нужно отдельно проверять на выбранной сборке и в выбранном интерфейсе.
Ограничения и лицензия
Код и связанные веса распространяются по Fish Audio Research License. Официальный репозиторий отдельно предупреждает о необходимости соблюдать условия лицензии и местное законодательство.
При клонировании используйте только голос, на который у вас есть необходимые права и согласие. Учитывайте риск выдачи синтетической записи за настоящую и обозначайте происхождение аудио там, где это требуется правилами площадки или законом.
Облачная платформа Fish Audio предлагает s2.1-pro-free для тестирования, прототипов, разработки и небольших компаний. По официальной документации этот вариант не включает гарантию времени до первого аудио (TTFA) и гарантии по соглашению об обработке данных (DPA). Точные цены и остальные ограничения проверяйте на актуальной странице тарифов перед запуском проекта.
Официальные и дополнительные ссылки
- Документация по возможностям: docs.fish.audio/overview/capabilities
- Код и инструкции по локальному запуску: github.com/fishaudio/fish-speech
- Модель: huggingface.co/fishaudio/s2-pro
- Инструкции по установке: speech.fish.audio/install/
Данные о линейке моделей и возможностях проверены по официальным источникам 12 сентября 2026 года.
Следующий шаг
Если вы собираете локальный ИИ-стек и выбираете голосовой слой, сначала определите требования к оборудованию, лицензии и допустимой задержке.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov

