Fish Audio S2-Pro — открытая модель синтеза речи (TTS), которая клонирует голос по короткому образцу, управляет подачей через инлайн-теги и поддерживает многоголосые диалоги. Модель можно запускать локально, однако официальный маршрут и сторонние порты установки нужно различать.

📌
Коротко: для клонирования обычно используют чистую запись продолжительностью 10–30 секунд. Дополнительное обучение для такого сценария не требуется. По состоянию на 12 сентября 2026 года Fish Audio называет S2-Pro моделью предыдущего поколения и рекомендует S2.1-Pro для новых производственных проектов.

Что представляет собой Fish Audio S2-Pro

S2-Pro — мультиязычная модель синтеза речи от Fish Audio. Официальный репозиторий описывает её как модель на 4 млрд параметров, обученную более чем на 10 млн часов аудио на 80+ языках.

В основе лежит двухуровневая авторегрессионная архитектура Dual-AR. Медленная часть предсказывает основной смысловой кодбук по временной оси, а быстрая восстанавливает остальные кодбуки с акустическими деталями. На этапе постобучения модель дополнительно выравнивали с помощью обучения с подкреплением.

S2-Pro поддерживает управление просодией и эмоциями через инструкции внутри текста, несколько говорящих и многоходовые диалоги. В актуальной линейке Fish Audio эта версия остаётся доступной, но новым производственным проектам разработчики рекомендуют S2.1-Pro с улучшенными качеством, задержкой и пропускной способностью относительно S2-Pro.

💡
Клонирование без дообучения (zero-shot) — воспроизведение тембра и манеры речи по короткому образцу без отдельного цикла обучения модели.

Основные возможности

ВозможностьЧто подтверждают актуальные источники
Клонирование голосаИспользование короткой записи, обычно продолжительностью 10–30 секунд, без дополнительного дообучения
Управление подачейИнструкции внутри текста, например [whisper], [excited], [angry], а также свободные описания манеры речи
ЯзыкиБолее 80 языков по данным официального репозитория
ДиалогиНесколько говорящих и многоходовая генерация с учётом предыдущего контекста
Потоковая генерацияВыдача аудио по мере генерации; официальный репозиторий отдельно описывает серверные маршруты через SGLang и vLLM Omni
Способы доступаОткрытый репозиторий для локального развёртывания, веб-приложение, REST API и официальный SDK

Как выбрать между S2-Pro и S2.1-Pro

Используйте S2-Pro, если вам нужны открытый локальный стек, многоголосая генерация или управление выражением естественными инструкциями и вы готовы самостоятельно поддерживать окружение.

Для нового приложения через облачный API разумнее сначала проверить S2.1-Pro. Fish Audio указывает его как рекомендуемую производственную модель с улучшенными качеством, задержкой и производительностью относительно S2-Pro.

S2-Pro остаётся полезным для локальных экспериментов и самостоятельного развёртывания, но закладывать его в новый проект как текущую флагманскую облачную модель уже не следует.

Доступ через веб-приложение, API и SDK

Fish Audio указывает три способа использования основных возможностей платформы: веб-приложение без кода, REST API и официальный SDK — набор библиотек для программного доступа. В проверенной обзорной странице перечислены эти маршруты, но не приведены конкретные адреса методов API, параметры авторизации или команда установки SDK.

Для подключения откройте в официальной документации разделы API Reference и Get Your API Key и следуйте инструкции выбранной версии. Не переносите параметры из примеров для другой версии модели или другого интерфейса.

Официальные способы локального запуска

В официальном репозитории предусмотрены отдельные инструкции для нескольких вариантов:

  • командный интерфейс;
  • WebUI;
  • серверный режим;
  • Docker;
  • серверы на базе SGLang Omni и vLLM Omni.

Точные команды зависят от выбранного режима и текущей версии репозитория. Перед установкой откройте соответствующий раздел документации из README и проверьте требования к Python, ускорителю и весам модели.

⚠️
Внимание: не смешивайте команды из разных версий Fish Speech и сторонних портов. Сначала выберите один маршрут установки, затем используйте README именно этого проекта и зафиксированную им версию модели.

Минимальный порядок работы

  1. Выберите интерфейс: командная строка, WebUI или сервер.
  2. Проверьте аппаратные требования выбранного маршрута.
  3. Установите зависимости по актуальной официальной инструкции.
  4. Загрузите совместимые веса S2-Pro.
  5. Сначала синтезируйте короткую фразу без клонирования.
  6. После успешной базовой генерации добавьте референс голоса.
  7. Сохраните версии кода, зависимостей и весов, чтобы окружение можно было воспроизвести.

Запуск на Mac с Apple Silicon

Официальная документация и репозиторий, проверенные 12 сентября 2026 года, не описывают отдельный официальный маршрут S2-Pro для Apple Silicon и не дают команд для MLX или MPS. Поэтому совместимость конкретной сборки под Mac нужно проверять по её собственному README.

Если вы используете Mac:

  • проверьте в README выбранного порта, что он явно поддерживает S2-Pro;
  • убедитесь, что версия весов совпадает с версией кода;
  • начинайте с короткой генерации без клонирования;
  • измеряйте скорость на своём устройстве вместо ориентира по чужим тестам;
  • не переносите команды из CUDA-инструкции в MLX- или MPS-окружение без адаптации.

Конкретные показатели скорости, объём памяти и качество квантованных вариантов в свежих приложенных источниках не подтверждены, поэтому фиксированные цифры для Apple Silicon здесь не приводятся.

⚖️
Практический компромисс: маршрут под Mac, который не описан в официальных источниках этого материала, добавляет отдельный слой совместимости; его нужно проверять отдельно от официальной установки.

Подготовка образца для клонирования

Официальный репозиторий указывает типичную продолжительность референса 10–30 секунд. Модель извлекает из него тембр, стиль речи и эмоциональные особенности.

Для первого теста подготовьте запись со следующими свойствами:

  • один говорящий;
  • разборчивая речь;
  • отсутствие фоновой музыки;
  • минимум эха и постоянного шума;
  • ровная громкость без перегрузки;
  • текст референса известен, если выбранный интерфейс требует транскрипцию.

Сначала сравните несколько чистых образцов одного человека. Если результат заметно меняется между запусками, проверьте качество записи, транскрипцию, язык текста и совместимость весов до экспериментов с дополнительным обучением.

Управление эмоциями и подачей

S2-Pro принимает инструкции в квадратных скобках непосредственно в тексте. В официальном репозитории приведены, среди прочих, такие варианты:

[whisper] Говорите тише.
[excited] У нас хорошие новости.
[angry] Я с этим не согласен.
[short pause] Продолжим после паузы.

Модель также поддерживает свободные описания подачи, например тихий голос или профессиональную манеру диктора. Начинайте с одной инструкции на коротком фрагменте. Если тегов много, труднее определить причину неудачной интонации.

Как проверить результат

📌
Ограничение проверки: материал основан на официальной документации и репозитории Fish Audio; локальный запуск и качество на конкретном устройстве здесь не проверялись.

После установки выполните три последовательных теста.

1. Базовый синтез

Сгенерируйте короткую нейтральную фразу в базовом режиме выбранного интерфейса, без добавления референса, если этот режим допускает генерацию без него. Успешный результат — интерфейс завершает генерацию без ошибки, а выходной аудиофайл открывается и содержит разборчивую речь.

2. Клонирование

Добавьте чистый образец продолжительностью 10–30 секунд и повторите тест с новым текстом. Прослушайте тембр, произношение и стабильность громкости. Один удачный фрагмент ещё не подтверждает устойчивость: проверьте несколько фраз разной длины.

3. Управление выражением

Сгенерируйте одну фразу без инструкции и ту же фразу с одним тегом, например [whisper]. Сравнение должно показать заметное изменение подачи без потери разборчивости.

📌
Критерий готовности: окружение можно считать рабочим, если оно повторно создаёт открываемый аудиофайл, принимает референс и предсказуемо реагирует хотя бы на одну инструкцию подачи.

Полезные сценарии

Локальная озвучка своим голосом

Исходные данные: чистый образец и подготовленный текст. Пользователь запускает модель локально, генерирует несколько коротких фрагментов и собирает их в выпуск. Наблюдаемый результат — аудиофайлы с устойчивым тембром на разных фразах. Сценарий не подходит, если сторонняя сборка нестабильна на выбранном оборудовании или лицензия не разрешает предполагаемое использование.

Многоголосый диалог

Исходные данные: сценарий с репликами нескольких персонажей. S2-Pro поддерживает несколько говорящих и использует предыдущий контекст для следующих реплик. Результат проверяют по различимости голосов, правильному порядку реплик и сохранению интонации на протяжении сцены.

Прототип голосового ассистента

Модель подключают к приложению, которое передаёт текст и принимает потоковое аудио. Успешный прототип начинает воспроизведение до завершения всей генерации и корректно обрабатывает несколько последовательных запросов. Реальная задержка зависит от оборудования и серверного стека, поэтому её нужно измерять в целевом окружении.

Мультиязычная озвучка

Подготовьте тексты на нескольких поддерживаемых языках и проверьте генерацию отдельно для каждого. Результат оценивают по разборчивости, сохранению тембра и правильности произношения. Заявленная поддержка 80+ языков не гарантирует одинакового качества для каждой языковой пары. Если требуется сохранить один голос между языками, это нужно отдельно проверять на выбранной сборке и в выбранном интерфейсе.

Ограничения и лицензия

Код и связанные веса распространяются по Fish Audio Research License. Официальный репозиторий отдельно предупреждает о необходимости соблюдать условия лицензии и местное законодательство.

🔴
Критично: перед коммерческим использованием, распространением весов или созданием голоса другого человека прочитайте актуальный полный текст лицензии и получите необходимые согласия. Название лицензии само по себе не определяет допустимость конкретного проекта.

При клонировании используйте только голос, на который у вас есть необходимые права и согласие. Учитывайте риск выдачи синтетической записи за настоящую и обозначайте происхождение аудио там, где это требуется правилами площадки или законом.

Облачная платформа Fish Audio предлагает s2.1-pro-free для тестирования, прототипов, разработки и небольших компаний. По официальной документации этот вариант не включает гарантию времени до первого аудио (TTFA) и гарантии по соглашению об обработке данных (DPA). Точные цены и остальные ограничения проверяйте на актуальной странице тарифов перед запуском проекта.

Официальные и дополнительные ссылки

Данные о линейке моделей и возможностях проверены по официальным источникам 12 сентября 2026 года.

Следующий шаг

Если вы собираете локальный ИИ-стек и выбираете голосовой слой, сначала определите требования к оборудованию, лицензии и допустимой задержке.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov