Fish Audio S2.1 Pro
Выразительная озвучка с управлением подачей прямо в тексте: эмоции, паузы, диалоги на два голоса. 80+ языков и клонирование голоса.
Для чего эта модель — лучший выбор
- Эмоции и подача задаются прямо в тексте: паузы, шёпот, смех
- Диалог на несколько голосов в одной генерации
- Более 80 языков с автоматическим определением языка
- Клонирование голоса по короткому образцу записи
- Потоковая выдача: звук начинается почти сразу
- Экспорт в MP3, WAV, FLAC и OGG
Где другую модель лучше взять
- До 3000 символов текста за одну генерацию
- Клонирование голоса работает только для одного диктора
- Голос из библиотеки нельзя совместить с клонированным образцом
- Для диалога нужно выбрать минимум два голоса
- Стоимость считается по объёму текста, а не по длительности звука
Как отвечает Fish Audio S2.1 Pro
Четыре сценария, в которых она окупает себя
Подробнее о Fish Audio S2.1 Pro
Fish Audio S2.1 Pro — озвучка текста с живой подачей
Fish Audio S2.1 Pro — флагманская модель синтеза речи от Fish Audio. Подача задаётся прямо в тексте: квадратные скобки вроде [короткая пауза], [шёпотом] или [смеётся] говорят модели, как произнести фразу. Работает в браузере на NetRoom, без VPN и зарубежной карты.
Чем модель отличается от обычного TTS
Классический синтез читает текст ровно от начала до конца. Здесь вы режиссируете: ставите паузу перед важной мыслью, переводите голос на шёпот, добавляете усмешку. Пометки в скобках пишутся обычными словами и в озвучку не попадают — они только управляют интонацией.
Диалоги и несколько голосов
Модель умеет собрать сцену на несколько голосов за одну генерацию. Реплики размечаются тегами говорящих, каждому назначается свой голос из библиотеки — сводить дорожки вручную не нужно.
Языки и клонирование голоса
Поддерживается более 80 языков с автоматическим определением языка текста, так что переключать настройки при локализации не приходится. Отдельно есть клонирование: загрузите короткий образец записи с расшифровкой — и получите синтез своим голосом. Клонирование работает для одного диктора.
Кому пригодится
Подкастерам — начитка выпуска без студии и дублей. Авторам аудиокниг — длинные главы с расстановкой пауз и акцентов. Разработчикам игр и аниматорам — реплики персонажей с нужной эмоцией. Маркетологам — озвучка роликов и рекламных вставок. Командам локализации — один сценарий, озвученный сразу на нескольких языках.
Как озвучить текст
1. Зарегистрируйтесь на NetRoom и пополните баланс в рублях. 2. Откройте раздел «Звук» и выберите Fish Audio S2.1 Pro. 3. Вставьте текст, добавьте пометки подачи в скобках и выберите голос. 4. При необходимости настройте скорость и громкость. 5. Скачайте результат в MP3, WAV, FLAC или OGG.
Сколько стоит
Оплата разовая, без подписки: тарификация идёт по объёму озвучиваемого текста. Актуальная цена указана на этой странице, смета проекта считается в разделе «Звук».
Что ещё есть в разделе «Звук»
Самая большая библиотека готовых голосов — у MiniMax Speech 2.8. Компактная выразительная альтернатива — xAI TTS. Целая звуковая сцена с эффектами получается в Seed Audio 1.0, а песня с вокалом — в MiniMax Music 2.6.
Озвучьте первый сценарий — начать на NetRoom.
Что менялось Fish Audio S2.1 Pro
- + Добавлена голосовая модель Fish Audio S2.1 Pro (Fish Audio): более 80 языков, многоголосые диалоги и клонирование голоса по одному образцу.
Подключите Fish Audio S2.1 Pro по API
Тот же движок — из вашего кода: один ключ и один баланс на текст, картинки, видео и звук. Оплата только за фактические запросы.
curl https://netroom.ai/api/v1/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "fish-audio/fish-audio-s21-pro", "input": {"prompt": "A cinematic mountain sunrise"}}'
Id модели уже подставлен в пример. Полный справочник параметров и цены — в GET /api/v1/models и в документации.
Попробуйте Fish Audio S2.1 Pro
прямо сейчас
Бесплатный доступ к базовым моделям. Без карты, без обязательств.