Text to Speech
Введите текст, выберите голос и модель — сервис генерирует речь с естественной интонацией. В S2.1 Pro можно описывать эмоции и манеру речи прямо в подсказках.
Fish Audio — платформа для генерации речи из текста, клонирования голоса и работы с Voice AI. Ниже — актуальный разбор TTS, моделей S2.1 Pro, русского языка, Voice Cloning, API, тарифов, прав на использование и реальных сценариев.
Fish Audio — Voice AI-платформа, где текст превращается в естественную речь, а короткая запись может стать основой для цифровой копии голоса. Основные инструменты доступны в браузере; разработчикам доступны REST API и официальный SDK. Пользователь может выбрать готовый AI voice из библиотеки, ввести текст и получить готовое аудио, либо создать собственный voice clone и использовать его в новых проектах.
В официальной документации платформы отдельно выделены Text to Speech, Speech to Text, Voice Cloning, потоковая генерация речи в реальном времени и управление голосами. В веб-приложении также есть Voice Changer, Story Studio, генерация звуков, Audio Separation и другие функции для аудиоконтента.
Сильная сторона сервиса — не один генератор, а набор инструментов для создания, обработки и повторного использования голосовых моделей.
Введите текст, выберите голос и модель — сервис генерирует речь с естественной интонацией. В S2.1 Pro можно описывать эмоции и манеру речи прямо в подсказках.
Voice Cloning создаёт цифровую модель по короткой чистой записи. Для стабильного результата важны отсутствие фоновой музыки, один говорящий и естественная подача.
Речь можно преобразовывать обратно в текст. Это полезно для транскрипций, подкастов, интервью, видеороликов и автоматизации голосовых сценариев.
Потоковая генерация подходит для voice agents, приложений и диалоговых интерфейсов, где первый фрагмент аудио должен появляться без долгой паузы.
В Discovery собраны пользовательские и публичные voices. Можно искать тембр и стиль под видео, персонажа, рекламный ролик, аудиокнигу или повествование.
Веб-приложение объединяет длинные проекты с несколькими голосами, Voice Changer, Audio Separation, звуковые эффекты и другие инструменты работы с аудио.
Официальный гайд рекомендует S2.1 Pro для production-задач.
| Модель | Статус | Языки | Управление голосом | Когда выбирать |
|---|---|---|---|---|
| S2.1 Pro | Рекомендуемая | 83 языка | Естественные описания в квадратных скобках, multi-speaker | Основная модель для качественной генерации речи и production. |
| S2 Pro | Предыдущее поколение | 80+ языков | Natural language control, несколько спикеров | Существующие интеграции и open-source сценарии. |
| S1 | Предыдущая модель | 13 языков, включая русский | Эмоциональные выражения через круглые скобки | Совместимость со старыми workflow. |
Для обычной генерации речи код не нужен. Рабочий сценарий укладывается в четыре шага.
Перейдите на официальный сайт и войдите в аккаунт. Для сохранения голосов, истории и генераций требуется профиль пользователя.
Откройте библиотеку voices или создайте свой клон. Для нового голоса загрузите чистую запись и укажите понятное имя модели.
Добавьте текст для генерации. В S2.1 Pro можно вставлять подсказки вроде [whisper], [laugh] или собственные описания манеры речи.
Прослушайте готовый voice, при необходимости исправьте текст, эмоции и паузы, затем сохраните результат для видео, подкаста или другого проекта.
Русский поддерживается в актуальной линейке моделей. Для S1 он прямо указан среди 13 языков. S2.1 Pro использует автоматическое определение языка и рассчитан на 83 языка, поэтому отдельный переключатель языка в API-сценарии часто не требуется.
Вместо длинного абзаца лучше разбить реплику на смысловые части и явно описать подачу:
[calm and confident] Добрый вечер. Сегодня мы разберём новый продукт.
[slightly excited] Самое интересное начинается прямо сейчас.
Такая структура помогает управлять тоном, паузами и эмоциональной интонацией без отдельного аудиоредактора.
Официальный сайт указывает, что для естественного клона может быть достаточно примерно 10 секунд аудио. При этом официальный гайд советует при проблемах увеличить запись до 30–60 секунд. Главное — чистый звук, один человек в записи и отсутствие фоновой музыки.
Говорите естественно, без шума и музыки. Не меняйте расстояние до микрофона во время записи.
В личном кабинете выберите Create Voice, загрузите файл и дождитесь обработки.
Введите несколько разных реплик. Если тембр неточный или речь роботизирована, запишите более длинный и чистый образец.
AI-синтез полезен там, где текст часто меняется и нужно быстро получать новые версии речи без повторной студийной записи.
Условия и цены могут меняться. Ниже — параметры с официальной страницы тарифов Fish Audio.
| Тариф | Цена при помесячной оплате | Лимит генерации | Ключевые возможности |
|---|---|---|---|
| Plus | 499 ₽/мес | до 200 минут / 250 000 кредитов | До 15 000 символов, enhanced voice cloning, Voice Design, коммерческое использование разрешено. |
| Pro | 999 ₽/мес | до 1 620 минут / 2 000 000 кредитов | До 30 000 символов, командные места, больше профессиональных voice slots. |
| Max | 1 999 ₽/мес | до 6 250 минут / 25 000 000 кредитов | Для крупных команд и большого объёма генерации. |
Пользовательская платформа и веб-приложение: AI voice generator, TTS, клонирование, библиотека голосов, Story Studio, API и другие аудиоинструменты.
Подходит: авторам контента, командам, подкастерам, разработчикам и пользователям, которым нужен готовый интерфейс.
Open-source направление и кодовая база моделей речи проекта. Репозиторий интересен разработчикам, которые хотят работать с моделью и инфраструктурой глубже.
Подходит: ML/AI-разработчикам, исследователям и командам с собственной инфраструктурой.
Это Voice AI-платформа для генерации речи из текста, клонирования голоса, Speech to Text, управления голосовыми моделями и других задач с аудио.
Да. Русский поддерживается. S1 прямо включает русский в список языков, а S2.1 Pro использует автоматическое определение языка и поддерживает 83 языка.
Официальный сайт пишет, что может быть достаточно примерно 10 секунд. Если результат слабый, руководство советует попробовать более длинную запись 30–60 секунд.
Для основной работы достаточно браузера. Также существуют мобильные приложения, но пользователю не обязательно устанавливать программу для обычного TTS.
Это актуальная рекомендуемая production-модель TTS. Она поддерживает 83 языка, несколько спикеров и управление выражением речи через естественные текстовые описания.
Да. Платформа предоставляет REST API, streaming-сценарии и официальный SDK. Это позволяет встроить генерацию речи в сайт, приложение, бота или voice agent.
Без разрешения — нет. Официальная инструкция прямо рекомендует клонировать только свой голос или голос человека, давшего письменное разрешение.
Для коммерческого использования необходимо соблюдать условия тарифа и права на конкретный voice. Официальный FAQ разрешает коммерческое использование Premium-подписчикам для проверенных голосов, которыми они владеют.
Помимо TTS платформа предлагает voice cloning, управление эмоциями и стилем, многоспикерные сценарии, библиотеку voices, API, Speech to Text и дополнительные инструменты обработки аудио.
Если задача — быстро превратить текст в речь для видео, можно сравнить результат с инструментами КупиГолос и выбрать подходящий голос, темп и подачу. Модель Fish Audio скоро появится в сервисе, но пока ещё недоступна.