Обычно генерация аудио требует склейки отдельных слоев — речи, эффектов, атмосферы. ByteDance представила Seed Audio 1.0, модель, которая генерирует всё это сразу, из одного текстового описания, как единую звуковую сцену. Это меняет подход к звуковому дизайну, упрощая создание комплексного аудио для креаторов и инженеров.
Модель Seed Audio 1.0 способна генерировать речь, звуковые эффекты, атмосферу и другие элементы аудио на уровне сцены в единой системе. Креаторы редко представляют звук как набор изолированных файлов — они слышат комнату до реплики, давление в паузе, фоновый шум. Seed Audio 1.0 построена вокруг этой единицы создания, позволяя управлять персонажами, таймингом, текстурой фона и звуковым дизайном как одним целым. Такой подход даёт более широкий диапазон экспрессии голоса — от сдержанного повествования до сильных эмоций, сохраняя при этом идентичность. Цель — сделать генерацию аудио похожей не на сборку клипов, а на режиссуру звуковой сцены.
Seed Audio 1.0 предлагает несколько ключевых возможностей:
- Генерация координированных сцен и контроль тайминга. Один промпт может описывать спикера, эмоциональный тон, подачу реплики, окружающую среду, ключевые звуковые эффекты и развитие сцены. Модель выстраивает диалог, атмосферу и звуковые сигналы естественнее по таймингу, тону и акустическому пространству. Точность контроля тайминга диалогов составляет 100 мс.
- Голоса с диапазоном и консистентностью. Голос можно формировать по текстовому описанию, референсному образцу или обоим. Поскольку модель обучена в контексте сцен (эмоции, темп, окружающий звук), она лучше управляет выражением, просодией, ритмом и стилем речи. Для длинного контента Seed Audio 1.0 может генерировать до двух минут аудио за один проход с возможностью продолжения, сохраняя узнаваемость персонажа.
- Многоязычное аудио с естественным выражением. Поддерживается более 20 языков, включая китайский, английский, японский, корейский, испанский, индонезийский, немецкий, французский, тайский и вьетнамский. Модель адаптирует голос персонажа под разные языки, сохраняя при этом его тембр и стиль исполнения.
Такая всесторонняя генерация сложна, так как требует одновременного понимания языка (кто говорит, эмоции, тайминг) и акустики (идентичность спикера, просодия, текстура). Seed Audio 1.0 соединяет эти два уровня через унифицированный фреймворк: языковая модель структурирует творческий замысел в элементы управления на уровне сцены, а диффузионный акустический генератор производит финальное аудио в высококачественном латентном пространстве.
Модель доступна через платформу BytePlus. Разработчики могут использовать Volcano Ark API, а для креаторов предусмотрена интеграция в видеоредактор CapCut / Jianying. Внутренние A/B-тесты показали, что Seed Audio 1.0 предпочтительнее при генерации голосов из текста, улучшая удобство использования и качество вывода. Для многосценового аудио, например, в кино, на ТВ или в играх, доля пригодного аудио превысила 90%.
Seed Audio 1.0 — это шаг к более выразительной и контролируемой генерации аудио, которая ближе к тому, как мыслят креаторы, представляя звук целыми сценами, а не набором дорожек. Пока контроль тайминга сосредоточен в основном на диалогах, а максимальная длина сцены ограничена двумя минутами. Но ByteDance обещает расширить возможности для более сложных и длинных проектов.