Добиться точной эмоциональной окраски в синтезированной речи обычно требовало десятков попыток и догадок. Теперь Runway интегрировал Eleven v3, модель от ElevenLabs, в свой API, что позволяет инженерам напрямую управлять интонациями и эмоциями голоса, используя обычные текстовые метки.
Ключевая особенность Eleven v3 — аудио теги: это короткие, заключенные в квадратные скобки фразы, например [смех], [шепот], [возбужденный], которые модель интерпретирует как указания по исполнению, а не как слова для произнесения. Это дает гранулированный контроль над эмоциональной подачей, темпом и тоном речи, заменяя более сложный язык разметки SSML (Speech Synthesis Markup Language).
Модель Eleven v3, которая поддерживает более 70 языков, работает с теми же предустановленными голосами Runway, что и Multilingual v2. Для начала работы достаточно использовать стандартный эндпоинт text to speech в Runway API.
Тарификация сервиса составляет 1 кредит за каждые 50 символов, с минимальным списанием в 1 кредит.
Интеграция Eleven v3 в API Runway упрощает процесс создания выразительной речи, предлагая прямой и интуитивно понятный метод управления эмоциями. Это позволяет разработчикам точно задавать характер произношения прямо в скрипте, минуя необходимость многократных перегенераций, но при этом сохраняется стандартная для подобных сервисов модель оплаты за объем текста.