Синхронный перевод всегда требовал не только скорости, но и глубокого понимания контекста, включая того, кто именно говорит. Alibaba Cloud представила Qwen3.8-LiveTranslate, которая делает большой шаг к естественности, научившись различать голоса и сохранять смысловые связи в реальном времени.
Qwen3.8-LiveTranslate, работающая на платформе DashScope API как модель Flash-уровня, предлагает низкую задержку и синхронизированный двуязычный вывод. Её главные нововведения расширяют возможности синхронного перевода:
- Разделение говорящих — модель отличает разных участников беседы и атрибутирует каждую фразу конкретному человеку. Это также помогает точнее сохранять тембр голоса при синтезе переведённой речи.
- Синхронизированный вывод — оригинал и перевод отображаются одновременно, что облегчает проверку и моментальное понимание. Это закладывает основу для таких функций, как субтитры и организация контента.
- Долгий контекст — модель использует предыдущие фразы и исторический контекст беседы, чтобы уточнять имена и терминологию, делая перевод более точным и последовательным.
Благодаря новой Interleave-архитектуре, которая объединяет аудио и текст в единый поток, модель заметно улучшила качество перевода. Средняя задержка (LAAL) снизилась с 2.8 до 2.3 секунды. Qwen3.8-LiveTranslate превосходит предыдущие версии и большинство современных систем по точности, беглости и краткости перевода, а также по показателю ошибок диаризации (DER) на наборах Omnilingua-MSpeaker и FLEURS.
Модель поддерживает перевод аудиовхода и текстового вывода для 60 языков, а также синтез речи на 29 языках. Через API можно отправлять не только аудио, но и изображения как визуальный контекст, что дополнительно повышает точность перевода в сложных сценариях.
Эти улучшения делают Qwen3.8-LiveTranslate применимой в более сложных и динамичных сценариях, где важны не только слова, но и кто их произносит. Однако, как и любая технология перевода, она требует тонкой настройки для специфических терминов и акцентов, которые можно задать через API.