До сих пор омнимодальные модели в основном понимали мультимедийный контент. Теперь Alibaba с Qwen3.8-Omni-Flash переводит их в категорию активных агентов, способных планировать задачи, вызывать инструменты и выполнять творческую работу с аудио и видео.
Новая модель Qwen сфокусирована на расширении агентских возможностей в реальных сценариях. Она поддерживает ввод текста, изображений, аудио и видео с окном контекста до 1 миллиона токенов, при этом сохраняя текстовую производительность на уровне текстовых моделей такого же размера. Заявлено, что средний балл Qwen3.8-Omni-Flash по 29 оценкам улучшился более чем на 25% по сравнению с предыдущей моделью Qwen3.5-Omni-Plus.
Особое внимание уделено снижению стоимости использования и повышению точности в агентских сценариях:
- Стоимость API — цена за час аудиовхода снизилась более чем на 98%, а за час аудиовизуального ввода — более чем на 93%.
- Агентские бенчмарки — модель улучшилась на 36.5 баллов в WildClawBench-MM и на 22.3 балла в AgenticVBench, набрав 69.6 в UniClawBench.
- Аудиовизуальное понимание — прирост на 8.3 балла в LongAudioSpan и на 9.6 балла в OmniVideoBench.
По данным llm-stats.com, Qwen3.8-Omni-Flash лидирует по общему показателю LLM Stats Score с 49.1 балла против 12.0 у Gemini 1.5 Pro. Qwen3.8-Omni-Flash также примерно в 19 раз дешевле за токен при смешанном соотношении ввода/вывода 3:1. Модель демонстрирует лучшие показатели в индексах рассуждений (48.8 против 11.8 у Gemini) и кодирования (36.1 против 4.4). При этом Gemini 1.5 Pro предлагает большее окно контекста — до 2 097 152 токенов, что делает её предпочтительнее для очень длинных документов.
Предыдущие модели Qwen уже выделялись на рынке благодаря архитектуре Thinker-Talker, которая разделяет компонент рассуждений и синтеза речи, позволяя стримить голосовой вывод до завершения полного ответа. Кроме того, Qwen3.5-Omni предлагала варианты с открытыми весами для самостоятельного размещения, что снижало интеграционные барьеры благодаря совместимости API с OpenAI.
Qwen3.8-Omni-Flash делает мультимедийные агентские возможности доступными и экономичными, резко снижая стоимость API и предлагая сильную производительность против конкурентов. Это смещает акцент с простого понимания контента на его активную обработку и создание, но вопрос о возможности самостоятельного размещения для этой версии остаётся открытым.