AI News Watcher
Monday, Aug 24, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 24, 2026 · 2 min read · Cohere ← Back to feed

Tiny Aya Vision: 70+ языков и зрение — впервые в модели меньше 4B daily

Обещает визуальное понимание на 70+ языках для устройств с ограниченными ресурсами, включая редкие.

Tiny Aya Vision: 70+ языков и зрение — впервые в модели меньше 4B
Редакция · Daily briefing

Большинство визуально-языковых моделей (VLM) либо велики и требуют облака, либо малы, но работают преимущественно с английским. Исследователи из Cohere Labs Community представили Tiny Aya Vision — первую модель меньше 4 миллиардов параметров, которая объединяет визуальное понимание с поддержкой более 70 языков.

Tiny Aya Vision текстовой модели Tiny Aya (3.35B параметров, 70+ языков), добавляя к ней визуальные функции. Разработчики утверждают, что это первая в своём роде модель, которая сочетает зрение и поддержку 70+ языков при размере менее 4B параметров, особенно для языков с ограниченными ресурсами. Это отличает её от других небольших VLM, таких как Qwen3-VL-2GB (2B, ~32 языка) или SmolVLM (<4B, англоцентричная).

Модель использует архитектуру позднего слияния (late-fusion design), аналогичную Aya Vision и LLaVA. В её основе:

Обучение проходило в два этапа: сначала тренировался только коннектор на 558 тысячах пар изображение-подпись, затем LoRA добавлялась к LLM с использованием мультиязычных данных. Ключевым третьим шагом стало кросс-модальное слияние весов — линейная интерполяция между весами мультимодальной и исходной текстовой модели. Это должно восстанавливать текстовую производительность и улучшать мультиязычное визуальное распознавание, как это показали более крупные модели Aya Vision 8B и 32B.

Текущие результаты ранние, модель находится в версии v0. На тесте CVQA точность поднялась с 25.6% (случайное угадывание) до 45.5% после англоязычной настройки, что подтверждает реальное визуальное понимание. Однако тест CVQA частично решается языковыми знаниями, что не позволяет полностью отделить визуальное мышление. Производительность по языкам варьируется: португальский и испанский лидируют (~50%+), а сингальский, киньяруанда и оромо отстают (~21%).

Это пока лишь первый этап разработки. Показатели по низкоресурсным языкам могут улучшиться после обучения на мультиязычных SFT-данных и культурно разнообразных визуальных данных. Также предстоит выяснить, сохранит ли кросс-модальное слияние весов свою эффективность при таком малом размере модели, где меньше избыточности параметров.

Tiny Aya Vision — это заявка на мультиязычный ИИ с визуальным пониманием для устройств с ограниченными ресурсами, где до сих пор не было подходящих моделей. Однако текущие результаты относятся к ранней версии, и предстоит выяснить, насколько эффективно сработают ключевые оптимизации при таком малом размере.

Дополнительные источники

  1. Cohere-Labs-Community / expedition-tayavision
  2. CohereLabs/aya-vision-8b
  3. Visual Instruction Tuning
  4. maya-multimodal/maya
  5. Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier
  6. siliconflow.com
  7. arxiv.org
  8. cohere.com
  9. aaai.org

Источники

  1. https://x.com/Cohere_Labs/status/2091905296071307274 external
  2. https://labscommunity.cohere.com/blog/2026/tiny-aya-vision/ blog
→ Опубликовано в Telegram: @agentic_ai_news/908