Большинство визуально-языковых моделей (VLM) либо велики и требуют облака, либо малы, но работают преимущественно с английским. Исследователи из Cohere Labs Community представили Tiny Aya Vision — первую модель меньше 4 миллиардов параметров, которая объединяет визуальное понимание с поддержкой более 70 языков.
Tiny Aya Vision текстовой модели Tiny Aya (3.35B параметров, 70+ языков), добавляя к ней визуальные функции. Разработчики утверждают, что это первая в своём роде модель, которая сочетает зрение и поддержку 70+ языков при размере менее 4B параметров, особенно для языков с ограниченными ресурсами. Это отличает её от других небольших VLM, таких как Qwen3-VL-2GB (2B, ~32 языка) или SmolVLM (<4B, англоцентричная).
Модель использует архитектуру позднего слияния (late-fusion design), аналогичную Aya Vision и LLaVA. В её основе:
- Замороженный визуальный кодировщик — SigLIP2-so400m (~400M параметров) обрабатывает изображения размером 384x384 и выдаёт 729 патч-эмбеддингов.
- Обучаемый коннектор — Pixel Shuffle (2x2) и двухслойный SwiGLU MLP (~12M параметров). Он уменьшает последовательность эмбеддингов до 196 токенов, жертвуя пространственным разрешением ради глубины, и проецирует их в пространство эмбеддингов языковой модели.
- Замороженный LLM-бэкбон — Tiny Aya Global (3.35B параметров, 70+ языков).
- Адаптация LLM — LoRA с рангом 256 (~280M параметров) позволяет бэкбону адаптироваться к визуальному вводу без полной донастройки.
Обучение проходило в два этапа: сначала тренировался только коннектор на 558 тысячах пар изображение-подпись, затем LoRA добавлялась к LLM с использованием мультиязычных данных. Ключевым третьим шагом стало кросс-модальное слияние весов — линейная интерполяция между весами мультимодальной и исходной текстовой модели. Это должно восстанавливать текстовую производительность и улучшать мультиязычное визуальное распознавание, как это показали более крупные модели Aya Vision 8B и 32B.
Текущие результаты ранние, модель находится в версии v0. На тесте CVQA точность поднялась с 25.6% (случайное угадывание) до 45.5% после англоязычной настройки, что подтверждает реальное визуальное понимание. Однако тест CVQA частично решается языковыми знаниями, что не позволяет полностью отделить визуальное мышление. Производительность по языкам варьируется: португальский и испанский лидируют (~50%+), а сингальский, киньяруанда и оромо отстают (~21%).
Это пока лишь первый этап разработки. Показатели по низкоресурсным языкам могут улучшиться после обучения на мультиязычных SFT-данных и культурно разнообразных визуальных данных. Также предстоит выяснить, сохранит ли кросс-модальное слияние весов свою эффективность при таком малом размере модели, где меньше избыточности параметров.
Tiny Aya Vision — это заявка на мультиязычный ИИ с визуальным пониманием для устройств с ограниченными ресурсами, где до сих пор не было подходящих моделей. Однако текущие результаты относятся к ранней версии, и предстоит выяснить, насколько эффективно сработают ключевые оптимизации при таком малом размере.