AI News Watcher
Wednesday, Aug 12, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 12, 2026 · 2 min read · HuggingFace ← Back to feed

LFM2.5-VL-3B видит экраны и кликает по ним — работает на вашем железе daily

Модель отвечает прямо, не рассуждая, для работы на устройстве — и конкурирует с более крупными аналогами.

LFM2.5-VL-3B видит экраны и кликает по ним — работает на вашем железе
Редакция · Daily briefing

Запустить модель, которая понимает изображения и текст, прямо на вашем устройстве — задача непростая. LiquidAI выпустила LFM2.5-VL-3B, способную видеть цифровые экраны, находить объекты и вызывать функции, работая при этом на локальном железе.

Модель LFM2.5-VL-3B от LiquidAI позиционируется как самая vision-language модель для локального запуска. Она понимает документы и экраны, привязывает объекты к запросам и умеет вызывать внешние инструменты. Ключевая особенность — ответы без глубокого рассуждения, что обеспечивает высокую скорость отклика для приложений на устройстве.

Эти возможности стали результатом четырёх основных улучшений по сравнению с предыдущими версиями:

В основе модели лежит визуальный энкодер SigLIP2 400M NaFlex, соединённый с языковым ядром LFM2.5-2.6B. Обучение проводилось на 34 триллионах токенов, с использованием в четыре раза большего объёма визуальных данных (изображения с подписями, OCR, данные для привязки объектов и следования инструкциям). Для поддержки нелатинских языков словарь был расширен до 128 тысяч токенов. Пост-обучение включает управляемую доводку (SFT) с дистилляцией знаний и обучение с подкреплением (RL).

На бенчмарках LFM2.5-VL-3B показала лидерство в своём классе по размеру (3.1B параметров) для задач с реальными изображениями, а также хорошо справляется с чтением цифрового контента, включая документы, графики и элементы пользовательского интерфейса на экране. Она превзошла конкурентов схожего размера, таких как Gemma и Qwen.

Модель демонстрирует эффективный инференс: до 228 токенов в секунду на Apple M5 Max и 116 токенов в секунду на AMD Ryzen AI Max+ 395, потребляя при этом менее 3.3 ГБ памяти. LiquidAI также предлагает квантованные версии в форматах GGUF, ONNX и MLX для разных платформ. Эта модель продолжает стратегию LiquidAI по созданию эффективных решений для периферийных устройств. Компания фокусируется на оптимизации задержки и энергопотребления, а также на применении архитектур, таких как MoE (смесь экспертов), которые обычно считаются неэффективными для небольших моделей, но позволяют достичь высокого качества при низких вычислительных затратах.

Выпуск LFM2.5-VL-3B от LiquidAI подтверждает тенденцию к переносу сложных ИИ-возможностей на локальные устройства. Это открывает путь для создания более быстрых и автономных агентов, способных взаимодействовать с цифровыми интерфейсами без задержек облака. Однако, для широкого внедрения критичной будет не только производительность, но и простота интеграции модели в существующие продукты.

Дополнительные источники

  1. LFM2.5-VL-3B - Hugging Face
  2. LFM2-8B-A1B: An Efficient On-device Mixture-of-Experts
  3. liquid.ai
  4. ycombinator.com

Источники

  1. https://huggingface.co/blog/LiquidAI/lfm2-5-vl-3b external
→ Опубликовано в Telegram: @agentic_ai_news/852