Запустить модель, которая понимает изображения и текст, прямо на вашем устройстве — задача непростая. LiquidAI выпустила LFM2.5-VL-3B, способную видеть цифровые экраны, находить объекты и вызывать функции, работая при этом на локальном железе.
Модель LFM2.5-VL-3B от LiquidAI позиционируется как самая vision-language модель для локального запуска. Она понимает документы и экраны, привязывает объекты к запросам и умеет вызывать внешние инструменты. Ключевая особенность — ответы без глубокого рассуждения, что обеспечивает высокую скорость отклика для приложений на устройстве.
Эти возможности стали результатом четырёх основных улучшений по сравнению с предыдущими версиями:
- Понимание экранов и интерфейсов — уверенная работа с цифровыми экранами на разных устройствах.
- Привязка объектов (grounding) — улучшенное обнаружение и привязка объектов по запросам на естественном языке.
- Ввод нескольких изображений — улучшенная способность рассуждать на основе нескольких входных изображений.
- Вызов функций (function calling) — улучшенная способность вызывать функции как в текстовых, так и в визуально-текстовых сценариях.
В основе модели лежит визуальный энкодер SigLIP2 400M NaFlex, соединённый с языковым ядром LFM2.5-2.6B. Обучение проводилось на 34 триллионах токенов, с использованием в четыре раза большего объёма визуальных данных (изображения с подписями, OCR, данные для привязки объектов и следования инструкциям). Для поддержки нелатинских языков словарь был расширен до 128 тысяч токенов. Пост-обучение включает управляемую доводку (SFT) с дистилляцией знаний и обучение с подкреплением (RL).
На бенчмарках LFM2.5-VL-3B показала лидерство в своём классе по размеру (3.1B параметров) для задач с реальными изображениями, а также хорошо справляется с чтением цифрового контента, включая документы, графики и элементы пользовательского интерфейса на экране. Она превзошла конкурентов схожего размера, таких как Gemma и Qwen.
Модель демонстрирует эффективный инференс: до 228 токенов в секунду на Apple M5 Max и 116 токенов в секунду на AMD Ryzen AI Max+ 395, потребляя при этом менее 3.3 ГБ памяти. LiquidAI также предлагает квантованные версии в форматах GGUF, ONNX и MLX для разных платформ. Эта модель продолжает стратегию LiquidAI по созданию эффективных решений для периферийных устройств. Компания фокусируется на оптимизации задержки и энергопотребления, а также на применении архитектур, таких как MoE (смесь экспертов), которые обычно считаются неэффективными для небольших моделей, но позволяют достичь высокого качества при низких вычислительных затратах.
Выпуск LFM2.5-VL-3B от LiquidAI подтверждает тенденцию к переносу сложных ИИ-возможностей на локальные устройства. Это открывает путь для создания более быстрых и автономных агентов, способных взаимодействовать с цифровыми интерфейсами без задержек облака. Однако, для широкого внедрения критичной будет не только производительность, но и простота интеграции модели в существующие продукты.