Сложные AI-агенты, способные выполнять многошаговые задачи и вызывать инструменты, обычно требуют облачных серверов. Новая модель LFM2.5-2.6B от LiquidAI меняет это, позволяя запускать такие системы прямо на обычных устройствах — от ноутбуков до смартфонов.
Модель LFM2.5-2.6B разработана для работы полностью на устройстве, поддерживая вызов инструментов и многошаговые рабочие процессы. Это позволяет разработчикам внедрять агентов повсеместно, сохранять данные приватными и масштабировать использование без затрат на облачные вычисления.
Несмотря на свои 2.6 миллиарда параметров, LFM2.5-2.6B демонстрирует производительность, сравнимую с моделями вчетверо крупнее, например, Gemma-4-E2B-it (5.1B) и Qwen3.5-4B (4.7B). По результатам бенчмарков, модель:
- Лидирует по следованию инструкциям (IFBench, Multi-IF, IFStruct).
- Выигрывает почти во всех тестах на использование инструментов (ToolSandbox, τ³-Bench Banking, PinchBench, BrowseComp+), уступая только Qwen3.5-9B в BFCLv4.
- Соревнуется с Qwen и превосходит Gemma в агентских задачах.
- Хорошо справляется со знаниями и математикой, но уступает в кодировании более крупным моделям.
Модель обучена на ~34 триллионах токенов и имеет контекстное окно в 128 тысяч токенов. Пост-тренинг, превращающий базовую модель в агента, включает четыре этапа:
- Supervised Fine-tuning (SFT) — два раунда тонкой настройки, с акцентом на агентские данные, такие как использование инструментов и веб-поиск.
- Teacher specialization — обучение специализированных "учителей" для разных областей (математика, код, использование инструментов).
- Multi-domain On-Policy Distillation (MOPD) — дистилляция знаний специализированных "учителей" в одну модель-ученика.
- Agentic Reinforcement Learning (Agentic RL) — многоходовое обучение с подкреплением в реальных агентских средах, где модель учится работать с различными инструментами и системными промптами.
Модель эффективно работает, достигая 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на процессоре AMD Ryzen, потребляя при этом менее 2.5 ГБ оперативной памяти. Она поддерживает 11 языков, включая русский.
LFM2.5-2.6B открывает путь к созданию автономных AI-агентов, которые работают без интернета, сохраняя пользовательские данные приватными и исключая расходы на облачные вычисления. Это может изменить подходы к разработке и внедрению AI, особенно для инженеров, работающих с on-device моделями. Пока неясно, насколько быстро экосистема инструментов для таких агентов адаптируется к локальному развертыванию.