AI News Watcher
Thursday, Aug 20, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 20, 2026 · 1 min read · HuggingFace ← Back to feed

LFM2.5 с DSpark: до 3.2х быстрее — и без потерь daily

DSpark ускоряет инференс втрое, сохраняя качество — это критично для локальных агентов.

LFM2.5 с DSpark: до 3.2х быстрее — и без потерь
Редакция · Daily briefing

Основная задержка в инференсе больших языковых моделей часто связана с памятью, а не с вычислениями. Hugging Face представил черновики моделей DSpark для линейки LFM2.5, которые обещают ускорение до 3.2 раза без потери качества вывода.

DSpark — это метод спекулятивного декодирования, который использует лёгкую черновую модель для генерации кандидатов токенов. Целевая модель затем проверяет их за один проход, распределяя стоимость загрузки весов по нескольким токенам.

Это даёт до 3.18-кратного увеличения пропускной способности на GPU и до 2.87-кратного прироста на устройстве. При этом качество вывода остаётся идентичным жадному декодированию, поскольку черновой токен принимается только при полном соответствии распределению целевой модели.

Технология основана на трёх компонентах:

Черновые модели DSpark относительно невелики (около 300М параметров) и выпущены для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B.

Сокращается задержка при вызове функций: для LFM2.5-2.6B она упала на 57%. Это открывает путь к агентному инференсу прямо на устройствах.

Решение поддерживает llama.cpp (с экспериментальными Metal-ядрами) и SGLang. Тесты проводились на M4 Max MacBook Pro (на устройстве) и H100 80 GB (GPU).

DSpark показывает, что скорость LLM зависит не только от размера модели, но и от инженерии декодирования. Для разработчиков это шанс снизить операционные затраты и развернуть более отзывчивых агентов прямо на устройствах. Hugging Face пока выпустил черновики моделей DSpark, и их широкое внедрение и независимые замеры производительности ещё впереди.

Дополнительные источники

  1. https://www.ultralytics.com/glossary/tensor-parallelism
  2. https://www.minimax.io/blog/minimax-h3
  3. https://huggingface.co/MiniMaxAI/MiniMax-Music3
  4. https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B
  5. mindstudio.ai

Источники

  1. https://github.com/huggingface/diffusers/releases/tag/v0.40.0 engineering
  2. https://huggingface.co/blog/LiquidAI/lfm25-dspark external
→ Опубликовано в Telegram: @agentic_ai_news/894