Основная задержка в инференсе больших языковых моделей часто связана с памятью, а не с вычислениями. Hugging Face представил черновики моделей DSpark для линейки LFM2.5, которые обещают ускорение до 3.2 раза без потери качества вывода.
DSpark — это метод спекулятивного декодирования, который использует лёгкую черновую модель для генерации кандидатов токенов. Целевая модель затем проверяет их за один проход, распределяя стоимость загрузки весов по нескольким токенам.
Это даёт до 3.18-кратного увеличения пропускной способности на GPU и до 2.87-кратного прироста на устройстве. При этом качество вывода остаётся идентичным жадному декодированию, поскольку черновой токен принимается только при полном соответствии распределению целевой модели.
Технология основана на трёх компонентах:
- Параллельный бэкбон в стиле DFlash, который генерирует скрытые состояния для всех черновых токенов за один проход.
- Легкая последовательная голова, моделирующая зависимость между соседними токенами для повышения уровня принятия.
- Верификатор с расписанием уверенности, который предсказывает вероятность выживания токена и отсекает низкоуверенные суффиксы.
Черновые модели DSpark относительно невелики (около 300М параметров) и выпущены для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B.
Сокращается задержка при вызове функций: для LFM2.5-2.6B она упала на 57%. Это открывает путь к агентному инференсу прямо на устройствах.
Решение поддерживает llama.cpp (с экспериментальными Metal-ядрами) и SGLang. Тесты проводились на M4 Max MacBook Pro (на устройстве) и H100 80 GB (GPU).
DSpark показывает, что скорость LLM зависит не только от размера модели, но и от инженерии декодирования. Для разработчиков это шанс снизить операционные затраты и развернуть более отзывчивых агентов прямо на устройствах. Hugging Face пока выпустил черновики моделей DSpark, и их широкое внедрение и независимые замеры производительности ещё впереди.