AI News Watcher
Monday, Aug 10, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 10, 2026 · 2 min read · HuggingFace ← Back to feed

Сжать LLM стало вдвое дешевле: хватит одной GPU daily

Учитель больше не сидит в памяти вместе с учеником, сокращая пиковое потребление VRAM со 250 до 128 ГБ.

Сжать LLM стало вдвое дешевле: хватит одной GPU
Редакция · Daily briefing

Обучение маленькой модели на знаниях большой (дистилляция знаний) — это способ сделать LLM доступнее. Но сам процесс обычно требует сотен GPU и до 250 ГБ VRAM на одну итерацию. Hugging Face и Multiverse Computing нашли два системных изменения, которые радикально удешевляют дистилляцию, позволяя запускать её в масштабе.

До сих пор дистилляция была одним из самых дорогих этапов в пайплайне разработки LLM. Стандартный подход, онлайн-дистилляция с использованием KL-расходимости, требует одновременной загрузки учительской и ученической моделей. На каждом шаге обучения учитель выполняет полный прямой проход, чтобы получить распределение выходных вероятностей, а ученик обучается ему соответствовать. При этом две полновходные матрицы вероятностей должны храниться в памяти для каждого токена. Например, для gpt-oss-120b с длиной последовательности 32K и размером батча 4 только тензор вероятностей учителя занимает около 50 ГБ VRAM. С учётом градиентов, активаций, весов модели и состояний оптимизатора пиковое потребление VRAM может достигать 250 ГБ, что превышает возможности даже самых GPU, таких как H200 или B200.

В блоге от 10 августа 2026 года Hugging Face и Multiverse Computing представили два системных изменения, которые решают эту проблему:

Вместе эти два изменения сокращают затраты на обучение настолько, что восстановление качества моделей с длинным контекстом становится возможным даже на одной GPU. Это также делает крупномасштабные эксперименты с дистилляцией практически осуществимыми. Пиковое потребление VRAM снижается примерно со 250 ГБ до 128 ГБ, что подтверждено бенчмарками.

Эти два изменения делают дистилляцию знаний не просто технически сложным процессом, но и экономически доступным для широкого круга разработчиков. Возможность проводить обучение на одной GPU и экспериментировать в масштабе открывает путь к появлению более компактных и моделей, но их принятие будет зависеть от того, насколько легко новые методы интегрируются в существующие пайплайны.

Дополнительные источники

  1. CompactifAI/Full-Chunked-KL-Loss
  2. Muse Glimmer Model Card
  3. Introducing Muse Spark: MSL’s First Model, Purpose-Built to Prioritize People
  4. huggingface.co
  5. snorkel.ai
  6. ycombinator.com

Источники

  1. https://huggingface.co/blog/MultiverseComputingCAI/efficient-knowledge-distillation external
  2. https://huggingface.co/blog/muse-glimmer external
→ Опубликовано в Telegram: @agentic_ai_news/837