Обучение маленькой модели на знаниях большой (дистилляция знаний) — это способ сделать LLM доступнее. Но сам процесс обычно требует сотен GPU и до 250 ГБ VRAM на одну итерацию. Hugging Face и Multiverse Computing нашли два системных изменения, которые радикально удешевляют дистилляцию, позволяя запускать её в масштабе.
До сих пор дистилляция была одним из самых дорогих этапов в пайплайне разработки LLM. Стандартный подход, онлайн-дистилляция с использованием KL-расходимости, требует одновременной загрузки учительской и ученической моделей. На каждом шаге обучения учитель выполняет полный прямой проход, чтобы получить распределение выходных вероятностей, а ученик обучается ему соответствовать. При этом две полновходные матрицы вероятностей должны храниться в памяти для каждого токена. Например, для gpt-oss-120b с длиной последовательности 32K и размером батча 4 только тензор вероятностей учителя занимает около 50 ГБ VRAM. С учётом градиентов, активаций, весов модели и состояний оптимизатора пиковое потребление VRAM может достигать 250 ГБ, что превышает возможности даже самых GPU, таких как H200 или B200.
В блоге от 10 августа 2026 года Hugging Face и Multiverse Computing представили два системных изменения, которые решают эту проблему:
- Офлайн-дистилляция — вместо повторного вычисления учителя на каждом шаге, его выход вычисляется однократно. Затем кэшируются 100 наиболее вероятных токенов для каждой позиции. Ученическая модель обучается на этом кэше, поэтому учитель не должен постоянно находиться в памяти вместе с учеником.
- Оптимизированная функция потерь KL-расходимости (Fused Chunked KL Loss) — новая, более эффективная по памяти функция потерь, которая обрабатывает данные по частям. Она позволяет избежать материализации полной матрицы
размер словаря × длина последовательности, что сокращает потребление VRAM по сравнению со стандартными реализациями в библиотеках вроде PyTorch.
Вместе эти два изменения сокращают затраты на обучение настолько, что восстановление качества моделей с длинным контекстом становится возможным даже на одной GPU. Это также делает крупномасштабные эксперименты с дистилляцией практически осуществимыми. Пиковое потребление VRAM снижается примерно со 250 ГБ до 128 ГБ, что подтверждено бенчмарками.
Эти два изменения делают дистилляцию знаний не просто технически сложным процессом, но и экономически доступным для широкого круга разработчиков. Возможность проводить обучение на одной GPU и экспериментировать в масштабе открывает путь к появлению более компактных и моделей, но их принятие будет зависеть от того, насколько легко новые методы интегрируются в существующие пайплайны.