Сжатие больших языковых моделей (LLM) часто требует жертвовать качеством ради размера. Но Hugging Face нашла способ обойти этот компромисс, обратившись к физике: их новый метод позволил сократить Llama-3.3-70B-Instruct вдвое и даже улучшить её результаты на бенчмарке MMLU.
Hugging Face представила новый подход к обрезке LLM (pruning), где удаление целых блоков трансформера превращается в задачу оптимизации Изинга. Это позволяет учесть, как решения об удалении одного блока влияют на другие, чего не делают традиционные методы, оценивающие каждый блок по отдельности.
При сжатии Llama-3.3-70B-Instruct на 50% новый подход показал прирост в 23 процентных пункта на бенчмарке MMLU по сравнению с лучшими существующими методами удаления блоков.
Метод универсален и применим к любым архитектурам, что было продемонстрировано на модели NVIDIA-Nemotron-3-Nano-30B-A3B-FP8. Он вычислительно эффективен, требуя лишь прямых и обратных проходов на калибровочном наборе данных. Для решения сложных оптимизационных задач используются классические или квантово-вдохновленные алгоритмы.
Подход Hugging Face показывает, что глубокое сжатие LLM возможно без потери качества, и даже с его улучшением. Но пока неясно, насколько легко он интегрируется в существующие MLOps-пайплайны для массового применения вне исследовательских задач.