AI News Watcher
Monday, Sep 21, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 21, 2026 · 1 min read · HuggingFace ← Back to feed

Hugging Face сжимает LLM вдвое и улучшает MMLU на 23% — с помощью физики daily

Обычные методы не учитывают, как блоки LLM влияют друг на друга — новый подход это исправляет, используя оптимизацию Изинга.

Hugging Face сжимает LLM вдвое и улучшает MMLU на 23% — с помощью физики
Редакция · Daily briefing

Сжатие больших языковых моделей (LLM) часто требует жертвовать качеством ради размера. Но Hugging Face нашла способ обойти этот компромисс, обратившись к физике: их новый метод позволил сократить Llama-3.3-70B-Instruct вдвое и даже улучшить её результаты на бенчмарке MMLU.

Hugging Face представила новый подход к обрезке LLM (pruning), где удаление целых блоков трансформера превращается в задачу оптимизации Изинга. Это позволяет учесть, как решения об удалении одного блока влияют на другие, чего не делают традиционные методы, оценивающие каждый блок по отдельности.

При сжатии Llama-3.3-70B-Instruct на 50% новый подход показал прирост в 23 процентных пункта на бенчмарке MMLU по сравнению с лучшими существующими методами удаления блоков.

Метод универсален и применим к любым архитектурам, что было продемонстрировано на модели NVIDIA-Nemotron-3-Nano-30B-A3B-FP8. Он вычислительно эффективен, требуя лишь прямых и обратных проходов на калибровочном наборе данных. Для решения сложных оптимизационных задач используются классические или квантово-вдохновленные алгоритмы.

Подход Hugging Face показывает, что глубокое сжатие LLM возможно без потери качества, и даже с его улучшением. Но пока неясно, насколько легко он интегрируется в существующие MLOps-пайплайны для массового применения вне исследовательских задач.

Дополнительные источники

  1. LLM Compression by Block Removal with Constrained Binary Optimization
  2. CompactifAI/Block_removal_through_constrained_binary_optimization
  3. huggingface/tokenizers
  4. Tokenization in Transformers v5: Simpler, Clearer, and More Modular
  5. tokenizers v1 performance benchmarks
  6. Tokenizers documentation
  7. arxiv.org

Источники

  1. https://huggingface.co/blog/MultiverseComputingCAI/pruning-llms-like-a-physicist-block-removal-as-an external
  2. https://huggingface.co/blog/tokenizers-v1 external
→ Опубликовано в Telegram: @agentic_ai_news/1071