AI News Watcher
Wednesday, Aug 26, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 26, 2026 · 2 min read · HuggingFace ← Back to feed

Hugging Face Transformers: GLM-5.3-Flash удешевляет длинный контекст в 10 раз daily

Новые гибридные архитектуры сочетают разреженное и линейное внимание, приближаясь к Claude Opus в сложных задачах.

Hugging Face Transformers: GLM-5.3-Flash удешевляет длинный контекст в 10 раз
Редакция · Daily briefing

Длинный контекст в больших языковых моделях всегда был дорогим удовольствием, особенно для мультимодальных задач. С новыми версиями Transformers v5.16.0 и v5.16.1, Hugging Face предлагает решение, которое снижает эти затраты в разы, благодаря моделям GLM-5.3-Flash и Qwen4-Exp.

GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. Она построена на новой базовой модели с переработанной архитектурой и рецептом обучения. Обладая 320 миллиардами общих и 18 миллиардами активных параметров, GLM-5.3-Flash превосходит предыдущую GLM-5.2 по бенчмаркам и в реальных задачах, при этом ее стоимость в десять раз ниже. По задачам кодирования и агентским бенчмаркам модель приближается к Claude Opus 4.8.

Впервые в серии GLM модель использует гибридную архитектуру, сочетающую разреженное и линейное внимание. Это снижает затраты на обслуживание длинного контекста, сохраняя его точность. Модель также применяет Manifold-Constrained Hyper-Connections (mHC) для повышения эффективности масштабирования и обучена на новейшем мультимодальном корпусе из 30 триллионов токенов.

В версии Transformers v5.16.0 добавлена поддержка Qwen4-Exp, которая также использует гибридную текстовую и мультимодальную архитектуру. В ней представлены три ключевых компонента: GatedResidual (GR), Qwen Sparse Attention (QSA) и Per-Layer Embedding (PLE). QSA, использующая несколько головок запросов для оценки сжатых блоков ключей, делает Qwen4-Exp первой гибридной архитектурой, интегрирующей линейное и разреженное внимание. Это существенно повышает эффективность вывода для рабочих нагрузок с длинным контекстом.

Среди других моделей, появившихся в Transformers v5.16.0, стоит отметить:

Этот релиз Hugging Face Transformers показывает, что будущее за моделями, которые не только мультимодальны, но и архитектурно адаптированы для экономной работы с большими объемами данных. Инженерам стоит обратить внимание на эти подходы при выборе моделей для работы с длинными контекстами, особенно учитывая снижение стоимости вычислений.

Дополнительные источники

  1. GLM-5.3-Flash
  2. Qwen4-Exp
  3. Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers
  4. Claude Opus 4.8 vs GLM-5.3: Benchmarks, Pricing & Which Is Better in 2026
  5. NVFP4 Quantization Algorithm Overview
  6. Bitsandbytes
  7. GLM-5V-Turbo: What Developers Should Know in 2026
  8. GLM-5.3-Flash Intelligence, Performance and Price Analysis (artificialanalysis.ai)

Источники

  1. https://github.com/huggingface/transformers/releases/tag/v5.16.1 engineering
  2. https://github.com/huggingface/transformers/releases/tag/v5.16.0 engineering
  3. https://huggingface.co/blog/train-multi-vector-encoder external
→ Опубликовано в Telegram: @agentic_ai_news/921