Длинный контекст в больших языковых моделях всегда был дорогим удовольствием, особенно для мультимодальных задач. С новыми версиями Transformers v5.16.0 и v5.16.1, Hugging Face предлагает решение, которое снижает эти затраты в разы, благодаря моделям GLM-5.3-Flash и Qwen4-Exp.
GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. Она построена на новой базовой модели с переработанной архитектурой и рецептом обучения. Обладая 320 миллиардами общих и 18 миллиардами активных параметров, GLM-5.3-Flash превосходит предыдущую GLM-5.2 по бенчмаркам и в реальных задачах, при этом ее стоимость в десять раз ниже. По задачам кодирования и агентским бенчмаркам модель приближается к Claude Opus 4.8.
Впервые в серии GLM модель использует гибридную архитектуру, сочетающую разреженное и линейное внимание. Это снижает затраты на обслуживание длинного контекста, сохраняя его точность. Модель также применяет Manifold-Constrained Hyper-Connections (mHC) для повышения эффективности масштабирования и обучена на новейшем мультимодальном корпусе из 30 триллионов токенов.
В версии Transformers v5.16.0 добавлена поддержка Qwen4-Exp, которая также использует гибридную текстовую и мультимодальную архитектуру. В ней представлены три ключевых компонента: GatedResidual (GR), Qwen Sparse Attention (QSA) и Per-Layer Embedding (PLE). QSA, использующая несколько головок запросов для оценки сжатых блоков ключей, делает Qwen4-Exp первой гибридной архитектурой, интегрирующей линейное и разреженное внимание. Это существенно повышает эффективность вывода для рабочих нагрузок с длинным контекстом.
Среди других моделей, появившихся в Transformers v5.16.0, стоит отметить:
- Step-3.7-Flash — разреженная модель Mixture-of-Experts (MoE) для зрения и языка, насчитывающая 198 миллиардов параметров, с визуальным кодером на 1.8 миллиарда параметров. Она поддерживает предсказание нескольких токенов и динамическую мозаичную обработку изображений.
- CohereCompass — базовая архитектура для небольших, специализированных визуально-языковых моделей.
- Добавлена поддержка квантования NVFP4 через ядра Hugging Face, что позволяет квантовать веса BF16 на лету и сокращает потребление памяти примерно на 50%.
Этот релиз Hugging Face Transformers показывает, что будущее за моделями, которые не только мультимодальны, но и архитектурно адаптированы для экономной работы с большими объемами данных. Инженерам стоит обратить внимание на эти подходы при выборе моделей для работы с длинными контекстами, особенно учитывая снижение стоимости вычислений.