AI News Watcher
Wednesday, Aug 26, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 26, 2026 · 2 min read · OpenRouter ← Back to feed

GLM 5.3 Flash: миллион токенов и видео — вдвое дешевле Gemini daily

Первая мультимодальная модель Z.ai с гибридной архитектурой снижает затраты на длинный контекст.

Контекст
1 048 576 токенов
Доступ
OpenRouter
GLM 5.3 Flash: миллион токенов и видео — вдвое дешевле Gemini
Редакция · Daily briefing

Модели, способные обрабатывать миллион токенов, а также видео и изображения, обычно обходятся дорого. Z.ai: GLM 5.3 Flash, представленная на OpenRouter, предлагает эти флагманские возможности, но с ценой за токен вдвое ниже, чем у Google Gemini 1.5 Pro.

Модель Z.ai: GLM 5.3 Flash, запущенная на платформе OpenRouter 26 августа 2026 года, выделяется своим контекстным окном в 1 048 576 токенов. Она способна принимать ввод в виде текста, изображений и видео, выдавая текстовый ответ.

Разработчик Z.ai заявляет, что GLM 5.3 Flash, имея 18 миллиардов активных параметров (из 320 миллиардов общих), превосходит предыдущую версию GLM-5.2 в бенчмарках и реальных задачах. По заявлениям компании, по производительности в задачах кодирования и агентных сценариях она приближается к Claude Opus 4.8.

Ключевое преимущество модели — её стоимость. По сравнению с Google Gemini 1.5 Pro, GLM 5.3 Flash примерно вдвое дешевле за миллион токенов: $1.40 против $2.50 за вход и $4.40 против $10.00 за выход. Z.ai также утверждает, что модель в десять раз дешевле в обслуживании, чем GLM-5.2.

Эта эффективность достигнута благодаря новой гибридной архитектуре, впервые примененной в серии GLM-5, которая сочетает разреженное и линейное внимание. Такой подход позволяет сократить затраты на обслуживание длинного контекста, сохраняя при этом его точность. Также используется технология Manifold-Constrained Hyper-Connections (mHC) для повышения эффективности масштабирования, и модель обучена на новом 30-триллионном мультимодальном корпусе данных.

Модель также поддерживает локальное развертывание с использованием популярных фреймворков, таких как SGLang и vLLM, что даёт разработчикам дополнительную гибкость.

Z.ai с GLM 5.3 Flash делает ставку на сочетание обширного контекста и мультимодальности с агрессивной ценовой политикой. Это может расширить круг задач, где использование таких моделей становится экономически оправданным. Однако заявленное приближение к Claude Opus 4.8 по производительности пока не подкреплено независимыми бенчмарками.

Дополнительные источники

  1. zai-org / GLM-5.3-Flash
  2. Z.ai
  3. llm-stats.com

Источники

  1. https://openrouter.ai/z-ai/glm-5.3-flash external
→ Опубликовано в Telegram: @agentic_ai_news/922