AI News Watcher
Monday, Sep 14, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 14, 2026 · 2 min read · Tencent Hunyuan ← Back to feed

Tencent SAS: Qwen3 сама учится выбирать контекст — без слепых зон daily

Новый механизм сквозной оптимизации внимания решает проблему «слепоты» к градиентам, предлагая готовые роутеры для Qwen3 4B-14B.

Tencent SAS: Qwen3 сама учится выбирать контекст — без слепых зон
Редакция · Daily briefing

Большие языковые модели сталкиваются с проблемой «слепоты», когда дело доходит до обработки длинных контекстов: квадратичная сложность механизма внимания заставляет их пропускать важную информацию. Tencent Hunyuan представила Simple-Attention-Sparsification (SAS) — механизм, который учит модели Qwen3 отбирать релевантные блоки контекста, оптимизируя этот выбор напрямую через функцию потерь.

Традиционные методы разреживания внимания (sparse attention) выбирают блоки контекста с помощью дискретного отбора Top-K, что блокирует градиенты от функции потерь языкового моделирования. В результате селектор контекста обучается не напрямую, а через вспомогательные задачи или эвристики, что может приводить к неоптимальному использованию ограниченного бюджета внимания. SAS решает эту проблему, добавляя непрерывные «вентили» (gates) к выбранным блокам. Это создает дифференцируемый путь для градиентов, позволяя модели оптимизировать ранжирование контекста сквозным методом.

Tencent Hunyuan выпустила готовые контрольные точки (checkpoints) SAS для моделей Qwen3 размером 4B, 8B и 14B. Эти контрольные точки содержат только веса обученных gate-роутеров (от 33 до 42 млн параметров), а не полные языковые модели. Они не являются самостоятельными и требуют наличия соответствующей базовой модели Qwen3, а также специализированного бэкенда seer_attn из форка sglang-blocksparse для инференса.

В релизе представлены следующие конфигурации разреженного внимания:

Для использования SAS необходимо клонировать репозиторий Tencent-Hunyuan/Simple-Attention-Sparsification, установить окружение с помощью pixi и запустить сервер инференса. Сервер использует OpenAI-совместимый API и автоматически загружает базовую модель Qwen3 при необходимости. Также доступны скрипты для запуска официальных бенчмарков, таких как MATH, GPQA-Diamond и LongBench-E, что позволяет оценить производительность SAS.

Выпуск SAS от Tencent Hunyuan указывает на то, что для эффективной работы с длинными контекстами недостаточно просто увеличить размер окна внимания. Ключ к повышению точности и эффективности лежит в способности модели самостоятельно и дифференцируемо учиться, какие части контекста наиболее релевантны. Однако текущий релиз требует специфической инфраструктуры и не является решением «из коробки», что может стать барьером для быстрого внедрения.

Дополнительные источники

  1. SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
  2. Tencent-Hunyuan/Simple-Attention-Sparsification
  3. Building architectures that can handle the world’s data - DeepMind
  4. Paper Walkthrough - LongNet: Scaling Transformers to 1,000,000,000 Tokens
  5. huggingface.co
  6. research.google

Источники

  1. https://huggingface.co/tencent/Simple-Attention-Sparsification docs
→ Опубликовано в Telegram: @agentic_ai_news/1027