Большие языковые модели сталкиваются с проблемой «слепоты», когда дело доходит до обработки длинных контекстов: квадратичная сложность механизма внимания заставляет их пропускать важную информацию. Tencent Hunyuan представила Simple-Attention-Sparsification (SAS) — механизм, который учит модели Qwen3 отбирать релевантные блоки контекста, оптимизируя этот выбор напрямую через функцию потерь.
Традиционные методы разреживания внимания (sparse attention) выбирают блоки контекста с помощью дискретного отбора Top-K, что блокирует градиенты от функции потерь языкового моделирования. В результате селектор контекста обучается не напрямую, а через вспомогательные задачи или эвристики, что может приводить к неоптимальному использованию ограниченного бюджета внимания. SAS решает эту проблему, добавляя непрерывные «вентили» (gates) к выбранным блокам. Это создает дифференцируемый путь для градиентов, позволяя модели оптимизировать ранжирование контекста сквозным методом.
Tencent Hunyuan выпустила готовые контрольные точки (checkpoints) SAS для моделей Qwen3 размером 4B, 8B и 14B. Эти контрольные точки содержат только веса обученных gate-роутеров (от 33 до 42 млн параметров), а не полные языковые модели. Они не являются самостоятельными и требуют наличия соответствующей базовой модели Qwen3, а также специализированного бэкенда seer_attn из форка sglang-blocksparse для инференса.
В релизе представлены следующие конфигурации разреженного внимания:
- Размер KV-блока — 64 токена.
- Top-K для тренировки — 31 исторический блок.
- Длина тренировочной последовательности — 32 768 токенов.
- Бюджет разреженного декодирования — 2048 токенов по умолчанию, с возможностью использования 1024 или 4096 токенов без переобучения. Важно отметить, что в процессе обучения оптимизировались только gate-роутеры, а параметры базовой модели Qwen3 оставались замороженными.
Для использования SAS необходимо клонировать репозиторий Tencent-Hunyuan/Simple-Attention-Sparsification, установить окружение с помощью pixi и запустить сервер инференса. Сервер использует OpenAI-совместимый API и автоматически загружает базовую модель Qwen3 при необходимости. Также доступны скрипты для запуска официальных бенчмарков, таких как MATH, GPQA-Diamond и LongBench-E, что позволяет оценить производительность SAS.
Выпуск SAS от Tencent Hunyuan указывает на то, что для эффективной работы с длинными контекстами недостаточно просто увеличить размер окна внимания. Ключ к повышению точности и эффективности лежит в способности модели самостоятельно и дифференцируемо учиться, какие части контекста наиболее релевантны. Однако текущий релиз требует специфической инфраструктуры и не является решением «из коробки», что может стать барьером для быстрого внедрения.