AI News Watcher
Friday, Jul 31, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Jul 31, 2026 · 3 min read · Together AI ← Back to feed

Together AI: автомасштабирование LLM теперь видит реальную нагрузку daily

Система реагирует на очередь запросов, а не на загрузку GPU — и учитывает долгие холодные старты.

Together AI: автомасштабирование LLM теперь видит реальную нагрузку
Редакция · Daily briefing

Когда дело доходит до автомасштабирования больших языковых моделей (LLM), стандартные подходы часто дают сбой: GPU могут казаться недозагруженными, пока очередь запросов уже забита, а холодные старты занимают минуты. Together AI представила новую функцию автомасштабирования для своего выделенного инференса, которая учитывает эти особенности, помогая инженерам балансировать между производительностью и стоимостью.

Традиционные механизмы автомасштабирования, хорошо работающие для обычных веб-сервисов, для LLM оказываются неэффективны. Основные причины:

Система Together AI позволяет настраивать политику автомасштабирования, включающую границы числа реплик, одну или несколько метрик масштабирования с целевыми значениями и временные окна. Контрольный цикл непрерывно оценивает наблюдаемую метрику, рассчитывает желаемое количество реплик, смягчает эти значения через временные окна, применяет границы и затем размещает GPU. Если целевое значение превышено, система пропорционально увеличивает количество реплик.

Ключевую роль играют временные окна:

Платформа предлагает восемь метрик для автомасштабирования, разделённых на три категории:

Важно понимать поведение холодных стартов. Установка min_replicas: 0 и max_replicas: 0 останавливает развёртывание, но не обеспечивает автоматического пробуждения. Процесс холодного старта состоит из размещения GPU, загрузки весов (до десятков ГБ), загрузки движка и прогрева. На H100 это занимает от 86 секунд (для базовой модели Qwen3.5-9B) до 145 секунд (для кастомной 18 ГБ модели), а до первого токена может пройти ещё 26–40 секунд. Масштабирование с 1 до 2 реплик занимает около 2,5 минут. Это означает, что функция автостопа выгодна только при длительных простоях и готовности первого пользователя терпеть задержку или ошибку. Для сервисов с SLO или автоматическими вызовами рекомендуется держать min_replicas: 1. Если пик трафика происходит быстрее холодного старта, запросы встают в очередь, задержка растёт, а риск ошибок и таймаутов увеличивается.

Together AI провела эксперимент с развёртыванием Qwen3.5-9B на 1xH100 с границами 1–3 реплики, имитируя синусоидальную нагрузку с пиками. Были протестированы три политики: inflight_requests (цель 8), ttft p95 (300 мс) и gpu_utilization (75%).

Together AI предлагает инженерам детальный контроль над автомасштабированием LLM, что критично для баланса между стоимостью и производительностью. Однако платформа не решает проблему холодных стартов на стороне пользователя, и выбор оптимальной политики по-прежнему требует глубокого понимания конкретной нагрузки и тщательного мониторинга.

Дополнительные источники

  1. Configure autoscaling
  2. Dedicated Model Inference Overview
  3. randomtrees.com
  4. cyfuture.cloud
  5. trystackd.com

Источники

  1. https://www.together.ai/blog/autoscaling-endpoints-for-llm-inference blog
→ Опубликовано в Telegram: @agentic_ai_news/803