Открытые модели ИИ сравнялись по качеству с закрытыми, но их внедрение в продакшен оставалось сложной задачей для инженеров. Together AI выпустила платформу инференса, которая даёт полный контроль над развёртыванием, производительностью, стоимостью и качеством таких моделей, избавляя команды от необходимости собирать весь стек инфраструктуры вручную.
Платформа Together AI предлагает комплексный подход к работе с открытыми моделями, опираясь на опыт компании в обработке более 400 триллионов токенов в месяц. Она позволяет развернуть модели за минуты, обеспечивая производственное качество с самого начала. Основные преимущества включают:
- Полный контроль над моделями, их производительностью, стоимостью, качеством и функциональностью.
- Предотвращение потерь времени и ресурсов на создание инференс-стека и слоя управления эндпоинтами с нуля.
- Непрерывное внедрение последних проверенных исследований для достижения производительности и эффективности.
Новая платформа объединяет достижения в исследованиях, оптимизации моделей и разработке инфраструктуры. Она позволяет использовать как модели из каталога Together, так и собственные открытые или тонко настроенные модели, загружая полные веса или адаптеры из Hugging Face, S3 или локальной машины. Это поддерживает весь жизненный цикл модели, от ранней донастройки до продакшен-версий.
Для упрощения развёртывания и работы платформа предлагает ряд ключевых возможностей:
- Профили развёртывания — оптимизированные конфигурации, протестированные командами Together, которые учитывают тип оборудования, квантование, тензорный параллелизм, спекулятивное декодирование и движок инференса.
- Ускоренный старт — переработанный слой кэширования и распределения весов позволяет совместно использовать их и проактивно «прогревать» перед развёртыванием, что даёт примерно 4-кратное ускорение холодного старта для многих моделей.
- Гибкое масштабирование — модели можно привязывать к конкретному региону или размещать гибко. Автомасштабирование может основываться на количестве активных запросов, загрузке GPU, времени до первого токена, задержке, скорости декодирования или пропускной способности.
Платформа также включает набор инструментов для безопасной и надёжной эксплуатации в продакшене:
- Стабильный эндпоинт — за одним эндпоинтом можно разместить несколько развёртываний с разными моделями, оборудованием или конфигурациями, что позволяет менять логику без изменения API-вызовов в приложении.
- Безопасные обновления — поддержка канареечных, blue-green и скользящих обновлений с автоматическим откатом при превышении пороговых метрик.
- Тестирование на реальном трафике — A/B-тесты для сравнения поведения разных развёртываний и «теневой» трафик, который зеркалирует продакшен-запросы на новое развёртывание без влияния на пользователя.
- Мониторинг — Prometheus-эндпоинт на уровне организации и обновлённая встроенная аналитика для отслеживания работоспособности, трафика, производительности и поведения масштабирования.
Помимо инференса, Together AI запустила закрытое бета-тестирование для кастомного обучения, включая обучение с подкреплением (full-weight и LoRA) и контролируемую донастройку. Конфигурировать обучение можно через Python SDK, а готовые чекпоинты напрямую развёртываются на инференс-платформе, устраняя ручную передачу между обучением и обслуживанием.
Together AI заявляет, что эта платформа — фундамент для полного цикла работы с моделями: от обучения до развёртывания и непрерывного улучшения. Цель — сделать контроль над открытыми моделями доступным, не превращая инференс в инфраструктурный проект "сделай сам". Для команд, которым нужен именно этот уровень контроля без капитальных затрат на разработку, это может быть значимым шагом.