Когда речь заходит о AI-моделях, выбор часто стоит между закрытыми системами с гарантированной производительностью и открытыми, требующими инженерных усилий. Together AI и Moonshot AI объединились, чтобы предложить третье решение: крупнейшую открытую модель Kimi K3, сразу готовую к продакшену.
Together AI стала стартовой площадкой для всех будущих открытых моделей Moonshot AI, начиная с Kimi K3. Это партнерство обеспечивает доступ с первого дня к релизам Moonshot через инфраструктуру Together AI, размещенную в США. Платформа предлагает собственную ценовую модель и инструменты, гарантируя отсутствие хранения данных и соблюдение требований.
Kimi K3 — крупнейшая открытая модель на сегодняшний день. Это разреженная модель Mixture-of-Experts (MoE) на 2.8 триллиона параметров с нативной поддержкой зрения и контекстным окном в 1 миллион токенов. Moonshot AI заявляет, что по бенчмаркам модель конкурирует с проприетарными системами. Модель построена на двух новых архитектурных компонентах:
- Kimi Delta Attention (KDA) — меняет поток информации по длине последовательности, ускоряя декодирование при длинных контекстах.
- Attention Residuals (AttnRes) — улучшает извлечение представлений по глубине модели, повышая эффективность обучения с минимальными затратами вычислительных ресурсов. Дополнительные оптимизации, включая per-head Muon и quantile-based expert load balancing, по данным Moonshot, дают примерно в 2.5 раза лучшую эффективность масштабирования по сравнению с Kimi K2.
Together AI предлагает Kimi K3 через свои основные продукты для инференса:
- Serverless — для быстрой итерации.
- Provisioned Throughput — резервирование мощностей с оплатой по токенам и SLA 99% аптайма. Это гарантирует пропускную способность по предсказуемой цене, без расчёта часов GPU.
- Dedicated Model Inference — для команд, которым нужен полный контроль над развертыванием, с лучшей экономикой токенов и постоянными обновлениями.
Разработчики могут пост-обучать (fine-tune) модели Kimi для своих задач. Доступны различные методы, включая полное обучение весов и LoRA с обучением с подкреплением, а также supervised fine-tuning (SFT). Настройка обучения происходит через Python SDK, поддерживается параллельное проведение нескольких LoRA-экспериментов на выделенных мощностях. Готовые чекпойнты можно сразу развертывать в инференс, без отдельного этапа передачи между обучением и обслуживанием.
Партнерство Together AI и Moonshot AI открывает ряд преимуществ для разработчиков:
- Доступ с первого дня — Kimi K3 доступна с высочайшим качеством и производительностью, подтвержденными Moonshot. Будущие релизы Moonshot также будут выходить на Together AI одновременно с запуском.
- Проверенное масштабирование — инфраструктура Together AI оптимизирована для больших разреженных MoE-моделей, таких как K3, обеспечивая заявленную производительность.
- Единая интеграция — все модели Moonshot будут доступны через тот же API и библиотеку моделей Together AI, без необходимости менять SDK или аккаунты.
- Пост-обучение с первого дня — клиенты Together могут использовать модели Kimi в качестве базовых для тонкой настройки, с возможностью удаления атрибуции, требуемой лицензией MIT.
- Открытые веса — Kimi K3 с открытыми весами дает гибкость в выборе сервиса: от Serverless для быстрых итераций до Provisioned Throughput или Dedicated Model Inference по мере роста использования, без привязки к одному провайдеру.
Партнерство Together AI и Moonshot AI переводит крупнейшие открытые модели, такие как Kimi K3, на новый уровень доступности и функциональности, который ранее был прерогативой закрытых систем. Это снижает барьеры для разработчиков, желающих строить сложные AI-приложения на открытом коде, предлагая готовое к продакшену решение и гибкость в обучении. Однако реальная экономия и производительность Kimi K3 в различных производственных сценариях ещё предстоит подтвердить независимыми тестами.