Высокая стоимость GPU-мощностей — одна из главных проблем в развитии AI. Together AI предлагает решение: получить те же вычислительные ресурсы вдвое дешевле, если быть готовым к их внезапной остановке.
Together AI ввела "preemptible compute" — предварительно отбираемые вычислительные мощности для Together GPU Clusters. Это позволяет снизить стоимость GPU-ресурсов на 50% по сравнению со стандартными тарифами. Главное условие: такие узлы могут быть остановлены (прерваны) в любой момент. Система даст до пяти минут на завершение текущих задач, прежде чем отключит узел.
Эти узлы не гарантируют минимального времени работы: они заполняются асинхронно, когда появляются свободные мощности. Вместо фиксированной ставки, их использование тарифицируется поминутно. Функция доступна для Kubernetes-кластеров Together AI, но пока не работает со Slurm. Каждый кластер должен содержать хотя бы один стандартный узел.
Такой подход подходит для рабочих нагрузок, которые могут быть остановлены и перезапущены без потери данных. Примеры включают обучение моделей с чекпойнтами, пакетную обработку данных или эксперименты, не требующие непрерывной работы. Приоритет здесь — экономия, а не гарантированная доступность.
Вводя "preemptible compute", Together AI предлагает инженерам больше гибкости в управлении бюджетом на GPU. Это требует от разработчиков проектировать отказоустойчивые системы, способные безболезненно переживать остановки узлов, но взамен даёт существенную экономию.