Простаивающие GPU — это как самолеты на земле: убытки. Бразильская Dharma AI опубликовала результаты нового планировщика, который увеличивает утилизацию графических процессоров на 33 процентных пункта. Теперь из того же железа можно получить на треть больше вычислений.
Компания Dharma AI представила новый планировщик GPU, который учитывает ограничения и поднимает утилизацию графических процессоров на 33 процентных пункта. При этом приоритетно-взвешенная производительность выросла до 105% по сравнению с обычными FIFO-планировщиками. Все улучшения достигнуты на идентичном оборудовании и с теми же рабочими нагрузками.
Ключ к такому приросту — в умном распределении ресурсов между разнородными задачами. Пакетное обучение, батчевый инференс и квантование требуют непрерывных блоков GPU до завершения работы. Инференс в реальном времени, напротив, эластичен: его потребность в мощностях меняется посекундно. Стандартные FIFO-планировщики вынуждены резервировать пиковую потребность для эластичных задач на весь день, что приводит к простою мощностей в часы низкого спроса. Новый планировщик Dharma AI решает эту проблему, избегая неэффективных фиксированных резерваций.
Решение Dharma AI напрямую затрагивает растущую проблему недоиспользования дорогостоящих GPU в корпоративном AI. Простой оборудования здесь сопоставим с простаивающими самолетами в авиации: затраты идут, а прибыли нет. Таким образом, оптимизация утилизации становится следующим ключевым ограничением после самой "интеллектуальности" моделей, определяя рентабельность внедрения AI-систем.
Переход от наращивания вычислительных мощностей к их оптимизации становится критическим для рентабельности AI. Dharma AI демонстрирует, что прирост эффективности возможен без капитальных затрат на новое железо. Это указывает на то, что для многих компаний следующим шагом в развитии AI-инфраструктуры станет не покупка, а умное управление уже имеющимися ресурсами.