На прошлой неделе, 23 июля 2026 года, сервис Replicate, специализирующийся на развертывании ИИ-моделей, столкнулся с перегрузкой своих GPU H100. Резкий скачок спроса привёл к тому, что запросы пользователей на инференс и обучение встали в очереди, которые длились до десяти часов.
Платформа Replicate, известная тем, что позволяет запускать и дообучать открытые модели вроде Llama 3 или Stable Diffusion без сложной инфраструктуры, достигла максимальной пропускной способности своих H100 GPU. Это вызвало задержки и очереди для некоторых моделей, затронув как задачи инференса (выполнения моделей), так и обучения. Инцидент продолжался около десяти часов, но, по сообщению Replicate, проблема уже решена.
Этот инцидент подчёркивает сохраняющийся дефицит топовых GPU, таких как H100, на рынке. Даже платформы, созданные специально для упрощения работы с ИИ-моделями и предоставляющие доступ к железу по модели pay-as-you-go, не застрахованы от внезапных пиков спроса и связанных с ними проблем масштабирования. Для инженеров это означает, что даже на managed-сервисах стабильность доступа к ресурсам может быть под вопросом, и стоит учитывать возможные задержки при планировании критически важных задач.