Groq, известный своей архитектурой для быстрого инференса, теперь будет использовать специализированный ускоритель NVIDIA Groq 3 LPX. Это позволит компании одной из первых предложить разработчикам скорость для самых требовательных агентных AI-систем в своём облаке.
Groq станет одним из первых, кто развернёт ускоритель NVIDIA Groq 3 LPX для генерации токенов на платформе NVIDIA Vera Rubin NVL72 в своём облаке AI-инференса. Развёртывание происходит в партнёрстве с Dell Technologies. NVIDIA Groq 3 LPX разработан специально для увеличения скорости генерации токенов, что критически важно для ресурсоёмких агентных систем.
В бенчмарках Artificial Analysis ускоритель показал выдающуюся производительность: до 3400 выходных токенов в секунду при работе с моделью Gemma 4 31B (открытая агентная модель) и контекстом в 100 000 токенов. Это рекордный показатель для данной модели. Благодаря Groq 3 LPX интерактивность для чувствительных к задержкам агентных AI-нагрузок вырастет в четыре раза по сравнению с ближайшими альтернативными платформами, что позволит сократить время выполнения таких задач, как кодирование, с часов до минут.
Groq уже имеет опыт эксплуатации собственных процессоров LPU в продакшене. За август 2026 года компания стала NVIDIA Cloud Partner, что позволяет ей развёртывать и управлять решениями на базе эталонной архитектуры NVIDIA. Её облачная платформа GroqCloud обслуживает более шести миллионов разработчиков и тысячи AI-компаний, генерируя триллионы токенов еженедельно. Недавнее привлечение $1 млрд инвестиций ($350 млн в августе 2026 года, включая участие NVIDIA, и $650 млн в июне 2026 года) позволит Groq масштабировать свою инфраструктуру с 54 до более чем 200 мегаватт в 2027 году.
Этот шаг Groq, известного своими LPU, демонстрирует прагматичный подход: компания готова использовать сторонние решения для достижения максимальной скорости в требовательных агентных задачах. Вопрос в том, как NVIDIA Groq 3 LPX будет сосуществовать с собственными LPU Groq и повлияет ли это на дальнейшее развитие их архитектуры.