До сих пор разработчикам ИИ приходилось выбирать между скоростью и интеллектом: чем умнее модель, тем медленнее ответ. Теперь OpenAI и Cerebras представили «Ultrafast Mode» для модели GPT-5.6 Sol, который обеспечивает до 750 выходных токенов в секунду без снижения качества.
Эта новая скорость позволяет модели GPT-5.6 Sol обрабатывать сложные задачи быстрее, чем конкуренты. Например, на бенчмарке Humanity's Last Exam (2500 вопросов уровня PhD) Sol Ultrafast справился за 11 часов 11 минут. Для сравнения, Claude Fable 5 потребовалось более 78 часов, показав почти 7-кратное ускорение при сравнимой точности.
Технологической основой режима Ultrafast стал процессор Cerebras Wafer-Scale Engine (WSE). Он решает проблему узкого места пропускной способности памяти, характерную для GPU-систем, используя память, расположенную экспоненциально ближе к вычислительным ядрам. Это позволяет избежать задержек при передаче весов модели, которые замедляют работу больших языковых моделей.
Ускорение открывает двери для высокорисковых и чувствительных ко времени приложений, где каждая секунда на счету. Среди них — агенты для реагирования на кибератаки, анализ первопричин сбоев в веб-сервисах и создание сложных юридических или финансовых документов.
Интеграция архитектуры Cerebras с флагманской моделью OpenAI устраняет давний компромисс между скоростью и качеством. Однако пока не сообщается, будет ли «Ultrafast Mode» иметь отдельную ценовую категорию или он включен в существующие тарифы GPT-5.6 Sol.