Когда ИИ-модели отвечают быстро, но не доводят дело до конца, это лишь часть задачи. Новая Grok 4.6 от SpaceXAI, доступная теперь в Microsoft Foundry Models, призвана завершать сложные рабочие процессы, а не просто генерировать ответы.
Grok 4.6 спроектирована для долгосрочного агентского мышления и комплексных рабочих процессов. Она способна планировать действия, восстанавливаться после ошибок и выполнять многошаговые задачи с минимальным контролем. Её производительность оценивается не только скоростью генерации ответов, но и способностью доводить работу до конца.
Модель оптимизирована для широкого спектра задач, охватывающих:
- Кодирование и инженерия — включая CAD (автоматизированное проектирование) и процедурный дизайн.
- Офисная продуктивность — создание отчётов, презентаций, электронных таблиц.
- Научные исследования — поддержка сложных технических задач и многошагового решения проблем.
Высокую производительность Grok 4.6 подтверждают внутренние тесты:
- Terminal-Bench 3.0 — оценивает многошаговое выполнение терминальных команд, имитируя реальные инженерные процессы.
- 3DCodeBench — проверяет способность модели генерировать сложные 3D-дизайны через код.
- AA Briefcase — измеряет выполнение долгосрочных проектов по обработке информации и созданию бизнес-документов.
Цены на Grok 4.6 Global Standard составляют $2.00 за 1M входных токенов, $6.00 за 1M выходных токенов и $0.50 за 1M кеш-токенов.
Grok 4.6 предлагает разработчикам инструмент для создания более автономных систем, способных работать над сложными задачами без постоянного контроля. Модель доступна в публичном превью в Microsoft Foundry Models, но заявленные высокие результаты в бенчмарках пока основаны на данных самого провайдера.