ИИ-агенты часто рапортуют о завершении задачи, но реальные бэкенд-системы с этим не соглашаются. Microsoft выпустила ThinkingBox через Hugging Face, чтобы измерять именно это расхождение между заявленным и фактическим состоянием, предлагая более строгий подход к оценке.
ThinkingBox оценивает ИИ-агентов не по сгенерированным ответам или вызовам инструментов, а по фактическим изменениям состояния бэкенда и побочным эффектам, которые они оставляют. Это позволяет выявить ситуации, когда агент "успешно" завершил работу, но оставил систему в неверном состоянии, например, закрыв тикет, пока проблема ещё не решена.
Исследования Microsoft показали, что разрыв между "успехом" агента и реальным состоянием бэкенда огромен. Из 121 680 попыток 79 853 провалили исполнительные проверки. При этом 67,24% из этих провалов завершились чисто и не сообщали об ошибках. В 77,61% таких случаев были найдены неверные значения полей, в 43,30% — непреднамеренные дополнительные эффекты, а в 25,36% — отсутствующие обязательные эффекты.
Инструмент работает, запуская агентов в изолированных средах с инструментами (MCP tool sessions) и затем оценивая конечное состояние бэкенда. Он также проверяет надежность агента, повторяя задачи до двадцати раз, чтобы убедиться в стабильности результатов.
ThinkingBox доступен через OpenEnv от Hugging Face. Это позволяет разработчикам использовать его для определения изолированных сред, создания сценариев, тестирования агентов с симулированным взаимодействием пользователя и оценки их влияния на бэкенд-системы.
ThinkingBox радикально меняет подход к оценке ИИ-агентов, перенося фокус с их "слов" на "дела", что критически важно для создания надежных продакшн-систем. Однако вендор не сообщил, насколько легко интегрировать ThinkingBox в уже существующие CI/CD пайплайны, помимо ручного запуска.