Когда ИИ-агент блестяще справляется с задачей на демо, но затем проваливает её при повторном запуске, это не просто неловкость. Для продакшена это критическая проблема надёжности. IBM выпустила ALTK-Evolve — систему, которая учит агентов стабильно повторять успех.
Обычно бенчмарки показывают среднюю точность, скрывая реальную проблему: разрыв согласованности. Например, агент на GPT-4.1, успешный в среднем в 77.4% случаев, при пятикратном повторении одной и той же задачи справляется со всеми пятью попытками лишь в 53% случаев. Это 24.4 процентных пункта разницы в надёжности.
Для решения проблемы IBM разработала Consistency Analyzer. Этот инструмент диагностирует «нестабильные» точки принятия решений в траектории агента — шаги, где модель была всего в одном токене от другого действия. Полученная диагностика затем преобразуется в рекомендации по согласованности.
Применение этих рекомендаций сокращает разрыв согласованности вдвое: с 24.4 до 12.0 процентных пунктов. При этом средняя точность работы агента не снижается.
ALTK-Evolve — это инструмент с открытым кодом, доступный на GitHub. Он не требует повторного запуска задачи целиком для анализа: достаточно одной записанной траектории агента.
IBM ALTK-Evolve смещает фокус с усреднённой производительности агентов на их надёжность, что критически важно для реальных систем. Однако IBM не сообщает, насколько применение таких рекомендаций по согласованности увеличивает латентность или стоимость инференса.