Оценка качества голосовых AI-агентов — одна из самых трудоемких задач, требующая анализа тысяч звонков. Ручной анализ не справляется с темпами разработки и обновления агентов. В ответ на это Microsoft Foundry предлагает решение: новые автоматизированные оценщики, способные анализировать поведение агентов на протяжении всего многоэтапного разговора.
Foundry предлагает два основных типа оценщиков, которые используют модель-судью для анализа полных многоэтапных диалогов:
- Task Completion — определяет, была ли успешно и полностью выполнена задача пользователя. Возвращает бинарный результат (успех/неуспех) и объяснение.
- Generated Rubric — оценивает разговор по критериям, которые генерируются из требований пользователя. Возвращает взвешенную общую оценку от 0 до 1, результат «пройдено/не пройдено» и оценки по каждому критерию с объяснениями.
Внутренние тесты Microsoft показали, что эти оценщики могут измерять точность, ранжировать агентов по производительности и демонстрировать повторяемость результатов. Для оценки использовались как синтетические бенчмарки (τ-Voice), содержащие 3000+ смоделированных звонков, так и реальные трассировки агентов Foundry. В качестве моделей-судей применялись различные конфигурации GPT.
В отличие от традиционных метрик, которые могут оценивать отдельные фразы или намерения, новые оценщики Foundry нацелены на понимание всего хода диалога. Это критически важно для сложных AI-систем, где ошибка на одном этапе может повлиять на весь разговор. Такой подход позволяет разработчикам быстрее и эффективнее итерировать, не полагаясь исключительно на медленный ручной анализ.
Внедрение автоматизированной оценки многоэтапных диалогов может ускорить разработку и улучшение голосовых AI-агентов. Однако Microsoft не сообщает о конкретных показателях точности или эффективности своих оценщиков в сравнении с человеческим суждением, а также предупреждает, что инструменты находятся в превью и не рекомендованы для продакшена.