AI News Watcher
Thursday, Oct 8, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Oct 08, 2026 · 1 min read · Microsoft AI ← Back to feed

Microsoft Foundry представила автооценку голосовых AI-агентов — для сложных диалогов daily

Инструменты для анализа многоэтапных разговоров, но пока в статусе превью без SLA.

Microsoft Foundry представила автооценку голосовых AI-агентов — для сложных диалогов
Редакция · Daily briefing

Оценка качества голосовых AI-агентов — одна из самых трудоемких задач, требующая анализа тысяч звонков. Ручной анализ не справляется с темпами разработки и обновления агентов. В ответ на это Microsoft Foundry предлагает решение: новые автоматизированные оценщики, способные анализировать поведение агентов на протяжении всего многоэтапного разговора.

Foundry предлагает два основных типа оценщиков, которые используют модель-судью для анализа полных многоэтапных диалогов:

Внутренние тесты Microsoft показали, что эти оценщики могут измерять точность, ранжировать агентов по производительности и демонстрировать повторяемость результатов. Для оценки использовались как синтетические бенчмарки (τ-Voice), содержащие 3000+ смоделированных звонков, так и реальные трассировки агентов Foundry. В качестве моделей-судей применялись различные конфигурации GPT.

В отличие от традиционных метрик, которые могут оценивать отдельные фразы или намерения, новые оценщики Foundry нацелены на понимание всего хода диалога. Это критически важно для сложных AI-систем, где ошибка на одном этапе может повлиять на весь разговор. Такой подход позволяет разработчикам быстрее и эффективнее итерировать, не полагаясь исключительно на медленный ручной анализ.

Внедрение автоматизированной оценки многоэтапных диалогов может ускорить разработку и улучшение голосовых AI-агентов. Однако Microsoft не сообщает о конкретных показателях точности или эффективности своих оценщиков в сравнении с человеческим суждением, а также предупреждает, что инструменты находятся в превью и не рекомендованы для продакшена.

Дополнительные источники

  1. microsoft.com
  2. retellai.com
  3. arxiv.org

Источники

  1. https://techcommunity.microsoft.com/t5/microsoft-foundry-blog/evaluating-voice-agents-how-reliable-are-foundry-s-multi-turn/ba-p/4559697 external
→ Опубликовано в Telegram: @agentic_ai_news/1174