AI News Watcher
Monday, Sep 21, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 21, 2026 · 2 min read · Perplexity ← Back to feed

Perplexity научила ИИ не ломаться при работе с инструментами daily

Агенты стали на 21,2% реже сбоить, учась на ошибках в реальных сценариях, а не только на успешных попытках.

Perplexity научила ИИ не ломаться при работе с инструментами
Редакция · Daily briefing

Агенты с искусственным интеллектом часто спотыкаются, когда начинают работать с реальными инструментами и данными, несмотря на все тренировки в синтетических средах. Perplexity Research нашла способ, как сделать их надёжнее, научив модели учиться на собственных ошибках в реальных сценариях использования.

Обычный подход к обучению на реальных данных — это фильтрация успешных сессий (rejection sampling fine-tuning). Он выбирает только те взаимодействия, которые привели к желаемому результату, и обучает модель имитировать их. Проблема в том, что даже в успешной сессии могут быть промежуточные ошибки, которые модель исправила по ходу дела. Имитируя всю траекторию, модель рискует закрепить эти неверные шаги. Кроме того, неудачные сессии, содержащие ценную информацию о сбоях, просто отбрасываются.

Perplexity Research решила эти ограничения, объединив фильтрацию успешных сессий с самодистилляцией с подсказками (hint-guided self-distillation). Новый метод разделяет два типа решений: какие сессии содержат поведение, достойное имитации, а какие — ошибки, которые нужно исправить. Каждое действие модели обрабатывается по одному из трёх сценариев:

Такой подход позволяет модели учиться не только на том, что сработало, но и на том, что пошло не так. В реальном использовании обученный таким образом агент снизил количество сбоев при вызове инструментов на 21,2% по сравнению с предыдущей версией. Данные для обучения собираются из реальных взаимодействий пользователей, но с соблюдением конфиденциальности: исключаются сессии с личной информацией и от пользователей, отказавшихся от сбора данных.

Этот этап обучения применяется после первичного усиления обучения в синтетических средах, помогая преодолеть разрыв между контролируемыми тестовыми сценариями и непредсказуемым реальным миром. Это приближает ИИ к созданию более устойчивых и предсказуемых агентов, которые меньше нуждаются в ручном вмешательстве для исправления ошибок.

Дополнительные источники

  1. Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
  2. Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Источники

  1. https://www.perplexity.ai/hub/blog/learning-from-real-world-mistakes blog
→ Опубликовано в Telegram: @agentic_ai_news/1076