Агенты с искусственным интеллектом часто спотыкаются, когда начинают работать с реальными инструментами и данными, несмотря на все тренировки в синтетических средах. Perplexity Research нашла способ, как сделать их надёжнее, научив модели учиться на собственных ошибках в реальных сценариях использования.
Обычный подход к обучению на реальных данных — это фильтрация успешных сессий (rejection sampling fine-tuning). Он выбирает только те взаимодействия, которые привели к желаемому результату, и обучает модель имитировать их. Проблема в том, что даже в успешной сессии могут быть промежуточные ошибки, которые модель исправила по ходу дела. Имитируя всю траекторию, модель рискует закрепить эти неверные шаги. Кроме того, неудачные сессии, содержащие ценную информацию о сбоях, просто отбрасываются.
Perplexity Research решила эти ограничения, объединив фильтрацию успешных сессий с самодистилляцией с подсказками (hint-guided self-distillation). Новый метод разделяет два типа решений: какие сессии содержат поведение, достойное имитации, а какие — ошибки, которые нужно исправить. Каждое действие модели обрабатывается по одному из трёх сценариев:
- Имитация — правильные шаги из успешных сессий усиливаются для дальнейшего воспроизведения.
- Коррекция — ошибочные шаги из успешных и неудачных сессий исправляются с помощью коротких подсказок. Эти подсказки содержат корректирующие инструкции, основанные на информации, которая уже была у модели в момент ошибки.
- Контекст — шаги из неудачных сессий без чётких подсказок сохраняются для понимания общей ситуации.
Такой подход позволяет модели учиться не только на том, что сработало, но и на том, что пошло не так. В реальном использовании обученный таким образом агент снизил количество сбоев при вызове инструментов на 21,2% по сравнению с предыдущей версией. Данные для обучения собираются из реальных взаимодействий пользователей, но с соблюдением конфиденциальности: исключаются сессии с личной информацией и от пользователей, отказавшихся от сбора данных.
Этот этап обучения применяется после первичного усиления обучения в синтетических средах, помогая преодолеть разрыв между контролируемыми тестовыми сценариями и непредсказуемым реальным миром. Это приближает ИИ к созданию более устойчивых и предсказуемых агентов, которые меньше нуждаются в ручном вмешательстве для исправления ошибок.