Когда агенты ИИ выдают некачественный результат или бесполезные комментарии, а обратная связь по ним просто исчезает — это путь к "шумному" опыту. Компания Warp, крупный пользователь платформы Claude от Anthropic, решила эту проблему, создав систему, в которой агенты сами учатся на ошибках и улучшают свои действия со временем.
Warp столкнулась с тем, что их внутренний агент для код-ревью часто давал бесполезные комментарии, а попытки вручную переписывать промпты или контекстные файлы не масштабировались. Главная проблема заключалась в том, что обратная связь от пользователей терялась после завершения сессии. Решением стал фреймворк Agent Skills, который позволяет агентам постоянно совершенствоваться.
В основе фреймворка лежит идея «навыков» — это файловые представления знаний, которые хранят инструкции вне основного промпта. Архитектура состоит из двух типов навыков, между которыми встраивается человеческая обратная связь:
- Базовый навык (inner/base skill) содержит функциональные знания и инструкции для выполнения конкретной задачи, например, правила для код-ревью.
- Улучшающий навык (outer/improver skill) работает по расписанию как агент-наблюдатель. Он собирает накопленную человеческую обратную связь, сравнивает предложенное агентом с реакцией человека и предлагает небольшое, сфокусированное изменение для базового навыка.
Поскольку навыки представлены в виде обычных файлов, агенты могут их эффективно обновлять. Эти обновления проходят через стандартный рабочий процесс код-ревью (Pull Request), где человек проверяет, одобряет и сливает изменения. После слияния базовый навык наследует улучшение. Такой подход гарантирует, что человек сохраняет контроль над тем, что именно меняется.
Warp уже применяет этот механизм для нескольких типов агентов в своём открытом репозитории, включая агентов для написания спецификаций, ревью кода и триажа задач. Например, агент по триажу задач анализирует новые обращения на GitHub, назначает метки и предлагает направление для исправления. Если поддерживающий разработчик оставляет детальный фидбек о пропущенной метке, улучшающий навык анализирует его и предлагает правку в базовый навык агента.
Механизм «навыков» от Warp демонстрирует, как можно превратить одноразовых помощников-агентов в постоянно развивающиеся системы. Ключевое здесь — возможность накапливать знания через структурированную обратную связь и при этом сохранять человеческий контроль над процессом улучшения, что критически важно для внедрения ИИ в корпоративные процессы.