Представьте блестящего повара, который выучил наизусть все поваренные книги, но каждое утро забывает особенности вашей кухни: что духовка греет сильнее, а постоянные клиенты любят побольше соли. Большинство AI-агентов ведут себя так же: они прекрасно следуют промптам, но не накапливают мудрость о своем окружении. Именно эту проблему решает система ALTK-Evolve от IBM Research, которая позволяет LLM-агентам учиться на собственном опыте, повышая их надежность и снижая затраты на токены.
Когда LLM-агент выполняет сложную многошаговую задачу, он часто терпит неудачу не из-за недостатка знаний. Модель знает, как работать с API, но не усвоила, как использовать их надежно. Агент может неправильно разбить страницы API, выбрать не того человека или вернуть значение, когда оно не требовалось. Он перечитывает логи вместо того, чтобы извлекать принципы, повторяя ошибки и не перенося уроки в новые ситуации.
Системы ALTK-Evolve и ACE (Agentic Context Engineering) решают эту проблему, позволяя агенту учиться на своих прошлых действиях. Обе превращают прошлые траектории агента в многоразовые уроки, которые подаются обратно в модель во время инференса, без обновления весов или ручной разметки. Важно, что обе системы отказываются от сжатия этих уроков в краткие сводки, чтобы избежать "смещения к краткости" (brevity bias — оптимизация к коротким, общим инструкциям) и "сжатия контекста" (context collapse — потеря деталей при переписывании). Вместо этого они ведут подробный учет уроков: ACE использует счетчики для каждого пункта, ALTK-Evolve — "счетчики поддержки" (support counts).
Однако ALTK-Evolve отличается от ACE в двух ключевых аспектах. Первый — это консолидация (как строится хранилище памяти):
- Кластеризует похожие уроки и объединяет их внутри кластера.
- Сохраняет поддержку — при объединении нескольких уроков выживший наследует их общий счет, уменьшая хранилище без потери опыта.
- Извлекает типизированные рекомендации (стратегии, восстановление, оптимизация) с указанием причинно-следственных связей и источника, что позволяет переносить уроки между разными приложениями.
Второе и главное отличие — это доставка уроков, которая напрямую влияет на стоимость токенов. Если ACE инжектирует полный плейбук на каждом шаге, независимо от модели или задачи, то ALTK-Evolve подходит к доставке как к "регулятору". Система инжектирует только релевантные рекомендации в момент действия, не перегружая контекст модели лишней информацией.
Такой подход позволил ALTK-Evolve повысить надежность агентов, особенно в сложных многошаговых задачах, демонстрируя улучшение на 14.2% в бенчмарке AppWorld. При этом система не раздувает контекст и легко интегрируется с популярными агентскими стеками, такими как ReAct-style агенты.
Система ALTK-Evolve показывает, что ключ к надёжным и экономичным AI-агентам лежит не столько в объеме их памяти, сколько в способности эффективно использовать её, доставляя только нужные уроки в нужный момент. Это важный шаг для LLM-агентов, которые до сих пор сталкивались с проблемой "вечного стажера", но реальные цифры экономии токенов и широта применения вне бенчмарков IBM Research пока остаются открытым вопросом.