Добавить ИИ-агенту больше памяти кажется простым решением: чем больше прошлых уроков, тем лучше. Однако это не всегда работает. В своей новой статье Hugging Face и IBM Research показали: память для агента — это не фича, которую включают, а доза, которую нужно точно калибровать под возможности конкретной модели.
Исследователи выяснили, что простая «активация» памяти или накопление большого объёма прошлых взаимодействий не гарантирует улучшения производительности. Вместо этого они предлагают подход «дозирования», где память агента — это набор инструкций (guideline set), дистиллированных из его прошлых задач, а не просто воспроизведение старых диалогов. Этот набор вводится в контекст модели во время инференса.
На восьми разных моделях, от 30B до флагманских проприетарных систем, выявились три основных паттерна:
- Сильные модели с запасом производительности хорошо работают с полным набором инструкций, включая редкие кейсы. Например, DeepSeek-V3.2 (671B MoE) улучшила выполнение задач на 9,5 процентных пункта.
- Менее способные модели перегружаются большим объёмом данных. Для них оптимален компактный набор основных инструкций в сочетании с выборочной подгрузкой релевантных рекомендаций для каждой задачи. Так, gpt-oss-120b (117B MoE) показала рост на 16,1 процентных пункта, тогда как полный набор инструкций давал меньший прирост и обходился на 50% дороже по токенам.
- Насыщенные модели не показывают измеримого прироста производительности, поскольку, вероятно, уже достигли своего потолка на данных задачах. В эту категорию попала GLM-5 (745B MoE).
На какой паттерн попадает модель, зависит не только от количества параметров. Влияют также запас производительности на бенчмарках, размер контекстного окна, архитектура, качество инструкций и распределение задач. Важно, что правильно подобранная «доза» памяти может быть не только самой точной, но и самой дешёвой: gpt-oss-120b получила +16,1 процентных пункта при увеличении токенов всего на 5%.
Исследование показывает, что эффективность ИИ-агентов зависит от тонкой настройки памяти, а не от её объёма. Хотя точные факторы, определяющие оптимальную «дозу», ещё изучаются, уже ясно: подход «чем больше, тем лучше» не работает, а правильная калибровка может быть одновременно самой точной и дешёвой.