Обычно, чтобы модель ИИ получила новые знания или исправила ошибки, требуется её дообучение. Microsoft предложила фреймворк EvoLib, который позволяет большим языковым моделям (LLM) учиться на собственном опыте прямо во время выполнения задач — без необходимости обновлять модель или использовать размеченные данные.
EvoLib работает как самообучающаяся система, которая перерабатывает прошлые попытки агента в многоразовые навыки и аналитические выводы. Это знание не просто накапливается, а постоянно развивается: полезные стратегии и инсайты уточняются, объединяются и получают новый «вес» по мере поступления нового опыта. Таким образом, наблюдения из конкретных случаев превращаются в более общие знания.
Ключевые механизмы EvoLib включают:
- Консолидация — при появлении нового знания фреймворк ищет похожее в своей библиотеке и объединяет его с новой информацией в более обобщенное и применимое знание.
- Механизм взвешивания — важность каждой единицы знания постоянно обновляется, исходя из её непосредственной полезности для текущей задачи и долгосрочного вклада в создание новых полезных абстракций.
Фреймворк разработан для использования с уже развернутыми моделями и системами ИИ, доступными через API, поскольку не требует обновления весов самой модели. EvoLib уже протестирован на задачах математического рассуждения, написания кода с ограничениями на эффективность и принятия решений в долгосрочных сценариях взаимодействия со средой, демонстрируя последовательное улучшение производительности.
Способность агентов к непрерывному самообучению и адаптации на основе собственного опыта, без постоянных циклов переобучения, критична для создания по-настоящему автономных систем. EvoLib предлагает один из путей к таким агентам, хотя масштабирование и управление постоянно развивающейся библиотекой знаний остается важным вызовом.