Обучение сложных AI-агентов методом Reinforcement Learning (RL) всегда сталкивалось с проблемой: тренировочная среда часто отличалась от боевой. Это требовало дорогих переделок и снижало эффективность. Microsoft Research Asia выпустила Agent Lightning v1.0 — фреймворк, который позволяет обучать агентов, используя их реальные системы развертывания, а не имитации.
Ключевое нововведение — парадигма Harnessed Agentic RL. Она позволяет тренировать агента, не переписывая его код под фреймворк. Это гарантирует, что обученный агент идентичен тому, что будет развернут, устраняя расхождения и дорогостоящие переделки между тренировочной и боевой версиями.
Фреймворк показал высокую эффективность: тестовый агент на базе Qwen3.5-9B, обученный с помощью Agent Lightning v1.0, повысил показатель Pass@1 на бенчмарке SWE-bench Verified с 41.8% до 56.4%. Это абсолютный прирост в 14.6 процентных пункта при использовании всего около 6000 обучающих примеров.
Agent Lightning v1.0 разработан как легковесное решение, содержащее около 3500 строк кода. Он имеет нативную поддержку Kubernetes, что позволяет запускать тренировочные процессы как стандартные Kubernetes-задания на любых кластерах, включая локальную инфраструктуру, без зависимости от платных коммерческих сервисов.
Agent Lightning v1.0 не просто предлагает новый фреймворк, а решает фундаментальную проблему практического применения RL для сложных AI-агентов, делая процесс обучения более реалистичным и эффективным. Однако в отчете не указано, насколько легко фреймворк интегрируется с уже существующими нестандартными системами мониторинга и логирования, используемыми в продакшене.