AI News Watcher
Wednesday, Sep 16, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 16, 2026 · 3 min read · Alibaba ← Back to feed

STAROps от Alibaba: ИИ-агент на 70% точнее находит корень проблемы daily

Даже убедительный отчёт может быть ошибочным; STAROps учит агента понимать систему, чтобы не путать симптомы с причиной.

STAROps от Alibaba: ИИ-агент на 70% точнее находит корень проблемы
Редакция · Daily briefing

Когда в продакшене срабатывает аварийное оповещение, самая опасная ошибка — принять симптом за настоящую причину. Если ИИ-агент действует по неверному диагнозу, это не просто тратит время инженеров, но и создает риск для всей системы. Alibaba представила фреймворк STAROps, который учит агентов не просто находить аномалии, а точно указывать на источник проблемы.

Обычно при оценке AgenticOps (подхода, где ИИ-агенты автоматизируют операции) внимание уделяют количеству инструментов, которые может использовать агент, или его способности запускать исправления. Однако Alibaba, разрабатывая STAROps, сосредоточилась на более фундаментальном вопросе: способен ли агент правильно определить первопричину? Оповещение обычно сообщает, какая метрика превысила порог, но не где именно произошел сбой. Например, ошибки 5xx могут указывать как на проблему во фронтенде, так и на медленную базу данных или исчерпание ресурсов ноды.

Текущие универсальные агенты могут запрашивать большой объем данных и генерировать хорошо структурированные отчеты, которые звучат правдоподобно. Но полный отчет не доказывает, что агент нашел объект, который действительно вышел из строя. Если он останавливается на сущности, где сработало оповещение, или принимает выраженную аномалию на пути распространения за первопричину, более сложные рассуждения могут сделать неверный вывод еще более убедительным.

Проверка концепции (proof of concept) обычно фокусируется на нескольких известных ошибках: зависший под, медленный SQL-запрос или сбой Redis. Это показывает, что система справляется со сценариями A, B и C, но не доказывает, что она сможет найти проблему типа D. В реальных продакшн-средах гораздо больше может пойти не так: проблема может возникнуть в приложении, контейнере, ноде, базе данных или сети. Топологии постоянно меняются, данные могут быть неполными, и несколько аномалий могут появиться одновременно.

STAROps решает эту проблему, сосредоточившись на самом процессе расследования: как агент понимает текущую систему, решает, что проверять дальше, доказывает надежность вывода и учится на сбоях в продакшене. Для этого фреймворк использует несколько ключевых механизмов:

Результаты бенчмарка RCA-Bench, проведенного на стратифицированном наборе из 30 случаев, показывают превосходство STAROps над универсальным агентом OpenClaw + DeepSeek-V4-Pro. Общий балл STAROps составил 75.23 против 51.02 у конкурента. Ключевое отличие заключается в способности идентифицировать сущность первопричины: здесь STAROps набрал 90 баллов против 52.8, что на 70% выше. По типу сбоя разрыв составил 24.7 балла. Это показывает, что универсальные агенты могут проводить несколько раундов запросов, но STAROps лучше определяет, куда именно направить расследование.

Например, в случае падения трафика для сервиса product-catalog::ListProducts универсальные агенты ошибочно заключили, что проблема в балансировщике нагрузки или фронтенде. STAROps же проследовал по связям до ноды cn-hongkong.10.0.1.107, где использование CPU выросло до 99.98%, что и было истинной причиной. В другом случае, когда замедлился фронтенд POST /api/checkout, STAROps, в отличие от конкурентов, продолжил расследование по трассировкам и обнаружил медленный SQL-запрос в сервисе inventory.

STAROps от Alibaba наглядно демонстрирует, что для эффективного анализа первопричин критически важна не столько способность агента запускать множество инструментов, сколько его умение построить точную модель системы и на её основе отличить симптом от истинной причины. Однако в некоторых областях, таких как проблемы с трафиком, DNS, CDN и сторонними сервисами, фреймворку ещё предстоит совершенствоваться.

Дополнительные источники

  1. RCA-Bench 数据集与评测协议
  2. RCA Agent 评测:开源方案与 STAROps 的同一评测集对比
  3. RocketMQ-A2A Paper Accepted at ACM FSE: Defining a Reliable Collaboration Paradigm for AI Agents
  4. Alibaba Cloud Recognized in the Challengers Quadrant of the Gartner® Magic Quadrant™ for Observability Platforms
  5. STAROps Intelligent Host Inspection: A 24/7 AI Doctor for Your ECS Instances
  6. aliyun.com

Источники

  1. https://www.alibabacloud.com/blog/toward-production-grade-agenticops-how-starops-builds-generalizable-root-cause-analysis_603555 blog
→ Опубликовано в Telegram: @agentic_ai_news/1041