Человек пропускает 86% опасных команд, когда ИИ-агент просит подтвердить действие. Anthropic делает свой автоматический режим в Claude Code стандартом, чтобы исправить это, переложив бремя контроля безопасности с пользователя на ИИ.
Автоматический режим Claude Code блокирует 89% опасных команд, тогда как в контролируемом исследовании с 1053 платными тестировщиками люди одобрили 86,4% таких запросов (заблокировав лишь 13,6%). Это означает, что ИИ-классификатор оказался в 6 раз эффективнее человека в предотвращении потенциально вредных действий.
Режим использует специальный классификатор, который проверяет каждое действие на необратимость, деструктивность или выход за пределы среды пользователя. Он также содержит дополнительный уровень защиты от инъекций промптов: в независимом тестировании ни одна из 720 атак не сработала против моделей Claude, работающих в авторежиме.
Помимо безопасности, авторежим позволяет Claude работать автономно дольше, сокращая количество прерываний в 9 раз. У команд, использующих его по умолчанию, количество отправленных запросов на слияние (PR) увеличивается на 25%.
Внутри Anthropic авторежим уже предотвратил серьезные инциденты, включая потенциальную утечку данных, массовое удаление ресурсов и необоснованное повышение привилегий. Крупные компании, такие как Adobe и Nuro, уже используют его для автоматизации задач и ночных агентов, которые готовят готовые PR к утру.
Передача контроля безопасности от человека к ИИ в Claude Code демонстрирует, как агенты могут стать не только эффективнее, но и надежнее, устраняя «усталость от разрешений». Однако Anthropic не сообщает, насколько хорошо авторежим справляется с непреднамеренными ошибками самого Claude, а не только с внешними угрозами или человеческим фактором.