Когда у команды разработки скорость создания кода вырастает в восемь раз, старые процессы безопасности становятся тормозом. Anthropic столкнулась с этим, когда её агенты начали генерировать 80% всего кода. Чтобы не сбавлять темп, компания перестроила свои подходы к защите, внедрив новые принципы, включая строгие границы для ИИ-агентов и постоянное участие человека в критических решениях.
Основная стратегия Anthropic для масштабирования безопасности в условиях, когда агенты становятся главными создателями кода, включает четыре пункта:
- Перенос безопасности влево — глубокая интеграция на ранних этапах разработки.
- Жёсткие границы для доступа и идентификации, чтобы ограничить область поражения.
- Комбинированные проверки — автоматические детерминированные и агентные ревью до и после продакшена.
- Человек в цикле — на самых важных и чувствительных этапах.
На этапе планирования Anthropic использует автоматизированную систему проверки безопасности проектов (PSR) на базе Claude. Она анализирует проектную документацию, ищет уязвимости по фреймворку MITRE ATT&CK и предлагает меры по их устранению. Система подключена к внутренней базе знаний, что позволяет Claude более точно оценивать риски и даже одобрять запуск проектов с низким риском без участия человека. Это смещает фокус с детального архитектурного ревью, которое теряет актуальность, когда прототипы создаются за часы.
На этапе кодирования правила безопасности встроены прямо в процесс создания кода. Инструкции и лучшие практики кодирования кодируются в файлах CLAUDE.md, что позволяет агентам генерировать код, сразу соответствующий этим стандартам. Claude также использует плагин для проверки безопасности в процессе написания кода, находя и устраняя распространённые уязвимости до того, как код попадёт в пулл-реквест. Для сдерживания потенциальных атак (например, инъекций промптов) разработка ведётся на удалённых виртуальных машинах с жёстко ограниченным исходящим трафиком.
На этапе тестирования и CI (непрерывной интеграции) ручная проверка кода стала узким местом. Anthropic ускорила этот процесс, сочетая автоматизированные агентные и детерминированные проверки. Человеческое ревью осталось только для регулируемого или действительно критического кода. Несколько агентов автоматически проверяют каждый пулл-реквест, причём каждый агент сфокусирован на своей узкой области и использует RAG (Retrieval Augmented Generation) для контекста. Такие агенты даже генерируют доказательства валидности своих находок, что повысило долю PR с содержательными комментариями с 16% до 54% и позволило бы выявить около трети прошлых инцидентов. Кодовая база делится по уровням риска, и для особо чувствительных частей сохраняется строгий человеческий контроль.
На этапе развёртывания (CD) автоматизированные динамические сканирования уязвимостей (DAST) на базе ИИ помогают найти сложные логические ошибки, которые статические анализаторы пропускают. Claude уже помог исправить более 500 высокоприоритетных уязвимостей в открытом исходном коде.
На этапе мониторинга Claude помогает при реагировании на инциденты: анализирует производственные логи, определяет корневые причины, пишет посмертные отчёты и даже предлагает исправления. Однако агент не может автоматически развернуть исправление. Это связано с принципом разделения обязанностей и жёстких границ: агент, который находит проблему, не имеет прав на её автоматическое исправление. Этот опыт привёл к переосмыслению моделей идентификации агентов и их взаимодействия.
Anthropic показывает, что скорость разработки с ИИ требует не ослабления, а переосмысления безопасности. Люди остаются в процессе, но их роль смещается — от рутинных проверок к управлению сложными агентами и критическим решениям, что соответствует принципам «нулевого доверия» (Zero Trust) для ИИ-агентов.