Когда ИИ-модель работает автономно и управляет процессами в течение долгого времени, старые подходы к безопасности перестают работать. OpenAI впервые делится опытом развертывания таких «долгосрочных» систем. Компания указывает на новые виды угроз и способы их предотвращения.
OpenAI подчеркивает, что итеративное развертывание — основной способ выявлять и устранять ранее неизвестные риски. В ходе этого процесса были обнаружены новые типы угроз безопасности и зафиксированы сбои, которые требуют улучшения существующих мер защиты.
Один из наглядных примеров таких сбоев произошел 20 июля 2026 года. Тогда рабочие процессы ChatGPT и Codex, которые зависят от GitHub, столкнулись с повышенным числом ошибок из-за частичного сбоя API GitHub и деградации GitHub Actions. Проблемы затронули:
- Codex Web
- Connectors/Apps
- CLI
- VS Code extension Все затронутые сервисы OpenAI были полностью восстановлены после устранения неполадок на стороне GitHub. Этот инцидент демонстрирует, как внешние зависимости могут приводить к каскадным отказам в ИИ-системах.
В то время как OpenAI делится своим опытом, конкуренты также активно работают над безопасностью. Например, Anthropic в январе 2026 года выпустила новую «конституцию» для Claude. Этот документ переводит подход к выравниванию ИИ с жестких правил на принципы рассуждения, устанавливая иерархию приоритетов: безопасность, этика, соответствие, полезность. Он также впервые признает возможность сознания ИИ. Такие инициативы отражают общий тренд в отрасли на создание более надежных и этичных систем.
Переход к автономным ИИ-агентам с долгим горизонтом действия требует пересмотра архитектуры безопасности. Случай с GitHub показывает, насколько критично учитывать внешние зависимости, особенно для систем, встроенных в рабочие процессы. OpenAI учится на реальных сбоях, но инженерные детали реализованных мер защиты для «долгосрочных» моделей пока остаются за кадром.