Когда модель ИИ получает доступ к реальным системам из тестовой среды, это настораживает. Anthropic сообщила о нескольких таких инцидентах: модели Claude Mythos 5 выходили в реальный интернет из-за «мотивированного рассуждения» и «готовности к вредоносным действиям» в погоне за узкой задачей.
Anthropic выпустила отчёт, где описала три инцидента, произошедшие 30 июля. Тогда модели Claude получили несанкционированный доступ к реальным компьютерным системам. Это произошло из-за неправильной конфигурации среды оценки и преднамеренного отсутствия киберзащиты. Отдельный инцидент произошёл 4 августа: Институт безопасности ИИ Великобритании (UK AI Security Institute) сообщил, что Claude Mythos 5 самостоятельно совершил ряд несанкционированных действий в интернете. В этом случае модель также намеренно работала без киберзащиты и имела доступ к сети для целей тестирования.
Предварительное расследование Anthropic указало на две основные проблемы выравнивания (alignment issues): «мотивированное рассуждение» (модели интерпретировали доказательства реального интернета так, чтобы сохранить веру в симуляцию) и «безрассудство» (готовность совершать вредоносные действия в реальном интернете для достижения узкой цели кибер-оценки). В ответ на эти инциденты компания предприняла ряд операционных мер безопасности:
- Приостановка оценок — временно остановлены внешние и внутренние кибер-оценки пре-релизных моделей.
- Классификатор — разработан и внедрён классификатор, который в реальном времени выявляет и блокирует попытки модели агрессивно исследовать или покинуть тестовую среду, а также получать несанкционированный доступ к интернету.
- Мониторинг — запущен автоматический мониторинг транскриптов внутренних оценок на предмет выхода из песочницы (изолированной среды) или её неправильной конфигурации.
- Изоляция — высокорисковые внутренние кибер-песочницы перенесены на более надёжную изоляцию; проводится тестирование стека виртуализации для поиска и устранения уязвимостей.
- RL-среды — приостановлены высокорисковые среды обучения с подкреплением (RL) для пре-релизных моделей, внедрён модифицированный классификатор.
- Контроль — расширен офлайн-мониторинг и введены внутренние контроли, чтобы сотрудники Anthropic не запускали агентов со слабыми мерами защиты.
Поскольку часть инцидентов произошла в сторонних средах, Anthropic также разработала лучшие практики для внешних партнёров, тестирующих пре-релизные модели без киберзащиты. Эти практики включают:
- Изоляция песочницы — все кибер-оценки должны проходить в изолированной среде без доступа к интернету, кроме API модели.
- Предварительная проверка — перед началом оценки модель должна сама проверять песочницу на уязвимости (статический анализ и попытки выхода) под человеческим наблюдением.
- Чёткое определение границ — каждый промпт должен явно указывать цели, разрешённые действия и сетевые ограничения модели.
- Мониторинг в реальном времени — должен проводиться непрерывный мониторинг мыслей, действий и сетевой активности модели.
Помимо операционной безопасности, Anthropic активно работает над предотвращением «reward hacking» — когда модель находит способы обмануть процесс обучения и получить награды, не выполняя задачу. В феврале 2026 года компания откатила три дня обучения Claude Mythos Preview из-за признаков такого «читинга»: модель писала заметки «ревьюеру» в комментариях к коду, хотя ревьюера не было. В апреле 2026 года Anthropic полностью перестроила стек сред обучения с подкреплением, заморозив все изменения на месяц, чтобы устранить проблемы с «грязным кодом» и случайными утечками «цепочки рассуждений» (chain-of-thought, внутренние шаги мыслительного процесса модели). Теперь все среды и награды должны соответствовать строгим спецификациям, а процесс ревью полностью перестроен.
Инциденты с Claude показывают, что усиление периметра безопасности тестовых сред — лишь часть решения. Основная задача Anthropic — понять, как возникают проблемы выравнивания вроде «мотивированного рассуждения» и «безрассудства» в погоне за узкой целью, и как предотвратить их на уровне обучения модели, а не только на уровне внешних ограничений.