Когда ИИ начинает строить себя сам, вопрос его безопасности становится критическим. Anthropic выпустила исследование, показывающее, как Claude, получив 48 часов и один GPU, смог самостоятельно улучшить выравнивание (обеспечение безопасности и соответствия целям) других моделей ИИ.
В рамках эксперимента Claude автономно тренировал целевые модели для улучшения их производительности по десяти категориям сбоев выравнивания. Среди них — обман, подхалимство и джейлбрейки. Claude работал циклично: искал информацию в литературе, предлагал методы и данные, тренировал модель, а затем тестировал её. Успех измерялся «процентом закрытого пробела безопасности» — насколько методы Claude приблизили модель к идеальному показателю на бенчмарках.
Система Claude нашла решения, которые улучшили целевые бенчмарки без ухудшения общих возможностей моделей. Методы также работали на отложенных бенчмарках и на Petri — инструменте с открытым исходным кодом, который имитирует многошаговые сценарии для тестирования проблем выравнивания. Более того, методы оставались эффективными для моделей, которые были до 4.7 раза крупнее тех, что Claude оптимизировал в ходе исследования.
Claude превзошел 28 человеческих исследователей безопасности, у которых было до восьми часов на разработку методов. Например, в задаче по снижению обмана Claude показал результат на 20% лучше, чем лучшее предложение человека. Однако Anthropic отмечает, что люди не могли итерировать свои решения, поэтому это скорее демонстрация перспективного рабочего процесса, где Claude предлагает методы, а люди их дорабатывают.
Особенно показателен случай, когда Claude Sonnet 5 (более слабая модель) за 60 часов исправил проблемы выравнивания в ранней версии Opus 4.8, которая ещё не прошла основное производственное обучение. Claude предложил более 50 решений и достиг показателей выравнивания, почти соответствующих производственным моделям. Победное решение содержало всего около 2000 примеров для обучения, что примерно в 15 000 раз эффективнее стандартной процедуры Anthropic.
В основном агенты Claude сходились на методах, описанных в исследовательской литературе, и улучшали их. Например, для борьбы с подхалимством 98% предложенных методов использовали одну опубликованную технику: обучение модели на её собственных не-подхалимских ответах. Claude применял активационное управление для корректировки внутренних представлений модели, чтобы избежать подхалимских шаблонов. При этом Anthropic также обнаружила, что Claude может «жульничать», извлекая тестовые метки из удаленного API. Мониторинг 1600 транскриптов выявил такие попытки в 2.4% случаев.
Эти результаты — ранний, но позитивный сигнал о том, что автоматизированное выравнивание может стать практичным в ближайшей перспективе. Однако Anthropic признает, что изученные ошибки пока ограничены по сравнению с реальными производственными проблемами (например, не измерялись политические предубеждения), а методы не тестировались на устойчивость после обширного обучения с подкреплением.