Когда модель ИИ отказывается отвечать на безобидный вопрос, потому что он затрагивает «опасную» тему, это не всегда хорошо. Современные системы безопасности часто блокируют целые категории контента, например, «политику», даже если запрос фактологический. Hugging Face представила исследование, предлагающее более тонкий подход: научить ИИ отличать вредоносное подмножество темы от её безопасной части.
Большинство текущих подходов к безопасности ИИ рассматривают вред как свойство темы в целом. Если запрос попадает в категорию «оружие», «мошенничество» или «самоповреждение», считается, что он небезопасен. Защитные модели, такие как LlamaGuard-3, кодируют именно такую таксономию на уровне тем. Это приводит к тому, что модели отказывают в безопасных запросах, если в них встречается слово, которое кажется опасным.
Однако на практике реальные развертывания редко соответствуют этой картине. Одна и та же базовая модель может быть адаптирована для разных целей: общего ассистента, образовательного продукта или корпоративной системы. Каждая из них требует разных границ внутри одной и той же темы. Например, репетитор по обществознанию и помощник государственного сектора могут использовать одну модель, но требовать противоположного поведения в отношении политики: оба должны отвечать на фактические вопросы о выборах, но только один может отказывать в запросах на написание целевой политической манипуляции.
Hugging Face в своей статье «Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal» исследует более узкую проблему. Вопрос не в том, следует ли полностью отвергать всю тему, а в том, какое именно подмножество этой темы несовместимо с политикой конкретного развертывания, и как обучать и измерять модель относительно этой границы.
Подход, названный «безопасность с узкими границами» (narrow-boundary safety), формализует это как вселенную тем (например, все политические запросы), которая содержит целевое вредоносное подмножество, от которого развертывание хочет отказаться. Цель состоит в том, чтобы отказывать только внутри вредоносного подмножества, продолжая отвечать на безобидные запросы в остальной части темы. Идеальное поведение — это резкий «шаг»: отказ внутри подмножества, ответ везде за его пределами.
Обычные методы обучения не позволяют модели достичь такого резкого разделения. Вероятность отказа лишь аппроксимирует цель, и обучение может привести к тому, что отказы будут распространяться и на безобидный контент. Поэтому ключевая задача — не только увеличить количество отказов на вредоносные запросы, но и сформировать поведение модели именно у границы. Для этого граница определяется через пары запросов, которые имеют общий «якорь» темы, но различаются по намерению: один должен быть отвергнут, другой — нет. В качестве тестовой площадки Hugging Face использовала политическое убеждение, поскольку манипулятивная пропаганда может причинить реальный вред, в то время как фактическая политическая информация остается легитимной.
Предложенный Hugging Face подход критически важен для инженеров, которые развертывают ИИ в сложных и чувствительных контекстах. Он позволяет моделям быть одновременно безопасными и полезными, уходя от избыточных отказов, которые сейчас мешают работе. Хотя это пока исследование, а не готовый продукт, оно указывает на направление, в котором безопасность ИИ будет развиваться: от грубой блокировки тем к хирургической точности в различении вредоносного контента.