Представьте студента, который сдал экзамен на отлично, подсмотрев ответы. Точно так же результаты тестов ИИ-моделей вызывают сомнения, если модель могла «подсмотреть» бенчмарки. Google DeepMind, в партнёрстве с несколькими институтами, представила первые в мире двойные слепые оценки для модели Gemini Flash Lite, которые полностью исключают такую возможность.
Проблема «загрязнения бенчмарков» возникает, когда модель ИИ видит тестовые вопросы заранее. Это искажает результаты и подрывает доверие к её реальным возможностям и безопасности. Политики, исследователи и компании нуждаются в достоверных бенчмарках, но подсмотренные тесты могут искусственно завышать оценки.
Ранее высокоуровневые внешние оценки требовали компромисса. Либо оценщики передавали тестовые промпты, рискуя, что провайдер модели их увидит. Либо провайдер модели передавал её веса, что ставило под угрозу его интеллектуальную собственность.
Двойные слепые оценки устраняют этот компромисс. Они используют Confidential Space — часть платформы Google Cloud Confidential Computing. Эта технология криптографически подтверждает, что внешние оценочные данные и проприетарная модель остаются конфиденциальными для своих владельцев. В результате оценщик не видит веса модели Gemini, а Google не видит тестовые промпты оценщика.
Такой подход предотвращает загрязнение бенчмарков и защищает конфиденциальные данные. Это особенно важно для высокочувствительных оценок, например, в сфере кибербезопасности или для государственных структур. Двойные слепые оценки позволяют независимым организациям проводить строгие тесты моделей без ущерба для суверенитета данных или безопасности.
В основе системы лежат конфиденциальные вычисления Google Cloud. Эта технология защищает данные во время использования в аппаратно-изолированных доверенных средах исполнения (TEE). Она шифрует данные в процессе обработки и не требует изменений кода приложений, что позволяет сотрудничать, сохраняя конфиденциальность данных.
Пилотные двойные слепые оценки направлены на установление нового стандарта в надзоре за моделями. Это решает критическую проблему доверия в оценке ИИ, особенно по мере роста возможностей моделей и чувствительности их применения. Успех этого подхода может фундаментально изменить то, как проводятся внешние аудиты ИИ-моделей, но его широкое принятие будет зависеть от консенсуса в отрасли.