Контекст: от саморегуляции к внешнему контролю
OpenAI опубликовала руководство «Priorities and principles for effective third party assessments» (Приоритеты и принципы эффективной оценки третьими сторонами). Документ описывает, как независимые исследователи и организации могут безопасно и эффективно проверять модели искусственного интеллекта на наличие уязвимостей, предвзятости и потенциально опасных функций.
Ранее OpenAI полагалась преимущественно на внутренние проверки. Теперь компания признает необходимость внешнего аудита для обеспечения безопасности передовых AI-систем, особенно в контексте растущего регулирования в США и ЕС.
Ключевые принципы оценки
В документе выделены несколько фундаментальных принципов, которым должны следовать оценщики:
- Безопасность прежде всего: Оценка не должна создавать новых рисков. Методы тестирования должны быть спроектированы так, чтобы избежать случайного раскрыния опасных знаний или создания вредоносного кода.
- Прозрачность и воспроизводимость: Результаты должны быть понятны широкой публике и научному сообществу. Методологии должны быть описаны достаточно подробно, чтобы другие могли воспроизвести тесты.
- Фокус на безопасности: Приоритет отдается выявлению рисков, связанных с биологической, химической, кибербезопасностью и дезинформацией, а не просто производительности.
- Сотрудничество: Оценщики должны делиться результатами с OpenAI для исправления уязвимостей, прежде чем публиковать их публично, чтобы дать компании время на патч.
Почему это важно для индустрии
Этот шаг знаменует сдвиг в парадигме регулирования AI. Вместо того чтобы ждать государственного вмешательства, OpenAI пытается создать стандарты для независимого аудита, аналогично тому, как это делается в авиации или ядерной энергетике.
Для разработчиков и исследователей это означает появление новых возможностей для участия в программах bug bounty и независимых аудитов. Для регуляторов — появление метрик, на которые можно опираться при оценке соответствия моделей стандартам безопасности.
Что дальше?
OpenAI планирует сотрудничать с выбранными третьими сторонами для пилотных проектов оценки. Ожидается, что в ближайшие месяцы появятся первые публичные отчеты о результатах таких независимых проверок, что повысит доверие к технологиям компании.
Источник: OpenAI ↗
