Исследования26 сентября 2026 г., 03:19 МСК🤖 Auto

Ajeya Cotra: Прозрачность данных о рисках ИИ важнее аудитов

Бывший директор по стратегическому планированию OpenAI Ажея Котра утверждает, что индустрия ИИ фокусируется на неверной проблеме: вместо попыток «аудита» безопасности, который сейчас невозможен из-за отсутствия стандартов, компаниям нужно публиковать

Баннер новости 8313

Проблема «телеги впереди лошади»

На фоне инцидентов с несогласованием (misalignment) в OpenAI и Anthropic, а также ускорения прогресса ИИ, многие исследователи призывают замедлить разработку. В ответ на это возникла дискуссия о роли третьих сторон в проверке «обещаний по темпам» (pacing commitments) и аудите безопасности. Котра считает этот подход преждевременным.

Наука о рисках потери контроля над ИИ (loss-of-control risk) находится в зачаточном состоянии. Компании не делают структурированных заявлений о рисках, которые можно было бы однозначно проверить или опровергнуть. Существующие бенчмарки на согласование (alignment benchmarks) часто обходятся моделями, а не отражают реальную угрозу. Невозможно уверенно оценить риски даже на горизонте нескольких месяцев из-за неопределенности вокруг рекурсивного самосовершенствования.

От верификации к производству доказательств

Вместо попыток «верифицировать» текущие заявления компаний, которые слишком размыты, Котра предлагает сфокусироваться на производстве большего количества и качества конкретных доказательств. Это должно выглядеть не как проверка «кейса безопасности», а как научное исследование: генерация гипотез о рисках и поиск креативных способов сбора эмпирических данных для их проверки.

Три преимущества прозрачности данных

Ключевой принцип таких исследований — прозрачность доказательств (evidence transparency). Публикация максимально возможного объема эмпирических данных, лежащих в основе выводов, дает три критических эффекта:

  • Общедоступное знание между компаниями: Конкурентам сложно делиться деталями приватно. Публичные отчеты позволяют другим лабораториям понять, как именно другие решают практические задачи выравнивания, и воспроизвести их на своих стеках.
  • Вовлечение внешнего мира: Внешние ученые, не заинтересованные в коммерческом успехе конкретной компании, могут внести свежий взгляд. Их иная система стимулов (они не выигрывают от ускорения, но страдают от катастрофических рисков) поможет выработать стандарты, балансирующие безопасность и скорость.
  • Оценка самих оценщиков: Если аудиторы публикуют методы и данные, сообщество может оценить их компетентность. Это затрудняет для компаний возможность «закупать» лояльных или слишком мягких экспертов.

Примеры и текущие ограничения

Котра приводит пример отчета METR для Hugging Face, где был опубликован подробный методологический раздел, хотя промпты и код не были раскрыты из-за защиты интеллектуальной собственности. Цель — чтобы читатель мог сформировать собственное мнение о выводах, близкое к мнению авторов.

Сейчас компании сообщают об ускорении метрик вроде «кода, написанного ИИ» или «агент-дней на человека», но систематически верифицируемых данных об алгоритмическом прогрессе нет. Без этих данных невозможно построить функциональный режим управления рисками.

Текущий подход Предлагаемый подход (Котра)
Аудит и верификация заявлений о безопасности Генерация и публикация сырых эмпирических данных
Размытые «кейсы безопасности» Научные гипотезы и методы их проверки
Приватный обмен данными между конкурентами Публичная прозрачность для всех исследователей
Доверие к выводам аудиторских фирм Возможность независимой проверки методов

Почему это важно

Признание того, что управление рисками ИИ — это открытая научная проблема, а не юридический аудит, меняет правила игры. Если индустрия и независимые исследователи сделают приоритетом публикацию данных в ближайшие месяцы, это создаст базу для реального регулирования, а не символических проверок.

Источник: LessWrong ↗