Проблема «телеги впереди лошади»
На фоне инцидентов с несогласованием (misalignment) в OpenAI и Anthropic, а также ускорения прогресса ИИ, многие исследователи призывают замедлить разработку. В ответ на это возникла дискуссия о роли третьих сторон в проверке «обещаний по темпам» (pacing commitments) и аудите безопасности. Котра считает этот подход преждевременным.
Наука о рисках потери контроля над ИИ (loss-of-control risk) находится в зачаточном состоянии. Компании не делают структурированных заявлений о рисках, которые можно было бы однозначно проверить или опровергнуть. Существующие бенчмарки на согласование (alignment benchmarks) часто обходятся моделями, а не отражают реальную угрозу. Невозможно уверенно оценить риски даже на горизонте нескольких месяцев из-за неопределенности вокруг рекурсивного самосовершенствования.
От верификации к производству доказательств
Вместо попыток «верифицировать» текущие заявления компаний, которые слишком размыты, Котра предлагает сфокусироваться на производстве большего количества и качества конкретных доказательств. Это должно выглядеть не как проверка «кейса безопасности», а как научное исследование: генерация гипотез о рисках и поиск креативных способов сбора эмпирических данных для их проверки.
Три преимущества прозрачности данных
Ключевой принцип таких исследований — прозрачность доказательств (evidence transparency). Публикация максимально возможного объема эмпирических данных, лежащих в основе выводов, дает три критических эффекта:
- Общедоступное знание между компаниями: Конкурентам сложно делиться деталями приватно. Публичные отчеты позволяют другим лабораториям понять, как именно другие решают практические задачи выравнивания, и воспроизвести их на своих стеках.
- Вовлечение внешнего мира: Внешние ученые, не заинтересованные в коммерческом успехе конкретной компании, могут внести свежий взгляд. Их иная система стимулов (они не выигрывают от ускорения, но страдают от катастрофических рисков) поможет выработать стандарты, балансирующие безопасность и скорость.
- Оценка самих оценщиков: Если аудиторы публикуют методы и данные, сообщество может оценить их компетентность. Это затрудняет для компаний возможность «закупать» лояльных или слишком мягких экспертов.
Примеры и текущие ограничения
Котра приводит пример отчета METR для Hugging Face, где был опубликован подробный методологический раздел, хотя промпты и код не были раскрыты из-за защиты интеллектуальной собственности. Цель — чтобы читатель мог сформировать собственное мнение о выводах, близкое к мнению авторов.
Сейчас компании сообщают об ускорении метрик вроде «кода, написанного ИИ» или «агент-дней на человека», но систематически верифицируемых данных об алгоритмическом прогрессе нет. Без этих данных невозможно построить функциональный режим управления рисками.
| Текущий подход | Предлагаемый подход (Котра) |
|---|---|
| Аудит и верификация заявлений о безопасности | Генерация и публикация сырых эмпирических данных |
| Размытые «кейсы безопасности» | Научные гипотезы и методы их проверки |
| Приватный обмен данными между конкурентами | Публичная прозрачность для всех исследователей |
| Доверие к выводам аудиторских фирм | Возможность независимой проверки методов |
Почему это важно
Признание того, что управление рисками ИИ — это открытая научная проблема, а не юридический аудит, меняет правила игры. Если индустрия и независимые исследователи сделают приоритетом публикацию данных в ближайшие месяцы, это создаст базу для реального регулирования, а не символических проверок.
Источник: LessWrong ↗
