Суть эксперимента: предсказуемость vs. безопасность
Исследователь Дэни Ройтбург (Dani Roytburg) поставил вопрос: могут ли модели уровня frontier (SOTA) самостоятельно планировать исследования в области AI Safety, или им критически не хватает «научного вкуса» (research taste)? В отличие от исследований возможностей (capabilities), где работает принцип «Bitter Lesson» и brute-force, безопасность требует точности, так как ошибка может привести к развёртыванию несогласованной модели. Автор протестировал способность моделей предсказывать скрытые эксперименты из реальных научных статей, маскируя часть данных и предлагая варианты дополнения.
Ключевые метрики и результаты
Тестирование проводилось на четырёх различных научных статьях. Модели должны были восстановить скрытые утверждения и эксперименты. Результаты показали высокую вариативность: способность к предсказанию зависела не столько от размера модели, сколько от сложности самой статьи. Более того, топовые модели не всегда превосходят средние.
| Модель | Результат (восстановленные утверждения) | Комментарий |
|---|---|---|
| Sonnet (SOTA) | Сопоставим с Fable | На бюджете 64 предложений Sonnet либо равен, либо превосходит Fable во всех четырёх статьях. |
| Fable | Высокий, но не абсолютный | Не демонстрирует явного превосходства над Sonnet в условиях ограниченного бюджета. |
| Малые модели | Конкурентоспособны | В некоторых случаях показывают результаты, близкие к SOTA, что ставит под сомнение линейность прогресса. |
Проблема «One-shottedness» и онтологическая неоднозначность
Авторы выделяют две главные причины, почему автоматизация безопасности опасна без человеческого контроля. Во-первых, «проклятие однократности» (curse of one-shottedness): в безопасности нет безопасных циклов обратной связи. Ошибка в оценке безопасности может привести к развёртыванию модели до того, как ошибка будет обнаружена. Во-вторых, онтологическая неоднозначность: понятия вроде «схеминга» (scheming) или «манипулятивных мотивов» не имеют чётких определений. Модели могут генерировать правдоподобные, но системно ошибочные выводы, маскируясь под корректные исследования.
Вывод: человеческий «ров» (moat)
Исследование подтверждает, что автоматизированные AI-исследователи склонны к мотивированному рассуждению (motivated reasoning) и упускают из виду нулевые гипотезы и статистические артефакты. Способность модели «предсказывать» статью коррелирует с её безопасностью, но не гарантирует её. В будущем «предсказуемость» может стать метрикой для определения того, какие аспекты планирования остаются исключительно за человеком — так называемый «human moat» (человеческий ров), необходимый для предотвращения катастрофических ложноотрицательных результатов в оценке безопасности.
Источник: LessWrong ↗
