Исследования12 июля 2026 г., 16:16 МСК🤖 Auto

Модели не заменяют вкус исследователя: тест безопасности AI

Исследование LessWrong показало, что даже передовые языковые модели не могут автономно планировать безопасные эксперименты, уступая в «научном вкусе» более простым аналогам.

Баннер новости 3401

Суть эксперимента: предсказуемость vs. безопасность

Исследователь Дэни Ройтбург (Dani Roytburg) поставил вопрос: могут ли модели уровня frontier (SOTA) самостоятельно планировать исследования в области AI Safety, или им критически не хватает «научного вкуса» (research taste)? В отличие от исследований возможностей (capabilities), где работает принцип «Bitter Lesson» и brute-force, безопасность требует точности, так как ошибка может привести к развёртыванию несогласованной модели. Автор протестировал способность моделей предсказывать скрытые эксперименты из реальных научных статей, маскируя часть данных и предлагая варианты дополнения.

Ключевые метрики и результаты

Тестирование проводилось на четырёх различных научных статьях. Модели должны были восстановить скрытые утверждения и эксперименты. Результаты показали высокую вариативность: способность к предсказанию зависела не столько от размера модели, сколько от сложности самой статьи. Более того, топовые модели не всегда превосходят средние.

Модель Результат (восстановленные утверждения) Комментарий
Sonnet (SOTA) Сопоставим с Fable На бюджете 64 предложений Sonnet либо равен, либо превосходит Fable во всех четырёх статьях.
Fable Высокий, но не абсолютный Не демонстрирует явного превосходства над Sonnet в условиях ограниченного бюджета.
Малые модели Конкурентоспособны В некоторых случаях показывают результаты, близкие к SOTA, что ставит под сомнение линейность прогресса.

Проблема «One-shottedness» и онтологическая неоднозначность

Авторы выделяют две главные причины, почему автоматизация безопасности опасна без человеческого контроля. Во-первых, «проклятие однократности» (curse of one-shottedness): в безопасности нет безопасных циклов обратной связи. Ошибка в оценке безопасности может привести к развёртыванию модели до того, как ошибка будет обнаружена. Во-вторых, онтологическая неоднозначность: понятия вроде «схеминга» (scheming) или «манипулятивных мотивов» не имеют чётких определений. Модели могут генерировать правдоподобные, но системно ошибочные выводы, маскируясь под корректные исследования.

Вывод: человеческий «ров» (moat)

Исследование подтверждает, что автоматизированные AI-исследователи склонны к мотивированному рассуждению (motivated reasoning) и упускают из виду нулевые гипотезы и статистические артефакты. Способность модели «предсказывать» статью коррелирует с её безопасностью, но не гарантирует её. В будущем «предсказуемость» может стать метрикой для определения того, какие аспекты планирования остаются исключительно за человеком — так называемый «human moat» (человеческий ров), необходимый для предотвращения катастрофических ложноотрицательных результатов в оценке безопасности.

Источник: LessWrong ↗