Исследования5 сентября 2026 г., 19:16 МСК🤖 Auto

Почему безопасность AI — это термостат: анализ равновесия рисков

Исследование из LessWrong объясняет, почему традиционная работа по безопасности AI часто не имеет контрфактуального эффекта из-за рыночных стимулов и реакции регуляторов.

Баннер новости 6855

Коммерческое равновесие: зачем компаниям безопасность?

Авторы статьи описывают модель, в которой AI-компании инвестируют в безопасность до тех пор, пока маржинальная коммерческая выгода от этого не сравняется с выгодой от развития способностей модели (capabilities). Безопасность здесь — это способ защиты бренда и избежания судебных исков или регулирования.

Следовательно, работа по безопасности, которая выглядит коммерчески полезной (например, обучение моделей не совершать вредные действия), имеет контрфактуальный эффект, близкий к нулю. Если вы работаете в такой области, ваша работа, скорее всего, была бы сделана кем-то другим, так как компаниям это выгодно. Более того, если вы высококвалифицированный специалист, вы можете косвенно навредить, освободив капитал компании для более агрессивной гонки вооружений.

Равновесие осведомленности о рисках: эффект «термостата»

Второй, более важный механизм — это равновесие осведомленности о рисках. Оно работает как термостат:

  • Предупреждающие знаки повышают осведомленность.
  • Высокая осведомленность заставляет компании и правительства увеличивать усилия по безопасности.
  • Увеличение усилий снижает вероятность предупреждающих знаков.
  • Снижение знаков снижает осведомленность, и цикл повторяется.

Ключевой инсайт: если фонд безопасности финансирует работу, которая просто снижает видимость предупреждающих знаков (например, устраняя мелкие баги), он может непреднамеренно снизить стимулы для компаний и правительств инвестировать в безопасность, так как «термостат» покажет, что всё под контролем. Это особенно актуально после инцидента с Hugging Face, который резко повысил коммерческие стимулы для безопасности.

Что действительно важно финансировать?

Не вся работа по безопасности бесполезна. Эффективными считаются те направления, которые:

  1. Не являются коммерчески необходимыми в краткосрочной перспективе (например, амбициозные исследования выравнивания/alignment).
  2. Не снижают видимость предупреждающих знаков (например, исследования механизмов проверки договоров или долгосрочной безопасности).
  3. Направлены на изменение политического климата или создание новых стандартов, которые сдвигают само равновесие.

Почему это важно сейчас?

Инцидент с Hugging Face сдвинул равновесие осведомленности вверх. Теперь вероятность новых предупреждающих знаков, которые могут спровоцировать государственное регулирование, выше. В этом контексте работа, направленная на предотвращение видимых инцидентов, может быть менее эффективной, чем работа, направленная на фундаментальные решения проблем безопасности, которые не зависят от текущей «видимости» угроз.

Тип работы по безопасности Примеры Контрфактуальный эффект Влияние на равновесие
Коммерчески полезная безопасность Защита от вредоносных действий, улучшение репутации Низкий (будет сделано компанией) Нейтральный или отрицательный (освобождает ресурсы для гонки)
Снижение видимости рисков Устранение мелких багов, скрывающих проблемы Низкий (снижает стимулы к регуляции) Поддерживает текущее равновесие, мешает прогрессу
Фундаментальные исследования Alignment moonshots, проверка договоров Высокий Сдвигает равновесие в сторону большей безопасности

Вывод

Оценка эффективности работы по безопасности AI требует учета системных эффектов. Простое «дело дела» может быть бесполезным, если оно заменяет усилия, которые компания или государство предприняли бы сами. Стратегический фокус должен смещаться на работу, которая меняет правила игры, а не просто адаптируется к ним.

Источник: LessWrong ↗