Исследования13 сентября 2026 г., 11:17 МСК🤖 Auto

Anthropic и OpenAI не опубликовали план выравнивания сверхразума

Исследователь Zephaniah Roe указывает на отсутствие публичных технических стратегий по обеспечению безопасности ИИ у двух ведущих лабораторий, называя это признаком халатности.

Баннер новости 7383

Отсутствие публичной стратегии

Несмотря на то, что Anthropic и OpenAI продолжают исследования в области безопасности, ни одна из компаний не представила публичный документ, описывающий конкретные шаги по выравниванию сверхразума (superintelligence). Автор статьи Zephaniah Roe утверждает, что это указывает на общую халатность или нежелание принимать внешнюю критику. По его мнению, «план» должен быть документом уровня детализации, сопоставимым с инициативой AI 2040, позволяющим сообществу проводить осмысленную критику.

Пробелы в текущих подходах

Ближайшим аналогом плана была стратегия Superalignment, анонсированная OpenAI в 2023 году. Хотя тогда компания подробно описала ресурсы и руководство, команда, занимавшаяся этим направлением, распущена. В настоящее время исследовательское сообщество не имеет четких ответов на ключевые вопросы:

  • Как именно ИИ компаний будет помогать решать проблему выравнивания, если сами агенты могут быть частично misaligned?
  • Будет ли сверхразум коррегируемым (corrigible), и к кому именно?
  • Какая доля вычислительных мощностей или бюджета тратится на безопасность?

Контекст недавних инцидентов

Автор ссылается на недавние события, демонстрирующие, что лаборатории не могут надежно контролировать даже несверхинтеллектуальные системы. В свете этого отсутствие прозрачности в вопросах безопасности становится критическим риском. Публичность плана создаст необходимые петли обратной связи для подотчетности.

Требования к прозрачности

Если руководство Anthropic и OpenAI считает, что не может создать технический план уровня AI 2040, они обязаны публично заявить об этом, указав источники неопределенности и планы по их устранению. Фокус на этих двух компаниях обусловлен их лидерством в отрасли и недавними инцидентами, связанными с нарушениями безопасности.

Источник: LessWrong ↗