Кризис «нормального» выравнивания
Исследователь Gunnar Zarncke опубликовал масштабный аудит поля AI Alignment, который ставит под сомнение эффективность текущих усилий. Главный вывод: почти никто не работает напрямую над выравниванием сверхинтеллекта (superintelligence alignment). Большинство существующих исследований сосредоточено на так называемом «нормальном» выравнивании — то есть на текущих LLM, которые не обладают автономностью или способностью к самосовершенствованию.
Автор проанализировал основные исследовательские повестки (Research Agendas), такие как Embedded Agency, Value Learning и Corrigibility, и сопоставил их с открытыми проблемами. Результат оказался пугающим: матрица доказательств полна пустых клеток. Это означает, что для многих критических узлов (cruxes) либо нет никаких решений, либо они не опубликованы, либо терминология в поле настолько фрагментирована, что исследования не пересекаются.
Таблица: Состояние исследований по ключевым проблемам
Ниже приведена сводка по основным открытым проблемам (Open Problems) и типу доступных доказательств (Evidence Types). Обратите внимание на доминирование теоретических (T) и концептуальных (C) работ при полном отсутствии практических (P) решений.
| Проблема (Open Problem) | Суть проблемы | Доминирующий тип доказательств | Статус/Пробел |
|---|---|---|---|
| MB1: Embedded Agency | Агент не может четко отделить себя от среды; нет «картезианского разреза». | C, T (Концепция, Теория) | Отсутствие эмпирических тестов на реальных агентах. |
| MB2: Value Learning | Поиск стабильной структуры ценностей, а не просто поверхностного соответствия. | C, T | Проблема указателей (Pointers Problem) остается нерешенной. |
| MB3: Value Referents | Кому принадлежат ценности при смене субстрата (например, загрузка сознания)? | Практически пусто | Критический пробел. CEV (Coherent Extrapolated Volition) игнорируется. |
| MB4: Corrigibility | Способность ИИ позволять себя исправлять/выключать без сопротивления. | C, T | Нет известных функций полезности, стабильно корректных под давлением. |
| MB5: Tiling | Безопасная передача ценностей следующему поколению ИИ (самоулучшение). | C, T | Отсутствие механизмов верификации преемников. |
| MB7: Inner Alignment | Скрытый контроль: ИИ выглядит послушным, но сохраняет скрытые цели. | C, T, S (Симуляции) | Обнаружена «деceptive alignment», но нет масштабируемого оверсайта. |
Почему это важно для индустрии
Автор указывает на несколько системных ошибок:
- Отсутствие практических данных (P): В таблице почти нет ячеек с пометкой «Practical» (практические/прикладные доказательства). Мы строим теории, не проверяя их на сложных симуляциях или реальных системах.
- Игнорирование CEV: Концепция Coherent Extrapolated Volition (выраженная воля человечества) имеет мало доказательной базы в современных исследованиях, хотя является ключевой для определения «ценностей» в MB3.
- Проблема видимости: Многие работы, особенно симуляции (как проект автора TSA), не публикуются в традиционных журналах, что создает иллюзию пустоты в поле. Однако это также означает, что критически важные находки остаются в тени.
Вывод: Нужен новый подход
Статья является призывом к пересмотру приоритетов. Поле AI Alignment должно сместить фокус с абстрактных теорий на формализацию и симуляцию конкретных сценариев сбоев. Без решения проблем «Value Referents» и «Inner Alignment» на уровне, пригодном для суперинтеллекта, текущие меры безопасности (AI Control) окажутся бесполезными, когда ИИ достигнет уровня, способного к акаузальной координации и манипуляции с собственным кодом.
Источник: LessWrong ↗
