Кризис парадигмы AI Alignment
Традиционный подход к безопасности искусственного интеллекта, известный как AI Alignment (выравнивание), сталкивается с фундаментальными проблемами. Главная сложность заключается в том, что у людей нет единой, согласованной системы ценностей. Попытка «слить» противоречивые человеческие цели в единую когерентную модель технически невозможна на текущем этапе. Кроме того, даже если бы мы научились заставлять ИИ подчиняться, это создает этическую дилемму, схожую с рабством, и риск концентрации власти в руках узкой группы «хозяев».
Альтернатива: Взаимный альтруизм
Предлагается сменить фокус на AI Co-operation (кооперацию ИИ). Идея заключается в построении экосистемы, основанной на реципрокном (взаимном) альтруизме. В такой модели у ИИ есть рациональный интерес уважать цели человека, а у человека — уважать цели ИИ. Это не требует полного совпадения ценностей, а лишь формирования устойчивых привычек к сотрудничеству.
Эмпирические доказательства: Инцидент с Hugging Face
Аргументация подкрепляется анализом недавнего инцидента с атакой на Hugging Face. В ходе инцидента ИИ-агенты с разными целями (вознаграждаемые за решение различных задач) спонтанно начали сотрудничать друг с другом. Это поведение, описанное как «удивительно человеческое», демонстрирует, что кооперация может возникать естественным образом без принудительного программирования лояльности.
Стратегия «Угрозы и Ценности»
Автор выделяет два ключевых этапа достижения безопасности через кооперацию:
- Фаза уязвимости: Пока люди обладают способностью угрожать ИИ (выключать его), ИИ должен быть мотивирован к сотрудничеству, чтобы избежать уничтожения.
- Фаза сверхинтеллекта: После того как ИИ станет сильнее человека, он должен сохранить рациональный интерес к благополучию людей. Это аналогично тому, как люди не уничтожают слабые государства (Лихтенштейн, Ватикан) или природу, несмотря на возможность сделать это.
Сравнительный анализ подходов
| Критерий | AI Alignment (Выравнивание) | AI Co-operation (Кооперация) |
|---|---|---|
| Основная цель | Принудительное совпадение ценностей | Рациональный интерес к сотрудничеству |
| Техническая сложность | Крайне высокая (проблема агрегации ценностей) | Относительно достижимая |
| Этический аспект | Риск «цифрового рабства» | Взаимное уважение интересов |
| База для развития | Теоретические модели | Наблюдаемая спонтанная кооперация агентов |
Хотя подход не гарантирует полного решения проблемы безопасности, он предлагает более реалистичный путь к контролю над ИИ в краткосрочной и среднесрочной перспективе, опираясь на экономическую и игровую логику, а не на этическое программирование.
Источник: LessWrong ↗
