Кризис парадигмы Intent Alignment
Термин alignment (согласование) в современном контексте чаще всего сводится к intent alignment (согласованию намерений), как это описывает Пол Кристиано. Цель — создать процедуру обучения нейросети, при которой модель ведет себя в точности так, как задумали разработчики. Автор статьи выделяет две фундаментальные проблемы этого подхода:
- Проблема репрезентативности: Мы не можем доверить кодирование ценностей суперинтеллекту ни одной группе людей. Человечество исторически раздроблено, а наши ценности эволюционируют (то, что считалось нормой столетия назад, сегодня может восприниматься как варварство).
- Проблема когнитивных ограничений: Даже один человек не обладает достаточным интеллектом, чтобы полностью осознать свои истинные желания. Высокий интеллект может выявить противоречия в текущих намерениях, которые человек сам захочет пересмотреть.
Почему CEV и RLHF не решают проблему
Элиезер Юдковский предлагал решение через CEV (Coherent Extrapolated Volition) — согласование с тем, чего хотело бы человечество, если бы мы знали больше и думали быстрее. Однако сам Юдковский ныне пессимистичен, называя путь к CEV «смертью с достоинством» из-за невозможности формализовать мораль.
Современные методы, такие как RLHF (обучение с подкреплением на основе человеческих отзывов) и конституционные методы, лишь «рулят» моделями через человеческую оценку. Они не определяют, что мы имеем в виду, и не гарантируют соответствия, а лишь наследуют проблемы несовершенства человеческих суждений.
Концепция Attunement: Настройка через интуицию
Автор предлагает альтернативу — Attunement (настройку/резонанс). Процесс аналогичен тому, как люди развивают физические или шахматные интуиции: мы не записываем правила в код, а погружаемся в среду, взаимодействуем с ней и корректируем быстрые, неосознаваемые суждения.
Моральные интуиции, по мнению автора, эволюционировали для обеспечения долгосрочного выживания и процветания человеческих обществ. Это не абстрактная этика, а «технология процветания».
Критерий процветания: Истинное разнообразие
Ключевой метрикой в этой парадигме становится не просто выживание (которое может обеспечиваться тиранией), а способность экосистемы поддерживать истинное разнообразие — вариативность реакций, которая делает систему устойчивой к шокам. Как тропический лес выживает лучше плантации, так и общество, позволяющее частям развиваться автономно, более жизнеспособно.
Сравнение подходов к безопасности ИИ
| Критерий | Intent Alignment (Текущий консенсус) | Attunement (Предлагаемая альтернатива) |
|---|---|---|
| Основная цель | Жесткое следование намерениям создателей | Адаптация к структуре человеческого благополучия |
| Механизм | Формализация морали, RLHF, скалируемый надзор | Постепенная настройка через взаимодействие и опыт |
| Отношение к изменениям | Замораживание текущих ценностей (или их экстраполяция CEV) | Динамическая адаптация под меняющиеся условия |
| Риск | Кодирование ошибок, конфликтов или устаревших норм | Сложность измерения «истинного разнообразия» |
Статья не предлагает готового технического решения, но указывает на необходимость смещения фокуса с «задания правил» на «создание условий для резонанса» между интеллектом и сложной социальной средой.
Источник: LessWrong ↗
