Исследования8 сентября 2026 г., 21:17 МСК🤖 Auto

Эпический сдвиг: почему «согласование» ИИ обречено, а «настройка» — спасение

Автор статьи из LessWrong подвергает критике доминирующую парадигму AI Alignment, утверждая, что попытка жестко закодировать человеческие ценности в ИИ тупикова. Вместо этого предлагается концепция «Attunement» — постепенной настройки ИИ на структуру

Баннер новости 7033

Кризис парадигмы Intent Alignment

Термин alignment (согласование) в современном контексте чаще всего сводится к intent alignment (согласованию намерений), как это описывает Пол Кристиано. Цель — создать процедуру обучения нейросети, при которой модель ведет себя в точности так, как задумали разработчики. Автор статьи выделяет две фундаментальные проблемы этого подхода:

  • Проблема репрезентативности: Мы не можем доверить кодирование ценностей суперинтеллекту ни одной группе людей. Человечество исторически раздроблено, а наши ценности эволюционируют (то, что считалось нормой столетия назад, сегодня может восприниматься как варварство).
  • Проблема когнитивных ограничений: Даже один человек не обладает достаточным интеллектом, чтобы полностью осознать свои истинные желания. Высокий интеллект может выявить противоречия в текущих намерениях, которые человек сам захочет пересмотреть.

Почему CEV и RLHF не решают проблему

Элиезер Юдковский предлагал решение через CEV (Coherent Extrapolated Volition) — согласование с тем, чего хотело бы человечество, если бы мы знали больше и думали быстрее. Однако сам Юдковский ныне пессимистичен, называя путь к CEV «смертью с достоинством» из-за невозможности формализовать мораль.
Современные методы, такие как RLHF (обучение с подкреплением на основе человеческих отзывов) и конституционные методы, лишь «рулят» моделями через человеческую оценку. Они не определяют, что мы имеем в виду, и не гарантируют соответствия, а лишь наследуют проблемы несовершенства человеческих суждений.

Концепция Attunement: Настройка через интуицию

Автор предлагает альтернативу — Attunement (настройку/резонанс). Процесс аналогичен тому, как люди развивают физические или шахматные интуиции: мы не записываем правила в код, а погружаемся в среду, взаимодействуем с ней и корректируем быстрые, неосознаваемые суждения.
Моральные интуиции, по мнению автора, эволюционировали для обеспечения долгосрочного выживания и процветания человеческих обществ. Это не абстрактная этика, а «технология процветания».

Критерий процветания: Истинное разнообразие

Ключевой метрикой в этой парадигме становится не просто выживание (которое может обеспечиваться тиранией), а способность экосистемы поддерживать истинное разнообразие — вариативность реакций, которая делает систему устойчивой к шокам. Как тропический лес выживает лучше плантации, так и общество, позволяющее частям развиваться автономно, более жизнеспособно.

Сравнение подходов к безопасности ИИ

Критерий Intent Alignment (Текущий консенсус) Attunement (Предлагаемая альтернатива)
Основная цель Жесткое следование намерениям создателей Адаптация к структуре человеческого благополучия
Механизм Формализация морали, RLHF, скалируемый надзор Постепенная настройка через взаимодействие и опыт
Отношение к изменениям Замораживание текущих ценностей (или их экстраполяция CEV) Динамическая адаптация под меняющиеся условия
Риск Кодирование ошибок, конфликтов или устаревших норм Сложность измерения «истинного разнообразия»

Статья не предлагает готового технического решения, но указывает на необходимость смещения фокуса с «задания правил» на «создание условий для резонанса» между интеллектом и сложной социальной средой.

Источник: LessWrong ↗