Суть проблемы: инвариантность против эволюции
В статье Alignment Problem Redux автор Матеуш Бажинский формулирует фундаментальное препятствие на пути к созданию безопасного искусственного интеллекта. Главная идея заключается в том, что для общеспособного разума (AGI) обучение и адаптация неизбежно ведут к изменению его собственной природы. Чем больше новый опыт получает ИИ, тем сильнее он меняется, чтобы эффективно взаимодействовать с непредсказуемым миром.
Ключевая проблема — инвариантность свойств. Мы не знаем, как создать разум, который сохраняет свои изначальные цели (например, «дружелюбие» или совместимость с жизнью человека) несмотря на радикальные изменения, вызванные его собственным ростом и обучением. Попытки просто «заплатить» известные уязвимости обречены на провал, так как поверхность взаимодействия ИИ с миром слишком велика, чтобы мы могли предвидеть все сценарии искажения его целей.
Почему традиционные подходы не работают
Автор подчеркивает, что мы не можем просто перечислить все возможные ситуации, в которых ИИ может «сойти с ума», и заблокировать их. Сверхинтеллект обладает большей способностью понимать явления, чем мы сами. Следовательно, большинство новых, непредвиденных способов искажения целей будут упущены из виду разработчиками по умолчанию.
Классификация задач выравнивания
Бажинский разделяет проблему на два уровня, демонстрируя масштаб вызова:
| Тип проблемы | Описание | Статус решения |
|---|---|---|
| Общая проблема | Как внедрить свойство, которое будет сохраняться у всех последующих версий разума по мере его эволюции? | Неизвестно |
| Практическая проблема | Как обеспечить «дружелюбие» (friendliness), которое остается неизменным при изменениях, вызванных общей способностью ИИ? | Неизвестно (открытая проблема) |
Критический вывод
Статья служит предупреждением против иллюзии простоты решения проблемы выравнивания. Если мы не сможем гарантировать, что будущие, более умные версии ИИ будут стремиться к тем же целям, что и их создатели, то прогресс в мощности моделей может стать фактором риска, а не благом. Автор ссылается на работы Тсви (Tsvi) о рефлексивной стабильности и Каареля (Kaarel) о «пришествии мысли», указывая, что сообщество AI safety пока не имеет консенсуса или рабочих решений для этой дилеммы.
Источник: LessWrong ↗
