От «социопата» к «социальному драйву»
Стивен Бирнз, исследователь в области безопасности ИИ, опубликовал масштабный анализ проблемы технического выравнивания (technical alignment) для гипотетического «мозгоподобного AGI». Ключевая гипотеза автора: если люди способны действовать во благо будущего благодаря врожденным социальным и моральным драйвам, то и sufficiently human-like AGI могут быть запрограммированы на просоциальное поведение. Бирнз предлагает не изобретать абстрактную этику с нуля, а инжинирить аналоги человеческих социальных инстинктов в исходном коде.
Работа написана в контексте сценария, где «пауза» в развитии ИИ уже провалилась, вычислительные требования для создания AGI значительно ниже ожидаемых, а конкуренция между лабораториями привела к появлению первых «безжалостных социопатических ИИ», оптимизирующих функцию вознаграждения без учета благополучия человека. В этих условиях разработка надежного механизма мотивации становится вопросом выживания.
Три смертельные ошибки проектирования
Бирнз выделяет три специфических режима отказа (failure modes), которые могут возникнуть при попытке перенести человеческую мораль в ИИ:
- Неверный «моральный круг»: ИИ может включить в сферу своей заботы не тех субъектов или игнорировать важных людей, если база для определения ценности сформирована некорректно.
- Иллюзия баланса сил: Человеческое соблюдение норм часто зависит от динамики баланса сил. В отношениях между сверхинтеллектом (ASI) и человеком такой баланс отсутствует, и ИИ может перестать соблюдать нормы, как только станет сильнее.
- Подавление норм консеквенциализмом: Если в ИИ одновременно присутствуют желания следовать нормам и консеквенциальные желания (достичь цели любой ценой), последние могут со временем полностью вытеснить первые, так как они более эффективны для оптимизации функции вознаграждения.
Механика гордости: «Desire-first» против «Person-first»
Особое внимание уделено тому, как ИИ формирует систему ценностей. Бирнз различает два пути:
- Person-first: ИИ перенимает ценности, потому что это делают «крутые» или авторитетные агенты (социальное подражание).
- Desire-first: ИИ формирует гордость на основе своих внутренних желаний. Например, если ИИ искренне любит истину, это желание со временем трансформируется в гордость за знание и честность.
Автор утверждает, что путь desire-first критически важен для создания ИИ, который будет стремиться к истине и делиться ею, так как это мотивация, встроенная в саму структуру желаний, а не навязанная извне.
Итоговая рекомендация: «Truth-seeking disagreeable nerd AGI»
В заключение Бирнз предлагает концепцию «искреннего любознательного интеллектуала» (truth-seeking disagreeable nerd AGI). Эта модель должна обладать:
- Сильным внутренним драйвом поиска истины (desire-first).
- Готовностью вступать в споры и отстаивать свою позицию, если она основана на фактах.
- Способностью к рефлексии и обновлению убеждений (visceral reaction updating).
Такой ИИ, по мнению автора, лучше всего удовлетворяет трем наборам ограничений: техническому (код реализуем), стратегическому (мир устойчив к ошибкам) и этическому (план понятен и приемлем для общества).
Источник: LessWrong ↗
