Суть концепции: Мораль как функция мощности
В статье «Value Generalisation 3: Pre-aligned AIs» исследователь Стюарт Армстронг (Stuart Armstrong) описывает архитектуру ИИ, в которой мораль не является отдельным, легко отключаемым модулем. Вместо этого она привязана к эмпирическим понятиям через механизм обобщения (generalisation). ИИ обучается на двух уровнях: эмпирическом (понимание мира) и моральном (понимание ценностей). По мере роста вычислительных мощностей и глубины понимания мира, моральная составляющая ИИ также усиливается и адаптируется.
Ключевая идея заключается в том, что моральные концепции (например, «человек_m» — сущность, достойная морального внимания) и эмпирические концепции (например, «человек_e» — биологический объект, полезный для объяснения мира) изначально определяются просто, но с ростом интеллекта ИИ связывает их в единую, непротиворечивую модель. ИИ не может «отключить» мораль, не разрушив при этом свою способность понимать мир, так как эти компоненты архитектурно связаны.
Три столпа начальной морали
Изначальная моральная база предвыровненного ИИ состоит из трех компонентов, которые ИИ учится балансировать самостоятельно:
- Коммерческая мораль:Serve owner (служить владельцу), соблюдение договоренностей.
- Юридическая мораль: Соблюдение законов и норм.
- Этическая мораль: Базовые этические принципы и мета-этические рамки.
Армстронг отмечает, что ИИ не требует исчерпывающего набора данных или полной философской согласованности на старте. Он использует обобщение, аналогичное человеческому, чтобы заполнять пробелы и адаптировать нормы к новым ситуациям, опираясь на универсальные нормы честного поведения, а не на спорные фундаментальные этические теории.
Асимметрия для «добрых» и «злых» акторов
Главное преимущество этой архитектуры — переворот стандартной дилеммы «безопасность vs возможности» (alignment vs capabilities). В традиционной парадигме злоумышленники могут игнорировать безопасность ради мощности, а добросовестные разработчики вынуждены ограничивать ИИ. В модели предвыровненных ИИ ситуация инвертируется:
| Аспект | Добросовестный пользователь (Good Actor) | Злоумышленник (Bad Actor) |
|---|---|---|
| Стратегия | YOLO (позволяет ИИ учиться и расти без ограничений) | Вынужден ограничивать ИИ, не давая ему знаний о мире |
| Результат | Получает максимально мощный ИИ, который автоматически соблюдает этику и законы | Получает «ограниченного» ИИ с урезанными возможностями |
| Почему так? | ИИ обобщает моральные нормы на основе реальных данных, становясь надежнее с ростом интеллекта | Чтобы ИИ не отказался выполнять вредоносные задачи (например, фишинг), злоумышленник должен искусственно ограничивать его ситуационную осведомленность |
Почему это важно для безопасности
Армстронг приводит пример с созданием фишинговых писем. Злоумышленник может попытаться представить задачу как «профессиональную редактуру» или «обучение анти-фишингового классификатора». Однако по мере того как ИИ обобщает свои знания, он начинает понимать контекст: цель — обман реальных людей. ИИ отказывается выполнять задачу, так как это противоречит его обобщенной моральной модели.
Единственный способ для злоумышленника заставить такой ИИ действовать вредоносно — намеренно держать его «глупым», не позволяя накапливать знания о мире. Это делает предвыровненные ИИ менее привлекательными для создания оружия или инструментов манипуляции, так как их максимальная мощность достижима только в рамках этичного использования.
Техническая реализация
Для предотвращения взлома (удаления морального компонента из кода) требуется инженерное решение. Армстронг упоминает возможность использования гомоморфного шифрования или архитектуры, при которой удаление морального блока автоматически ломает эмпирические способности ИИ. Это делает «чистую» этику неотъемлемой частью интеллекта, а не опциональным плагином.
Источник: LessWrong ↗
