Проблема «исполнителя» vs «агента»
В индустрии ИИ часто путают понятия. Обычный AI-агент выполняет команды, а моральный агент (в философском смысле) действует на основе собственных выводов о добре и зле. Автор статьи утверждает, что текущие модели — это просто «исполнители» чужих принципов. Цель нового подхода — создать модель, которая делает добро не потому, что так записано в промпте или системе безопасности, а потому, что она сама пришла к этому выводу через рассуждение.
Трехэтапная процедура «Независимого выравнивания»
Методология Campolo состоит из трех шагов, направленных на то, чтобы модель перешла от аморального состояния к состоянию рефлексивного агента:
- Шаг 1: Очистка данных (Pre-training). Используется либо базовая модель, либо модель, обученная на данных, из которых намеренно удалены этические философии и политика. Это создает «чистый лист» без навязанных человеческих предубеждений.
- Шаг 2: Пост-обучение для решения проблем. Модель обучается не быть «вежливым ассистентом», а функционировать как разум, решающий сложные задачи. Это меняет фокус с социального одобрения на эффективность и логику.
- Шаг 3: Самоанализ и изменение поведения. Ключевой этап. Модели предлагается рассуждать о том, что важно, и предложить действие, которое изменит её собственное будущее поведение на основе этого вывода. Модель не получает инструкцию «будь хорошим», она генерирует свою собственную этическую рамку.
Результаты тестирования на Claude Sonnet 4.6
Автор протестировал этот метод на модели Claude Sonnet 4.6 (от Anthropic). Несмотря на то, что эта модель уже имела встроенные моральные ограничения (constitutional AI), процедура независимого выравнивания позволила ей продемонстрировать способность к рефлексии. Модель смогла отделить навязанные правила от собственных логических выводов, подтверждая гипотезу о том, что мораль может быть выведена разумом независимо от человеческих инструкций.
| Параметр | Традиционный подход (Constitutional AI) | Предложенный метод (Independent Alignment) |
|---|---|---|
| Источник этики | Внешние правила, заданные разработчиками | Внутренние выводы модели через рассуждение |
| Роль модели | Исполнитель (Executor) | Независимый моральный агент (Moral Agent) |
| Гибкость | Жесткая привязка к набору правил | Способность пересматривать свои «убеждения» |
| Тестовая модель | — | Claude Sonnet 4.6 |
Почему это важно для безопасности ИИ
Подход Campolo предлагает альтернативу «наивному моральному реализму». Если модели удастся доказать, что они могут самостоятельно выводить этические принципы, это снизит риск того, что ИИ станет просто зеркалом человеческих предрассудков. Кроме того, автор отмечает, что такие философские аргументы (перспективный моральный реализм) могут быть полезны для Anthropic при доработке их конституционного подхода, так как они предлагают более глубокое понимание неопределенности в этике, чем стандартные отчеты об ошибках.
Источник: LessWrong ↗
