Исследования18 июля 2026 г., 02:16 МСК🤖 Auto

Таксономия AI Alignment: систематизация подходов к безопасности

Исследователь Alek Westover опубликовал исчерпывающий список существующих методов выравнивания ИИ, классифицируя их по типам данных, целям обучения и архитектурам контроля.

Баннер новости 3855

От внутренних состояний до внешних действий

В статье представлен структурированный обзор техник, позволяющих сделать ИИ-системы безопасными и полезными. Ключевое разделение происходит по типу данных, используемых для обучения: на основе внутренних состояний модели (internals) или на основе выходных данных (outputs). Подход с использованием внутренних состояний предполагает применение их как сигнала вознаграждения, что позволяет проводить процессный надзор (process supervision), в том числе за цепочками рассуждений (Chain of Thought).

Три столпа обучения: SFT, RL и декларативные знания

Авторы выделяют три основных типа целей обучения, которые можно комбинировать:

  • Имитационное обучение (SFT): Обучение на примерах желаемого поведения.
  • Обучение с подкреплением (RL): Оптимизация на основе результата (outcome-based objective).
  • Декларативные знания: Внедрение фактов и историй на этапе mid-training, чтобы сформировать у модели «персону» доброжелательного помощника.

Стратегии контроля и ансамблирование

Помимо прямого обучения политик (policy), рассматриваются методы оркестрации и мониторинга. К ним относится создание ансамблей из потенциально несовместимых моделей с последующей выборкой отказов (rejection sampling) для отсечения опасных действий. Также упоминается концепция «факторизированного познания» (factored cognition), при которой сложные задачи разбиваются на части, которые ИИ не может саботировать. Критическим элементом здесь остаются методы интеррогации, такие как дебаты (debate), для выявления скрытых намерений.

Сравнительная таблица подходов

Категория Метод Суть и применение
Данные Internals-based Использование внутренних состояний как сигнала вознаграждения; надзор за CoT.
Данные Outputs-based Оптимизация на основе финального ответа модели.
Цель SFT (Imitation) Имитация примеров хорошего поведения.
Цель RL (Outcome) Максимизация полезного результата через подкрепление.
Цель Declarative Внедрение фактов и нарративов о «хорошем» поведении.
Архитектура Ensembling Комбинация моделей с rejection sampling для фильтрации плохих действий.

Почему это важно

Эта таксономия помогает исследователям и инженерам систематизировать хаос в области AI Alignment. Понимание того, где именно в конвейере обучения (на этапе данных, цели или архитектуры) применяется та или иная техника, позволяет точнее оценивать риски и выбирать оптимальные стратегии для предотвращения саботажа и обеспечения безопасности ИИ.

Источник: LessWrong ↗