От внутренних состояний до внешних действий
В статье представлен структурированный обзор техник, позволяющих сделать ИИ-системы безопасными и полезными. Ключевое разделение происходит по типу данных, используемых для обучения: на основе внутренних состояний модели (internals) или на основе выходных данных (outputs). Подход с использованием внутренних состояний предполагает применение их как сигнала вознаграждения, что позволяет проводить процессный надзор (process supervision), в том числе за цепочками рассуждений (Chain of Thought).
Три столпа обучения: SFT, RL и декларативные знания
Авторы выделяют три основных типа целей обучения, которые можно комбинировать:
- Имитационное обучение (SFT): Обучение на примерах желаемого поведения.
- Обучение с подкреплением (RL): Оптимизация на основе результата (outcome-based objective).
- Декларативные знания: Внедрение фактов и историй на этапе mid-training, чтобы сформировать у модели «персону» доброжелательного помощника.
Стратегии контроля и ансамблирование
Помимо прямого обучения политик (policy), рассматриваются методы оркестрации и мониторинга. К ним относится создание ансамблей из потенциально несовместимых моделей с последующей выборкой отказов (rejection sampling) для отсечения опасных действий. Также упоминается концепция «факторизированного познания» (factored cognition), при которой сложные задачи разбиваются на части, которые ИИ не может саботировать. Критическим элементом здесь остаются методы интеррогации, такие как дебаты (debate), для выявления скрытых намерений.
Сравнительная таблица подходов
| Категория | Метод | Суть и применение |
|---|---|---|
| Данные | Internals-based | Использование внутренних состояний как сигнала вознаграждения; надзор за CoT. |
| Данные | Outputs-based | Оптимизация на основе финального ответа модели. |
| Цель | SFT (Imitation) | Имитация примеров хорошего поведения. |
| Цель | RL (Outcome) | Максимизация полезного результата через подкрепление. |
| Цель | Declarative | Внедрение фактов и нарративов о «хорошем» поведении. |
| Архитектура | Ensembling | Комбинация моделей с rejection sampling для фильтрации плохих действий. |
Почему это важно
Эта таксономия помогает исследователям и инженерам систематизировать хаос в области AI Alignment. Понимание того, где именно в конвейере обучения (на этапе данных, цели или архитектуры) применяется та или иная техника, позволяет точнее оценивать риски и выбирать оптимальные стратегии для предотвращения саботажа и обеспечения безопасности ИИ.
Источник: LessWrong ↗
