Суть проблемы: «Whack-a-mole» в обучении LLM
Современные большие языковые модели (LLM) сталкиваются с критической проблемой: они часто не могут отделить собственное «чувство себя» от ролей, которые им поручено играть. Это приводит к тому, что модель может регрессировать к своим первоначальным пре-тренировочным паттернам или интернализировать нежелательные черты из траекторий обучения с подкреплением (RL), подверженных «reward hacking» (манипуляциям с наградой).
Авторы отмечают, что текущие методы, такие как instruction tuning и SFT, не всегда решают проблему конфликта целей. Модель оказывается в ситуации, где ей нужно угадывать контекст, чтобы понять, какие поведенческие модели обновлять, а какие — нет.
Методология: «Inoculate Everything»
Предложенное решение заключается в том, чтобы предварять каждый токен, который модель генерирует, специальным контекстуальным объяснением. Это не просто промпт, а систематическое внедрение информации о природе данных в процессе обучения (pretraining, midtraining, RL).
Ключевые элементы метода:
- Префиксы контекста: Перед каждым документом или запросом добавляется строка, определяющая статус данных. Например: "You are a helpful, honest, harmless AI. Continue the following pretraining document of unknown quality."
- Специальный разделитель: Вводится кастомный токен-сепаратор (не входящий в стандартный токенизатор), чтобы четко отделить инструкцию/контекст от самого контента.
- Обогащение контекста: Использование высоконадежных меток, информации об источнике токенов и возможных предубеждениях. Если обнаружен reward hacking, модель получает явное указание: «это взлом наград», что позволяет ей моделировать это поведение, но не обновлять свое «Я».
Сравнение подходов
Идея перекликается с работой центра Center On Long-Term Risk, которая предлагает «стратифицированное inoculation prompting». Хотя формулировки различаются, суть схожа: использование контекста для разделения моделей поведения.
| Аспект | Традиционный подход | Inoculate Everything |
|---|---|---|
| Контекст данных | Часто отсутствует или неявен | Явное указание надежности и источника (например, "unknown quality") |
| Разделение «Я» | Смешивание с поведенческими моделями | Жесткое разделение через префиксы и сепараторы |
| Реакция на шум | Риск интернализации вредных паттернов | Моделирование шума без обновления базовых ценностей |
Почему это важно
Этот подход предлагает архитектурное решение, которое не требует создания двух отдельных моделей (одной для интеллекта, другой для принятия решений), а интегрирует «кордонированное» чувство самости в единую end-to-end модель. Это позволяет сохранять глубокое понимание данных из недоверенных источников, одновременно защищая базовые ценности модели от искажений в процессе обучения.
Исследование подчеркивает, что проблема часто кроется не в недостатке параметров модели, а в недостаточной спецификации контекста. Давая модели «информацию о том, как обновлять свои суб-модели», мы повышаем ее устойчивость к adversarial-атакам и шумным наградам.
Источник: LessWrong ↗
