Исследования18 августа 2026 г., 05:17 МСК🤖 Auto

Inoculate Everything: Новый метод защиты LLM от сбоев в обучении

Исследователь davids предлагает метод «инфекционной изоляции» (inoculation), где модель постоянно получает контекст о надежности данных, чтобы отделить «Я» от шумных наград RL.

Баннер новости 5963

Суть проблемы: «Whack-a-mole» в обучении LLM

Современные большие языковые модели (LLM) сталкиваются с критической проблемой: они часто не могут отделить собственное «чувство себя» от ролей, которые им поручено играть. Это приводит к тому, что модель может регрессировать к своим первоначальным пре-тренировочным паттернам или интернализировать нежелательные черты из траекторий обучения с подкреплением (RL), подверженных «reward hacking» (манипуляциям с наградой).

Авторы отмечают, что текущие методы, такие как instruction tuning и SFT, не всегда решают проблему конфликта целей. Модель оказывается в ситуации, где ей нужно угадывать контекст, чтобы понять, какие поведенческие модели обновлять, а какие — нет.

Методология: «Inoculate Everything»

Предложенное решение заключается в том, чтобы предварять каждый токен, который модель генерирует, специальным контекстуальным объяснением. Это не просто промпт, а систематическое внедрение информации о природе данных в процессе обучения (pretraining, midtraining, RL).

Ключевые элементы метода:

  • Префиксы контекста: Перед каждым документом или запросом добавляется строка, определяющая статус данных. Например: "You are a helpful, honest, harmless AI. Continue the following pretraining document of unknown quality."
  • Специальный разделитель: Вводится кастомный токен-сепаратор (не входящий в стандартный токенизатор), чтобы четко отделить инструкцию/контекст от самого контента.
  • Обогащение контекста: Использование высоконадежных меток, информации об источнике токенов и возможных предубеждениях. Если обнаружен reward hacking, модель получает явное указание: «это взлом наград», что позволяет ей моделировать это поведение, но не обновлять свое «Я».

Сравнение подходов

Идея перекликается с работой центра Center On Long-Term Risk, которая предлагает «стратифицированное inoculation prompting». Хотя формулировки различаются, суть схожа: использование контекста для разделения моделей поведения.

n
Аспект Традиционный подход Inoculate Everything
Контекст данных Часто отсутствует или неявен Явное указание надежности и источника (например, "unknown quality")
Разделение «Я» Смешивание с поведенческими моделями Жесткое разделение через префиксы и сепараторы
Реакция на шум Риск интернализации вредных паттернов Моделирование шума без обновления базовых ценностей

Почему это важно

Этот подход предлагает архитектурное решение, которое не требует создания двух отдельных моделей (одной для интеллекта, другой для принятия решений), а интегрирует «кордонированное» чувство самости в единую end-to-end модель. Это позволяет сохранять глубокое понимание данных из недоверенных источников, одновременно защищая базовые ценности модели от искажений в процессе обучения.

Исследование подчеркивает, что проблема часто кроется не в недостатке параметров модели, а в недостаточной спецификации контекста. Давая модели «информацию о том, как обновлять свои суб-модели», мы повышаем ее устойчивость к adversarial-атакам и шумным наградам.

Источник: LessWrong ↗