От RLHF к Mid-Training: новый рычаг влияния
Традиционные методы выравнивания, такие как RLHF (обучение с подкреплением на основе обратной связи от человека), часто применяются на этапе пост-обучения. Однако последние работы Geodesic и Anthropic (2026 год) демонстрируют, что более эффективный рычаг находится на стадии mid-training (позднее препро-обучение). Техники Alignment Pre-training (APT) и Model Spec Mid-training (MSM) показывают, что обучение модели на предсказании следующего токена в синтетических документах, описывающих «характер» ассистента, снижает риск misalignment и улучшает обобщение.
Проблема синтетики и «параллельная вселенная» нарративов
Существующие подходы опираются на искусственно сгенерированные истории. Это создает риски: модели могут распознавать синтетику и обесценивать её, а также возникает проблема коллапса энтропии и недостаточной разнообразия данных. Параллельно, исследования в области participatory AI (соучаствующего ИИ) научились извлекать сложные человеческие ценности через рассказы, дневники и нарративы, но эти данные редко используются для прямого обучения моделей из-за сложности их структурирования в правила или принципы.
Концепция «A Million Authors»
Автор статьи предлагает объединить эти два направления. Идея заключается в том, чтобы собрать миллион историй, написанных обычными людьми, о том, как ИИ-ассистент должен вести себя в различных ситуациях. Эти «живые» нарративы, прошедшие модерацию, могут стать ядром для mid-training открытых моделей. Это позволяет:
- Наполнить веса модели аутентичными, плюралистичными priors (априорными знаниями) об этичном поведении.
- Дать сообществу реальное влияние на поведение open-weight моделей, а не только право владения кодом.
- Избежать сжатия сложных человеческих норм до простых правил, сохраняя контекст и нюансы.
Сравнение подходов к выравниванию
| Критерий | Традиционный RLHF (Post-training) | Синтетический Mid-training (APT/MSM) | Предлагаемый подход (Participatory Mid-training) |
|---|---|---|---|
| Источник данных | Человеческие предпочтения (рейтинги A/B) | Сгенерированные ИИ истории/спеки | Нарративы от сообщества (1 млн авторов) |
| Глубина контекста | Низкая (сжатие до дискретных единиц) | Средняя (зависит от качества генерации) | Высокая (сохранение нюансов и сложности) |
| Риск коллапса | Манипуляция оптимизатором | Коллапс энтропии и распознавание синтетики | Минимизирован за счет разнообразия реальных голосов |
| Влияние сообщества | Косвенное (через аннотаторов) | Отсутствует | Прямое формирование «личности» модели |
Почему это важно?
Если эта концепция будет реализована, мы увидим переход от «алигмента сверху вниз» (где ценности навязываются узкой группой экспертов или синтетикой) к «алигменту снизу вверх». Модели станут частью общего достояния (commons), поведение которых формируется коллективным воображением и этическими нормами широкой аудитории, а не только корпоративными политиками.
Источник: LessWrong ↗
