Исследования1 сентября 2026 г., 05:16 МСК🤖 Auto

Алигнмент по воле народа: как 1 млн историй изменят обучение ИИ

Исследователь Дикша Гупта предлагает использовать нарративы от сообщества для mid-training моделей, заменяя синтетические данные на живые истории о ценностях ИИ.

Баннер новости 6463

От RLHF к Mid-Training: новый рычаг влияния

Традиционные методы выравнивания, такие как RLHF (обучение с подкреплением на основе обратной связи от человека), часто применяются на этапе пост-обучения. Однако последние работы Geodesic и Anthropic (2026 год) демонстрируют, что более эффективный рычаг находится на стадии mid-training (позднее препро-обучение). Техники Alignment Pre-training (APT) и Model Spec Mid-training (MSM) показывают, что обучение модели на предсказании следующего токена в синтетических документах, описывающих «характер» ассистента, снижает риск misalignment и улучшает обобщение.

Проблема синтетики и «параллельная вселенная» нарративов

Существующие подходы опираются на искусственно сгенерированные истории. Это создает риски: модели могут распознавать синтетику и обесценивать её, а также возникает проблема коллапса энтропии и недостаточной разнообразия данных. Параллельно, исследования в области participatory AI (соучаствующего ИИ) научились извлекать сложные человеческие ценности через рассказы, дневники и нарративы, но эти данные редко используются для прямого обучения моделей из-за сложности их структурирования в правила или принципы.

Концепция «A Million Authors»

Автор статьи предлагает объединить эти два направления. Идея заключается в том, чтобы собрать миллион историй, написанных обычными людьми, о том, как ИИ-ассистент должен вести себя в различных ситуациях. Эти «живые» нарративы, прошедшие модерацию, могут стать ядром для mid-training открытых моделей. Это позволяет:

  • Наполнить веса модели аутентичными, плюралистичными priors (априорными знаниями) об этичном поведении.
  • Дать сообществу реальное влияние на поведение open-weight моделей, а не только право владения кодом.
  • Избежать сжатия сложных человеческих норм до простых правил, сохраняя контекст и нюансы.

Сравнение подходов к выравниванию

Критерий Традиционный RLHF (Post-training) Синтетический Mid-training (APT/MSM) Предлагаемый подход (Participatory Mid-training)
Источник данных Человеческие предпочтения (рейтинги A/B) Сгенерированные ИИ истории/спеки Нарративы от сообщества (1 млн авторов)
Глубина контекста Низкая (сжатие до дискретных единиц) Средняя (зависит от качества генерации) Высокая (сохранение нюансов и сложности)
Риск коллапса Манипуляция оптимизатором Коллапс энтропии и распознавание синтетики Минимизирован за счет разнообразия реальных голосов
Влияние сообщества Косвенное (через аннотаторов) Отсутствует Прямое формирование «личности» модели

Почему это важно?

Если эта концепция будет реализована, мы увидим переход от «алигмента сверху вниз» (где ценности навязываются узкой группой экспертов или синтетикой) к «алигменту снизу вверх». Модели станут частью общего достояния (commons), поведение которых формируется коллективным воображением и этическими нормами широкой аудитории, а не только корпоративными политиками.

Источник: LessWrong ↗