Миф об «алignment» как причине унификации
Долгое время индустрия винила в однообразии ответов больших языковых моделей (LLM) этапы пост-обработки: SFT (Supervised Fine-Tuning) и RLHF (Reinforcement Learning from Human Feedback). Считалось, что именно «выравнивание» по человеческим предпочтениям стирает креативность. Однако новое исследование «Is Convergence Inevitable?» (Fortier, Chen, West, август 2026) переворачивает этот парадигму. Авторы доказывают, что семантическая конвергенция (схлопывание разнообразия ответов) не создается, а лишь проявляется на этапе алайнмента, так как корни проблемы лежат глубже — в самом пре-тренинге.
Эксперимент: SFT как катализатор, а не причина
Команда провела контролируемые эксперименты, чтобы отследить момент появления гомогенности. Они обучали модели на инструкциях (SFT), используя различные наборы данных, и наблюдали за поведением моделей до и после этого этапа. Ключевая находка: данные для SFT не могут «внести» гомогенность, если её нет в базе. Они лишь действуют как катализатор, усиливая уже существующие паттерны.
Результаты тестирования на базовых моделях (до этапа обучения с учителем) показали, что даже простое промптинг-взаимодействие способно индуцировать коллапс разнообразия. Это означает, что модель уже «знает», как отвечать «правильно» и «скучно», задолго до того, как человек начнет её корректировать.
Почему это важно для разработчиков
Если конвергенция заложена в объективах обучения (pre-training objectives), то попытки исправить ситуацию только через RLHF или тонкую настройку (post-alignment interventions) обречены на провал. Разработчикам придется пересматривать архитектуру пре-тренинга или использовать методы, направленные на сохранение энтропии на самых ранних этапах генерации.
Сводка ключевых выводов
| Этап | Роль в гомогенности | Вывод исследования |
|---|---|---|
| Pre-training | Источник проблемы | Гомогенность формируется естественным путем из целей обучения модели. |
| SFT (Instruction Tuning) | Катализатор | Раскрывает и усиливает уже существующую конвергенцию, но не создает её. |
| RLHF / Post-alignment | Фиксация | Попытки исправить разнообразие здесь малоэффективны без изменения базы. |
Исследование ставит под сомнение саму неизбежность «конвергенции» к одному мнению, предлагая взглянуть на проблему через призму фундаментальных ограничений современных архитектур LLM.
Источник: arXiv cs.CL ↗
