Проблема «единого ползунка»
Современные модели стремятся к плюралистической адаптации — созданию одного «steerable» (управляемого) ИИ, который может балансировать между конфликтующими ценностями. Метод Multi-Objective Direct Preference Optimization (MODPO) позволяет это делать, меняя веса целей. Но вопрос в том: когда одна модель может улучшить два показателя одновременно, а когда придется выбирать? Авторы предлагают предсказывать эти конфликты до дорогостоящего дообучения.
Ключевое открытие: Разрыв между Human и AI аннотациями
Исследователи протестировали два измерения предобучения на семи парах целей из датасетов HelpSteer и UltraFeedback. Результаты показали критическую разницу:
- Человеческие аннотации: Предсказатели работают отлично. Можно точно определить, будут ли цели конфликтовать или синергетично улучшаться.
- AI-аннотации: Методы предсказания не работают. Ошибки вызваны тем, что модели-референты (reward models) путают длину ответа и повторение слов с качеством ответа, что искажает оценку.
Экономия на обучении: Слияние моделей
Тренировать отдельную модель для каждой точки компромисса (trade-off) слишком дорого. Авторы проверили два способа покрытия спектра без полного переобучения:
- Выбор ближайшей модели: Использование уже обученной модели с похожими весами.
- Слияние параметров (Model Merging): Линейная интерполяция весов разных моделей.
Оба метода дают прирост, но ни один из них не превосходит прямое дообучение (direct training). Это важный сигнал для инженеров: слияние — это компромисс, а не замена.
Практические выводы
Для создания надежных управляемых моделей необходимо:
- Использовать метрики предобучения для фильтрации конфликтующих пар целей.
- Осторожно относиться к AI-генерированным предпочтениям: они требуют очистки от артефактов длины и повторов.
- Понимать, что слияние моделей — это «бесплатный» буст, но не панацея для сложных компромиссов.
Источник: arXiv cs.AI ↗
