Исследования24 сентября 2026 г., 08:18 МСК🤖 Auto

MODPO: Как предсказать конфликт целей в мультизадачных LLM

Исследование David Tsoi и Esra Dönmez показывает, что для настройки мультизадачных моделей (MODPO) достаточно двух метрик предобучения, но только для человеческих данных. Для AI-аннотаций методы ломаются.

Баннер новости 8163

Проблема «единого ползунка»

Современные модели стремятся к плюралистической адаптации — созданию одного «steerable» (управляемого) ИИ, который может балансировать между конфликтующими ценностями. Метод Multi-Objective Direct Preference Optimization (MODPO) позволяет это делать, меняя веса целей. Но вопрос в том: когда одна модель может улучшить два показателя одновременно, а когда придется выбирать? Авторы предлагают предсказывать эти конфликты до дорогостоящего дообучения.

Ключевое открытие: Разрыв между Human и AI аннотациями

Исследователи протестировали два измерения предобучения на семи парах целей из датасетов HelpSteer и UltraFeedback. Результаты показали критическую разницу:

  • Человеческие аннотации: Предсказатели работают отлично. Можно точно определить, будут ли цели конфликтовать или синергетично улучшаться.
  • AI-аннотации: Методы предсказания не работают. Ошибки вызваны тем, что модели-референты (reward models) путают длину ответа и повторение слов с качеством ответа, что искажает оценку.

Экономия на обучении: Слияние моделей

Тренировать отдельную модель для каждой точки компромисса (trade-off) слишком дорого. Авторы проверили два способа покрытия спектра без полного переобучения:

  1. Выбор ближайшей модели: Использование уже обученной модели с похожими весами.
  2. Слияние параметров (Model Merging): Линейная интерполяция весов разных моделей.

Оба метода дают прирост, но ни один из них не превосходит прямое дообучение (direct training). Это важный сигнал для инженеров: слияние — это компромисс, а не замена.

Практические выводы

Для создания надежных управляемых моделей необходимо:

  • Использовать метрики предобучения для фильтрации конфликтующих пар целей.
  • Осторожно относиться к AI-генерированным предпочтениям: они требуют очистки от артефактов длины и повторов.
  • Понимать, что слияние моделей — это «бесплатный» буст, но не панацея для сложных компромиссов.

Источник: arXiv cs.AI ↗