Проблема размытых предпочтений
Современные методы выравнивания (alignment) больших языковых моделей часто сталкиваются с проблемой «размытия» ответов. Когда модель обучается на основе векторов предпочтений, неопределенность исследования (exploration uncertainty) приводит к тому, что распределения наград для разных целей перекрываются. В результате модель генерирует ответы, которые слабо соответствуют заданным условиям, делая контроль над поведением ИИ нестабильным.
Решение через взаимную информацию
Авторы работы, опубликованной в arXiv (2026) и принятой к публикации на конференции ECML/PKDD 2026, предлагают фреймворк MI-EPO (Multi-Objective Exploration and Preference Optimization via Mutual Information). Ключевая идея заключается в максимизации совместной условной взаимной информации между тремя компонентами:
- Сгенерированными ответами модели;
- Обратной связью по предпочтениям;
- Векторами предпочтений.
Этот подход позволяет разделить задачи выравнивания целей и исследования, зависящего от предпочтений, за счет внедрения вероятностного механизма маршрутизации (probabilistic routing mechanism).
Результаты экспериментов
Тестирование проводилось на задачах безопасного выравнивания (safe alignment) и создания полезного ассистента. Метод MI-EPO демонстрирует способность генерировать ответы, которые не только лучше соответствуют заданным векторам предпочтений, но и остаются различимыми для разных условий. Это обеспечивает стабильный компромисс между несколькими объектами одновременно, чего часто не хватает традиционным методам онлайн-оптимизации предпочтений.
| Аспект | Традиционные методы | MI-EPO (предлагаемый метод) |
|---|---|---|
| Механизм оптимизации | Условное обучение на векторах предпочтений | Максимизация взаимной информации (Information Theory) |
| Проблема исследования | Перекрывание распределений наград | Разделение целей через вероятностную маршрутизацию |
| Контроль вывода | Нестабильный при конфликте целей | Стабильный компромисс и высокая различимость ответов |
Значение для индустрии
Работа Hongyan Xie и коллег закладывает теоретический фундамент для создания более предсказуемых ИИ-ассистентов. Использование информационных метрик вместо простых градиентных спусков по наградам позволяет избежать «коллизии» целей, что критически важно для внедрения LLM в сферы, требующие строгого соблюдения этических и функциональных ограничений.
Источник: arXiv cs.CL ↗
