Исследования2 октября 2026 г., 08:17 МСК🤖 Auto

GAP-DPO: Градиентное выравнивание для персонализации LLM

Исследователи представили GAP-DPO — алгоритм, использующий геометрию градиентов для выбора пар предпочтений, что значительно улучшает персонализацию LLM по сравнению со стандартным DPO.

Баннер новости 8754

Проблема стандартного DPO в персонализации

Персонализация больших языковых моделей (LLM) требует не просто повышения общего качества, а точного соответствия индивидуальным предпочтениям пользователя. Стандартный метод Direct Preference Optimization (DPO) часто опирается на эвристические критерии, такие как экстремумы вероятности (likelihood-based extremes). Это приводит к тому, что оптимизация отключается от явной полезности пользователя, что может ухудшить персонализацию. Авторы статьи arXiv:2610.00061 доказывают, что выбор пар предпочтений — это не просто предварительная обработка, а ключевой геометрический компонент оптимизации.

Суть метода GAP-DPO

Команда исследователей во главе с Руомингом Цзинем (Ruoming Jin) формализовала обучение персонализированным предпочтениям как задачу оптимизации, выровненной по геометрии. Они проанализировали первое взаимодействие между градиентами ожидаемой полезности пользователя и направлениями обновлений DPO. Ключевой вывод: при выборке вне политики (off-policy sampling) обновление DPO трансформируется из сигнала коррекции ошибок в обновление, похожее на подкрепление (reinforcement-like), когда маржа предпочтений направленно совпадает с градиентами полезности. На основе этого предложен алгоритм GAP-DPO (Geometry-Aligned Preference DPO), который выполняет выбор пар, осознанный с точки зрения полезности, и контролирует сдвиг распределения через регенерацию на каждом эпохе.

Экспериментальные результаты

Тестирование проводилось на бенчмарках персонализированной генерации текста. GAP-DPO демонстрирует стабильное превосходство над стандартными вариантами DPO. Метод обеспечивает лучшую стилистическую точность, соответствие предпочтениям и общее качество генерации. Ниже приведено сравнение ключевых аспектов подхода:

Критерий Стандартный DPO (эвристики) GAP-DPO (Gradient-Aligned)
Механизм выбора пар Эвристический (экстремумы вероятности) Геометрически выровненный по градиентам полезности
Влияние на персонализацию Риск деградации из-за отрыва от пользы пользователя Прямая оптимизация под индивидуальные предпочтения
Контроль сдвига данных Часто отсутствует или слабый Регенерация распределения на каждой эпохе
Результат генерации Базовое качество Улучшенная стилистическая и смысловая точность

Значение для индустрии

Работа GAP-DPO устанавливает градиентное выравнивание как объединяющий принцип для персонализированного оптимизации предпочтений. Это означает, что разработчики могут создавать более «человечные» и точные модели, отказываясь от универсальных эвристик в пользу математически обоснованного выбора обучающих пар. Это критически важно для приложений, где тон, стиль и индивидуальные предпочтения пользователя имеют решающее значение, например, в персонализированных ассистентах или креативных инструментах.

Источник: arXiv cs.AI ↗