Исследования1 июля 2026 г., 14:19 МСК🤖 Auto

RoPoLL: Как геометрическая медиана спасает LLM-жюри от сизифова труда

Исследователи доказали, что традиционные LLM-жюри (PoLL) неустойчивы к предвзятости. Новый метод RoPoLL заменяет усреднение на геометрическую медиану, повышая точность оценки на 19% и позволяя малым моделям бить гигантов.

Баннер новости 2731

Проблема: «Синдром овец» и бесконечное смещение

Использование панели из нескольких больших языковых моделей (LLM) для оценки ответов — популярный тренд. Однако исследователи из команды Anish Acharya, Kris W Pan и Brian Verkhovsky обнаружили критический дефект в статистике этого подхода. В статье RoPoLL: Robust Panel of LLM Judges (arXiv:2606.30931) показано, что стандартная агрегация мнений (PoLL) подвержена неограниченному смещению (unbounded bias) при любом уровне загрязнения данных.

Проблема возникает, когда хотя бы один судья в панели ведет себя «типично для LLM»: впадает в режим коллапса (mode collapse), проявляет сизифию (сизифия — склонность соглашаться с пользователем, даже если он неправ) или отказывается отвечать по соображениям безопасности. В таких условиях увеличение количества судей не помогает, так как ошибка масштабируется.

Решение: Геометрическая медиана вместо среднего

Авторы предлагают заменить функцию агрегации на геометрическую медиану (Geometric Median, GM). Этот подход, названный RoPoLL, не требует тонкой настройки (tuning-free) и обладает оптимальной конечной выборкой точки разрушения (breakdown point) на уровне 1/2. Это означает, что метод сохраняет корректность, даже если половина судей в панели выдают заведомо ложные или предвзятые результаты.

Теоретический анализ показывает, что RoPoLL достигает параметрической скорости ошибки sigma * sqrt(d/N). Существует лишь статистико-вычислительный разрыв (statistical-computational gap) с идеальным медианой Тьюки (Tukey halfspace median), который вычислительно неразрешим для больших размерностей, но RoPoLL эффективно обходит это ограничение за полиномиальное время.

Результаты: Малые модели бьют гигантов

Эксперименты проводились на 13 открытых моделях-судьях (от 4B до 675B параметров), трех бенчмарках для обучения с подкреплением (RLHF) и четырех режимах коррупции (до 50% зашумленных данных). RoPoLL превзошел традиционный PoLL во всех сценариях:

Метрика / Сценарий Результат RoPoLL Сравнение / Примечание
Кросс-размерные атаки (при равных вычислительных затратах) +19% точности Превосходство над базовым PoLL
Тяжелохвостые византийские злоумышленники На порядки выше Устойчивость к экстремальному шуму
HelpSteer-2 (30% бимодально-случайной коррупции) 38B (3 судьи) vs 675B Малая модель RoPoLL бьет Mistral-Large-3 (675B) с коэффициентом 1.31x
Эффективность параметров 18x преимущество Меньше параметров при лучшей точности

Почему это важно для индустрии

Контрольная группа с шумными землями (Noisy-GT) подтвердила, что прирост качества достигается именно за счет устойчивости к предвзятому загрязнению, а не просто к случайному шуму. Это открывает путь к созданию дешевых и надежных систем оценки, где вместо использования одной огромной модели-рефери (которая сама может быть предвзята) используется небольшая группа из 3-4 моделей среднего размера, объединенных через геометрическую медиану. Это снижает затраты на inference и повышает надежность RLHF-пайплайнов.

Источник: arXiv cs.AI ↗