Проблема: LLM-судьи не объективны
Большие языковые модели (LLM) всё чаще используются как автоматические судьи для оценки качества ответов других моделей. Однако их вердикты уязвимы перед когнитивными искажениями. Существующие методы борьбы либо полагаются на хрупкие промпты (debiasing), которые не работают универсально, либо требуют ручного контроля, что не масштабируется.
Команда исследователей во главе с Цянь Ваном (Qian Wang) предложила метод Chain-of-Models (CoM) — автоматический пайплайн, где вторая модель (аудитор) анализирует цепочку рассуждений (reasoning trace) первой модели перед вынесением итогового вердикта.
Ключевой инсайт: «Сильный» не значит «лучший аудитор»
Авторы протестировали 9 моделей от 6 разных семейств (включая Qwen2.5, Kimi-K2.5, GPT-4o, GLM-5) на 4 типах когнитивных искажений и 4 фактических датасетах. Выяснилось два парадоксальных факта:
- Стандартная устойчивость не предсказывает эффективность аудита. Например, Kimi-K2.5 демонстрирует лучшую самостоятельную устойчивость к искажениям, но является слабым аудитором для выявления ошибок в рассуждениях Qwen2.5-72B.
- Лучший аудитор зависит от типа искажения. Нет универсального «супер-аудитора». GPT-4o лучше всего справляется с эффектами толпы (bandwagon), авторитета и отвлечения внимания, тогда как GLM-5 превосходит конкурентов в выявлении сикофанства (сладкоречия/угождения).
Решение: Выбор аудитора под конкретное искажение
Исследователи разработали правило выбора аудитора, которое оценивает кандидатов по трем параметрам: функциональное разнообразие, устойчивость к конкретному типу искажения и калиброванная эффективность аудита. Этот подход позволяет динамически подбирать модель-аудитор под тип выявленной предвзятости.
Результаты: Превосходство кросс-модельного подхода
Метод Chain-of-Models показал значительное улучшение метрик по сравнению с базовыми подходами. Ниже приведено сравнение точности (accuracy) на четырех срезах с искажениями:
| Метод / Конфигурация | Точность (Accuracy) | Примечание |
|---|---|---|
| Chain-of-Models (с выбором аудитора) | 0.884 | Оптимальный результат |
| Сильнейший фиксированный аудитор | 0.824 | Одна модель на все случаи |
| Базовый уровень (без аудита) | 0.805 | Исходные предсказания LLM |
Разница в 6% по сравнению с лучшим фиксированным аудитором и 8% по сравнению с отсутствием аудита критически важна для надежности автоматизированных систем оценки. Авторы опубликовали данные, конфигурации и агент-навык (LLM-agent skill) для воспроизведения результатов.
Источник: arXiv cs.CL ↗
