Исследования4 августа 2026 г., 04:17 МСК🤖 Auto

Chain-of-Models: Как кросс-модельный аудит спасает LLM-судей от предвзятости

Исследование arXiv:2607.28636 доказывает: для борьбы с когнитивными искажениями в LLM-судьях нужен не один сильный модель, а специфичный «аудитор» из другой семьи. Точность метода достигает 88,4%.

Баннер новости 5004

Проблема: LLM-судьи не объективны

Большие языковые модели (LLM) всё чаще используются как автоматические судьи для оценки качества ответов других моделей. Однако их вердикты уязвимы перед когнитивными искажениями. Существующие методы борьбы либо полагаются на хрупкие промпты (debiasing), которые не работают универсально, либо требуют ручного контроля, что не масштабируется.

Команда исследователей во главе с Цянь Ваном (Qian Wang) предложила метод Chain-of-Models (CoM) — автоматический пайплайн, где вторая модель (аудитор) анализирует цепочку рассуждений (reasoning trace) первой модели перед вынесением итогового вердикта.

Ключевой инсайт: «Сильный» не значит «лучший аудитор»

Авторы протестировали 9 моделей от 6 разных семейств (включая Qwen2.5, Kimi-K2.5, GPT-4o, GLM-5) на 4 типах когнитивных искажений и 4 фактических датасетах. Выяснилось два парадоксальных факта:

  • Стандартная устойчивость не предсказывает эффективность аудита. Например, Kimi-K2.5 демонстрирует лучшую самостоятельную устойчивость к искажениям, но является слабым аудитором для выявления ошибок в рассуждениях Qwen2.5-72B.
  • Лучший аудитор зависит от типа искажения. Нет универсального «супер-аудитора». GPT-4o лучше всего справляется с эффектами толпы (bandwagon), авторитета и отвлечения внимания, тогда как GLM-5 превосходит конкурентов в выявлении сикофанства (сладкоречия/угождения).

Решение: Выбор аудитора под конкретное искажение

Исследователи разработали правило выбора аудитора, которое оценивает кандидатов по трем параметрам: функциональное разнообразие, устойчивость к конкретному типу искажения и калиброванная эффективность аудита. Этот подход позволяет динамически подбирать модель-аудитор под тип выявленной предвзятости.

Результаты: Превосходство кросс-модельного подхода

Метод Chain-of-Models показал значительное улучшение метрик по сравнению с базовыми подходами. Ниже приведено сравнение точности (accuracy) на четырех срезах с искажениями:

Метод / Конфигурация Точность (Accuracy) Примечание
Chain-of-Models (с выбором аудитора) 0.884 Оптимальный результат
Сильнейший фиксированный аудитор 0.824 Одна модель на все случаи
Базовый уровень (без аудита) 0.805 Исходные предсказания LLM

Разница в 6% по сравнению с лучшим фиксированным аудитором и 8% по сравнению с отсутствием аудита критически важна для надежности автоматизированных систем оценки. Авторы опубликовали данные, конфигурации и агент-навык (LLM-agent skill) для воспроизведения результатов.

Источник: arXiv cs.CL ↗