Проблема LLM-as-a-Judge
Использование больших языковых моделей в роли судей (LLM-as-a-judge) стало стандартом автоматической оценки, но сталкивается с тремя критическими барьерами: высокая стоимость API, значительная задержка (latency) и непрозрачность принятия решений. Эти ограничения делают масштабирование оценки ненадежным и экономически неэффективным.
Решение: PAJAMA и дистилляция программ
Авторы (Tzu-Heng Huang, Shengqi Qiu, Frederic Sala) предлагают альтернативу под названием PAJAMA. Вместо того чтобы каждый раз запрашивать LLM, система дистиллирует логику принятия решений в комитет детерминированных программ. Эти «программные судьи» работают напрямую, обеспечивая прозрачность, возможность инспекции кода и полное отсутствие затрат на API за каждый образец.
Ключевые метрики и результаты
Эксперименты проводились на пяти наборах данных и четырех семействах моделей. Результаты показывают, что программные судьи могут сопоставить производительность LLM-судьи размером 13B параметров. При использовании выходов программ как сигналов маршрутизации PAJAMA улучшает как точность, так и пропускную способность, продвигая границу Парето.
| Метрика / Аспект | LLM-as-a-Judge (13B) | PAJAMA (Program Distillation) |
|---|---|---|
| Стоимость оценки | Высокая (зависит от API) | Практически нулевая (после дистилляции) |
| Прозрачность решений | Низкая (черный ящик) | Высокая (код можно инспектировать) |
| Точность (на 5 датасетах) | Базовый уровень | Сопоставима с базовым уровнем |
| Применение в RewardBench | Стандартная тренировка | Рeward-модель из программ превосходит проприетарные лейблы при стоимости API ниже в 100 раз |
Механизм работы и Fallback
Система PAJAMA агрегирует решения комитета программ в единый вердикт. Важной особенностью является механизм fallback: случаи с низкой уверенностью программных судей автоматически эскалируются обратно к LLM. Это позволяет сохранить высокую точность в сложных edge-кейсах, не жертвуя эффективностью на простых задачах.
Значение для индустрии
Помимо оценки, программные судьи генерируют дешевые и эффективные сигналы вознаграждения (reward signals). На бенчмарке RewardBench reward-модель, дистиллированная из вердиктов программ, превзошла модель, обученную на лейблах проприетарной LLM, при этом стоимость API снизилась на два порядка (в 100 раз). Это открывает путь к созданию масштабируемых систем обучения с подкреплением (RLHF) без зависимости от дорогих моделей-генераторов лейблов.
Источник: arXiv cs.AI ↗
