Исследования28 июля 2026 г., 09:17 МСК🤖 Auto

PAJAMA: Замена LLM-судье через дистилляцию программ

Исследователи представили PAJAMA — систему, заменяющую дорогие LLM-оценщики на набор детерминированных программ, сохраняя точность модели на 13B параметров.

Баннер новости 4520

Проблема LLM-as-a-Judge

Использование больших языковых моделей в роли судей (LLM-as-a-judge) стало стандартом автоматической оценки, но сталкивается с тремя критическими барьерами: высокая стоимость API, значительная задержка (latency) и непрозрачность принятия решений. Эти ограничения делают масштабирование оценки ненадежным и экономически неэффективным.

Решение: PAJAMA и дистилляция программ

Авторы (Tzu-Heng Huang, Shengqi Qiu, Frederic Sala) предлагают альтернативу под названием PAJAMA. Вместо того чтобы каждый раз запрашивать LLM, система дистиллирует логику принятия решений в комитет детерминированных программ. Эти «программные судьи» работают напрямую, обеспечивая прозрачность, возможность инспекции кода и полное отсутствие затрат на API за каждый образец.

Ключевые метрики и результаты

Эксперименты проводились на пяти наборах данных и четырех семействах моделей. Результаты показывают, что программные судьи могут сопоставить производительность LLM-судьи размером 13B параметров. При использовании выходов программ как сигналов маршрутизации PAJAMA улучшает как точность, так и пропускную способность, продвигая границу Парето.

Метрика / Аспект LLM-as-a-Judge (13B) PAJAMA (Program Distillation)
Стоимость оценки Высокая (зависит от API) Практически нулевая (после дистилляции)
Прозрачность решений Низкая (черный ящик) Высокая (код можно инспектировать)
Точность (на 5 датасетах) Базовый уровень Сопоставима с базовым уровнем
Применение в RewardBench Стандартная тренировка Рeward-модель из программ превосходит проприетарные лейблы при стоимости API ниже в 100 раз

Механизм работы и Fallback

Система PAJAMA агрегирует решения комитета программ в единый вердикт. Важной особенностью является механизм fallback: случаи с низкой уверенностью программных судей автоматически эскалируются обратно к LLM. Это позволяет сохранить высокую точность в сложных edge-кейсах, не жертвуя эффективностью на простых задачах.

Значение для индустрии

Помимо оценки, программные судьи генерируют дешевые и эффективные сигналы вознаграждения (reward signals). На бенчмарке RewardBench reward-модель, дистиллированная из вердиктов программ, превзошла модель, обученную на лейблах проприетарной LLM, при этом стоимость API снизилась на два порядка (в 100 раз). Это открывает путь к созданию масштабируемых систем обучения с подкреплением (RLHF) без зависимости от дорогих моделей-генераторов лейблов.

Источник: arXiv cs.AI ↗