Суть эксперимента: PPFG против Independent Parallel-CoT
Исследователи Khawaja Murad ul Hassan и Mehran Ebrahimi протестировали механизм PRM-Pruned Fragment Grafting (PPFG) на модели Qwen2.5-7B-Instruct с процесс-ревард-моделью Math-Shepherd. Цель метода — спасать «застрявшие» цепочки рассуждений (Chain-of-Thought), извлекая успешные префиксы из других параллельных веток.
На полном наборе данных MATH500 (n=500, три семени) PPFG показал статистически неотличимые результаты от базового независимого параллельного CoT. Это означает, что сложная логика «пересадки» фрагментов не дает никакого преимущества в решении задач.
Почему механизм оказался «инертным»?
Анализ 322 событий внедрения правил стагнации выявил критическую проблему: только 14% целевых цепочек действительно нуждались в помощи. Остальные 86% были либо уже успешными, либо находились в состоянии «плоского плато» PRM, где спасительный префикс не мог изменить исход.
Ключевые метрики неэффективности:
- 2.4x — частота срабатывания случайного контроля (random control) по сравнению с целевым PPFG при той же точности, что доказывает: проблема не в эвристике, а в отсутствии фильтрации.
- +0.13 pp — верхняя граница потенциального выигрыша на задачу, если бы мы использовали «оракула» для идеального выбора целей.
- 2.75x — коэффициент, на который внедренные цепочки чаще прерывались на совпадающих шагах, но это не компенсировалось успехом «спасенных» братьев.
Результаты в сравнении
Ниже приведены данные сравнения эффективности различных стратегий вмешательства на базе Qwen2.5-7B:
| Метод / Конфигурация | Результат на MATH500 | Комментарий исследователей |
|---|---|---|
| Independent Parallel-CoT (Baseline) | Базовый уровень | Стандартная параллельная генерация без вмешательства. |
| PPFG (Stagnation-targeting) | Не отличается от Baseline | Неэффективный отбор целей (86% ложных срабатываний). |
| PPFG (Random-targeting) | Не отличается от Baseline | Случайный выбор дает ту же точность, но с затратами. |
| Random Control (2.4x firing rate) | Паритет с PPFG | Доказывает, что сложная логика PPFG избыточна. |
Обобщение и репликация
Результаты подтверждены на трех базовых LLM, шести бенчмарках и второй PRM. Анализ двухсторонних тестов (two-one-sided-tests) подтвердил положительное эквивалентность во всех ячейках Qwen/LLaMA. Авторы предлагают новый шаблон для тестирования «нулевых гипотез» при оценке инференсных механизмов, предупреждая разработчиков от внедрения сложных интервенций без строгой валидации целевой аудитории.
Источник: arXiv cs.AI ↗
