Исследования2 октября 2026 г., 07:20 МСК🤖 Auto

PPFG-эффект: почему «умное» склеивание цепочек рассуждений не работает

Исследование arXiv:2610.00047 доказывает, что метод PRM-Pruned Fragment Grafting (PPFG) не дает прироста точности на MATH500. Вмешательство в процесс генерации оказалось бесполезным из-за некорректного выбора целей.

Баннер новости 8753

Суть эксперимента: PPFG против Independent Parallel-CoT

Исследователи Khawaja Murad ul Hassan и Mehran Ebrahimi протестировали механизм PRM-Pruned Fragment Grafting (PPFG) на модели Qwen2.5-7B-Instruct с процесс-ревард-моделью Math-Shepherd. Цель метода — спасать «застрявшие» цепочки рассуждений (Chain-of-Thought), извлекая успешные префиксы из других параллельных веток.

На полном наборе данных MATH500 (n=500, три семени) PPFG показал статистически неотличимые результаты от базового независимого параллельного CoT. Это означает, что сложная логика «пересадки» фрагментов не дает никакого преимущества в решении задач.

Почему механизм оказался «инертным»?

Анализ 322 событий внедрения правил стагнации выявил критическую проблему: только 14% целевых цепочек действительно нуждались в помощи. Остальные 86% были либо уже успешными, либо находились в состоянии «плоского плато» PRM, где спасительный префикс не мог изменить исход.

Ключевые метрики неэффективности:

  • 2.4x — частота срабатывания случайного контроля (random control) по сравнению с целевым PPFG при той же точности, что доказывает: проблема не в эвристике, а в отсутствии фильтрации.
  • +0.13 pp — верхняя граница потенциального выигрыша на задачу, если бы мы использовали «оракула» для идеального выбора целей.
  • 2.75x — коэффициент, на который внедренные цепочки чаще прерывались на совпадающих шагах, но это не компенсировалось успехом «спасенных» братьев.

Результаты в сравнении

Ниже приведены данные сравнения эффективности различных стратегий вмешательства на базе Qwen2.5-7B:

Метод / Конфигурация Результат на MATH500 Комментарий исследователей
Independent Parallel-CoT (Baseline) Базовый уровень Стандартная параллельная генерация без вмешательства.
PPFG (Stagnation-targeting) Не отличается от Baseline Неэффективный отбор целей (86% ложных срабатываний).
PPFG (Random-targeting) Не отличается от Baseline Случайный выбор дает ту же точность, но с затратами.
Random Control (2.4x firing rate) Паритет с PPFG Доказывает, что сложная логика PPFG избыточна.

Обобщение и репликация

Результаты подтверждены на трех базовых LLM, шести бенчмарках и второй PRM. Анализ двухсторонних тестов (two-one-sided-tests) подтвердил положительное эквивалентность во всех ячейках Qwen/LLaMA. Авторы предлагают новый шаблон для тестирования «нулевых гипотез» при оценке инференсных механизмов, предупреждая разработчиков от внедрения сложных интервенций без строгой валидации целевой аудитории.

Источник: arXiv cs.AI ↗