Проблема стандартного SMC
Инференс-тайм выборка через последовательный Монте-Карло (SMC) позволяет улучшить логические способности LLM без дополнительного обучения (post-training). Однако традиционные подходы используют ресэмплинг с равными весами. Это приводит к агрессивному отсечению траекторий с низким весом, которые могут содержать верные решения, и снижает генетическое разнообразие пространства поиска.
Решение: Chopthin-Consensus
Авторы предлагают метод Chopthin-Consensus Power Sampling (CCPS). Вместо уравнивания весов и принудительного дублирования частиц, метод накладывает верхнюю границу на отношение между наибольшим и наименьшим весами, сохраняя неравенство. Это обеспечивает:
- Богатый набор различных путей рассуждения.
- Сохранение взвешенного приближения SMC в условном ожидании.
- Гарантированную нижнюю границу эффективного размера выборки (ESS) после ресэмплинга.
Механизм выбора ответа
Для использования обогащенной популяции применяется механизм semantic-majority selection: токены-идентичные финальные траектории объединяются, семантически эквивалентные ответы кластеризуются, и возвращается ответ, поддержанный наибольшим количеством различных траекторий.
Результаты и метрики
Тестирование проводилось на трех моделях с открытым весом и пяти бенчмарках для рассуждений. Метод CCPS показал значительное улучшение охвата (oracle coverage) в 13 из 15 настроек. В сочетании с семантическим мажоритарным выбором, точность финального ответа совпала или превысила базовый Power-SMC в 14 из 15 случаев, с абсолютным приростом до 10.6 процентных пунктов.
| Метрика / Параметр | Значение / Описание |
|---|---|
| Метод | Chopthin-Consensus Power Sampling (CCPS) |
| Ключевое улучшение | Сохранение разнообразия траекторий (diversity-preserving) |
| Рост точности (макс.) | +10.6 percentage points |
| Улучшение охвата (coverage) | В 13 из 15 настроек |
| Совпадение/превосходство точности | В 14 из 15 настроек |
| Конференция | COLM 2026 Workshop on Efficient Reasoning |
Значение для индустрии
Результаты демонстрируют, что методы, сохраняющие разнообразие при ресэмплинге, и методы выбора, учитывающие это разнообразие, являются взаимодополняющими механизмами для улучшения рассуждений LLM без затрат на дообучение. Код метода доступен в репозитории авторов.
Источник: arXiv cs.CL ↗
