Исследования14 сентября 2026 г., 09:17 МСК🤖 Auto

Chopthin-Consensus: как сохранить разнообразие в LLM без дообучения

Исследователи представили метод Chopthin-Consensus Power Sampling (CCPS), который улучшает рассуждения больших языковых моделей за счет сохранения генетического разнообразия траекторий поиска.

Баннер новости 7426

Проблема стандартного SMC

Инференс-тайм выборка через последовательный Монте-Карло (SMC) позволяет улучшить логические способности LLM без дополнительного обучения (post-training). Однако традиционные подходы используют ресэмплинг с равными весами. Это приводит к агрессивному отсечению траекторий с низким весом, которые могут содержать верные решения, и снижает генетическое разнообразие пространства поиска.

Решение: Chopthin-Consensus

Авторы предлагают метод Chopthin-Consensus Power Sampling (CCPS). Вместо уравнивания весов и принудительного дублирования частиц, метод накладывает верхнюю границу на отношение между наибольшим и наименьшим весами, сохраняя неравенство. Это обеспечивает:

  • Богатый набор различных путей рассуждения.
  • Сохранение взвешенного приближения SMC в условном ожидании.
  • Гарантированную нижнюю границу эффективного размера выборки (ESS) после ресэмплинга.

Механизм выбора ответа

Для использования обогащенной популяции применяется механизм semantic-majority selection: токены-идентичные финальные траектории объединяются, семантически эквивалентные ответы кластеризуются, и возвращается ответ, поддержанный наибольшим количеством различных траекторий.

Результаты и метрики

Тестирование проводилось на трех моделях с открытым весом и пяти бенчмарках для рассуждений. Метод CCPS показал значительное улучшение охвата (oracle coverage) в 13 из 15 настроек. В сочетании с семантическим мажоритарным выбором, точность финального ответа совпала или превысила базовый Power-SMC в 14 из 15 случаев, с абсолютным приростом до 10.6 процентных пунктов.

Метрика / Параметр Значение / Описание
Метод Chopthin-Consensus Power Sampling (CCPS)
Ключевое улучшение Сохранение разнообразия траекторий (diversity-preserving)
Рост точности (макс.) +10.6 percentage points
Улучшение охвата (coverage) В 13 из 15 настроек
Совпадение/превосходство точности В 14 из 15 настроек
Конференция COLM 2026 Workshop on Efficient Reasoning

Значение для индустрии

Результаты демонстрируют, что методы, сохраняющие разнообразие при ресэмплинге, и методы выбора, учитывающие это разнообразие, являются взаимодополняющими механизмами для улучшения рассуждений LLM без затрат на дообучение. Код метода доступен в репозитории авторов.

Источник: arXiv cs.CL ↗