Проблема: «Правильный ответ, но не тот формат»
Большие языковые модели (LLM) часто справляются со сложными математическими выводами, но терпят неудачу на этапе оформления ответа. Модель может вычислить верное число, но забыть применить модульную арифметику, вернуть дробь вместо целого числа или использовать неверный формат кодирования. Это критично для систем автоматической проверки, где важен не только результат, но и его структура.
Решение: двухэтапный протокол без дообучения
Авторы предлагают метод Constraint-First Reasoning (CFR) — протокол, не требующий изменения весов модели. Он работает в два этапа:
- Этап 1 (Извлечение): Модель анализирует условие задачи и явно выписывает все ограничения (формат ответа, тип чисел, необходимые преобразования).
- Этап 2 (Решение с проверкой): Модель решает задачу, постоянно сверяя промежуточные и финальные результаты с извлеченным списком ограничений.
Для оптимизации вычислений используется Routed-CFR: текстовый маршрутизатор на основе регулярных выражений определяет, содержит ли задача «строгие» ограничения. Если да — запускается CFR, если нет — используется стандартный Chain-of-Thought (CoT).
Результаты на бенчмарках
Метод протестирован на сложных наборах данных: AIME, CMIMC, BRUMO и AIMO_AMC. CFR демонстрирует стабильное улучшение по сравнению с прямым Chain-of-Thought на различных архитектурах. Ниже приведена сводка эффективности подхода:
| Метрика / Аспект | Описание результата |
|---|---|
| Тип вмешательства | Тестовое время (test-time intervention), без дообучения |
| Ключевые датасеты | AIME, CMIMC, BRUMO, AIMO_AMC |
| Механизм маршрутизации | Regex-роутер активирует CFR только при наличии строгих ограничений |
| Основной выигрыш | Снижение ошибок форматирования и нарушения явных условий задачи |
| Ограничения метода | Эффективность зависит от качества извлечения ограничений на Этапе 1 |
Почему это важно
CFR позиционируется не как замена общим методам математического рассуждения, а как целевая «надстройка». Исследование показывает, что значительная часть ошибок LLM в математике — это не ошибки логики, а ошибки соблюдения условий. Метод позволяет повысить надежность систем без затрат на переобучение моделей, что делает его привлекательным для внедрения в production-решения, где важна точность формата ответа.
Источник: arXiv cs.CL ↗
