Проблема статичного выбора
Традиционные подходы к улучшению работы больших языковых моделей (LLM) часто ограничиваются генерацией пула кандидатов и последующей их ранжированием с помощью верификатора. Как только лучший кандидат выбран, обратная связь от верификатора игнорируется. Это упущение, так как верификация содержит информацию о том, почему решение ошибочно или неполно, что можно использовать для его доработки.
Решение: Verify--Repair--Reselect (VRR)
Авторы работы Akiyoshi Tomihari и Yuma Ichikawa предлагают метод LLM-as-an-Improver, который трансформирует верификацию из этапа отбора в этап улучшения. Алгоритм VRR работает по следующему циклу:
- Генерация: Сохраняется текущий победитель, но также создаются три альтернативы: «починенные» версии победителя и аутсайдера, а также решение на основе нового подхода.
- Фильтрация: Используются только данные во время инференса (inference-time information) для отбрасывания невалидных и дублирующихся кандидатов.
- Реселекция: Финальный ответ выбирается по тем же критериям оценки, что и на первом этапе.
Ключевые результаты
Метод демонстрирует устойчивость в задачах генерации кода и логического вывода. Главное преимущество VRR — способность восстанавливать правильное решение даже в тех случаях, когда исходный пул кандидатов полностью ошибочен. Это расширяет роль LLM от простого генератора к активному «улучшителю» (improver).
| Этап | Действие | Цель |
|---|---|---|
| Verify | Оценка кандидатов верификатором | Выявление ошибок и слабых мест |
| Repair | Генерация исправленных версий | Создание более сильных кандидатов на основе фидбека |
| Reselect | Повторный отбор лучшего | Выбор оптимизированного решения |
Значение для индустрии
Подход LLM-as-an-Improver закладывает фундамент для систем, которые не просто «угадывают» ответ, а итеративно улучшают его. Это особенно критично для сложных задач программирования и математики, где первое решение часто бывает неточным, но исправимым.
Источник: arXiv cs.AI ↗
