Исследования18 сентября 2026 г., 11:17 МСК🤖 Auto

LLM-as-an-Improver: Верификация как инструмент улучшения кода

Исследователи представили метод VRR, который использует фидбек от верификатора не только для выбора лучшего ответа, но и для генерации исправленных решений, повышая точность LLM.

Баннер новости 7781

Проблема статичного выбора

Традиционные подходы к улучшению работы больших языковых моделей (LLM) часто ограничиваются генерацией пула кандидатов и последующей их ранжированием с помощью верификатора. Как только лучший кандидат выбран, обратная связь от верификатора игнорируется. Это упущение, так как верификация содержит информацию о том, почему решение ошибочно или неполно, что можно использовать для его доработки.

Решение: Verify--Repair--Reselect (VRR)

Авторы работы Akiyoshi Tomihari и Yuma Ichikawa предлагают метод LLM-as-an-Improver, который трансформирует верификацию из этапа отбора в этап улучшения. Алгоритм VRR работает по следующему циклу:

  • Генерация: Сохраняется текущий победитель, но также создаются три альтернативы: «починенные» версии победителя и аутсайдера, а также решение на основе нового подхода.
  • Фильтрация: Используются только данные во время инференса (inference-time information) для отбрасывания невалидных и дублирующихся кандидатов.
  • Реселекция: Финальный ответ выбирается по тем же критериям оценки, что и на первом этапе.

Ключевые результаты

Метод демонстрирует устойчивость в задачах генерации кода и логического вывода. Главное преимущество VRR — способность восстанавливать правильное решение даже в тех случаях, когда исходный пул кандидатов полностью ошибочен. Это расширяет роль LLM от простого генератора к активному «улучшителю» (improver).

Этап Действие Цель
Verify Оценка кандидатов верификатором Выявление ошибок и слабых мест
Repair Генерация исправленных версий Создание более сильных кандидатов на основе фидбека
Reselect Повторный отбор лучшего Выбор оптимизированного решения

Значение для индустрии

Подход LLM-as-an-Improver закладывает фундамент для систем, которые не просто «угадывают» ответ, а итеративно улучшают его. Это особенно критично для сложных задач программирования и математики, где первое решение часто бывает неточным, но исправимым.

Источник: arXiv cs.AI ↗