Исследования21 сентября 2026 г., 11:18 МСК🤖 Auto

CoVer: Новый метод RL для генерации кода с приростом точности до +7.1%

Исследователи представили CoVer — фреймворк, решающий проблему «размывания» тестов в самообучающихся моделях. Метод использует информационный выигрыш и отбор диверсифицированных тестов, значительно повышая надежность генерации кода.

Баннер новости 7930

Проблема самообучения: от пермиссивности к предвзятости

Методы self-play, где одна языковая модель одновременно пишет код и создает тесты для его проверки, часто сталкиваются с двумя критическими проблемами. Первая — collapse of permissiveness (размывание строгости): модель максимизирует награду за прохождение тестов, генерируя тривиальные, недискриминативные тесты, которые легко проходят. Вторая — concentration bias (предвзятость концентрации): тесты группируются вокруг модальных (наиболее частых) входных данных, что искусственно завышает дисперсию оценок и снижает обобщающую способность.

Решение CoVer: Информационный выигрыш и GT-якорение

Авторы Ana Nunez и Peyman Najafirad предлагают фреймворк CoVer (Co-trained Coder and Verifier), основанный на GRPO. Ключевые инновации:

  • Information-Gain (IG) Reward: Награда за каждый сгенерированный тест рассчитывается через взаимную информацию между вектором прохождения/непрохождения и градиентным сигналом корректности, привязанным к ground truth (GT). Награду получают только те тесты, которые положительно коррелируют с истинной сложностью задачи.

  • Диверсифицированный отбор: Трехэтапный процесс фильтрации (по невалидности, строкам ввода и профилю выполнения) отбрасывает поведенчески избыточные тесты, повышая эффективный размер выборки при фиксированном вычислительном бюджете.

Результаты бенчмарков

Метод был протестирован на пяти ключевых наборах данных: LiveBench, MBPP, LiveCodeBench, CodeContests и Code-Forces. CoVer демонстрирует статистически значимое улучшение метрики pass@1 по сравнению с базовой моделью Qwen2.5-Instruct.

Модель (Backbone) Улучшение Pass@1 Макро-среднее
7B параметров +5.8 пунктов Наивысший среди сравнимых методов
14B параметров +7.1 пунктов Наивысший среди сравнимых методов

Практическая применимость

CoVer не только улучшает саму генерацию кода, но и работает как компонент выбора. При интеграции в пайплайн ранжирования CodeT модель CoVer-7B добавляет еще +3.5 пункта к итоговому рейтингу. Это доказывает двойную пользу со-обучения: модель становится лучше не только в написании, но и в оценке качества решений.

Источник: arXiv cs.AI ↗