Проблема самообучения: от пермиссивности к предвзятости
Методы self-play, где одна языковая модель одновременно пишет код и создает тесты для его проверки, часто сталкиваются с двумя критическими проблемами. Первая — collapse of permissiveness (размывание строгости): модель максимизирует награду за прохождение тестов, генерируя тривиальные, недискриминативные тесты, которые легко проходят. Вторая — concentration bias (предвзятость концентрации): тесты группируются вокруг модальных (наиболее частых) входных данных, что искусственно завышает дисперсию оценок и снижает обобщающую способность.
Решение CoVer: Информационный выигрыш и GT-якорение
Авторы Ana Nunez и Peyman Najafirad предлагают фреймворк CoVer (Co-trained Coder and Verifier), основанный на GRPO. Ключевые инновации:
- Information-Gain (IG) Reward: Награда за каждый сгенерированный тест рассчитывается через взаимную информацию между вектором прохождения/непрохождения и градиентным сигналом корректности, привязанным к ground truth (GT). Награду получают только те тесты, которые положительно коррелируют с истинной сложностью задачи.
- Диверсифицированный отбор: Трехэтапный процесс фильтрации (по невалидности, строкам ввода и профилю выполнения) отбрасывает поведенчески избыточные тесты, повышая эффективный размер выборки при фиксированном вычислительном бюджете.
Результаты бенчмарков
Метод был протестирован на пяти ключевых наборах данных: LiveBench, MBPP, LiveCodeBench, CodeContests и Code-Forces. CoVer демонстрирует статистически значимое улучшение метрики pass@1 по сравнению с базовой моделью Qwen2.5-Instruct.
| Модель (Backbone) | Улучшение Pass@1 | Макро-среднее |
|---|---|---|
| 7B параметров | +5.8 пунктов | Наивысший среди сравнимых методов |
| 14B параметров | +7.1 пунктов | Наивысший среди сравнимых методов |
Практическая применимость
CoVer не только улучшает саму генерацию кода, но и работает как компонент выбора. При интеграции в пайплайн ранжирования CodeT модель CoVer-7B добавляет еще +3.5 пункта к итоговому рейтингу. Это доказывает двойную пользу со-обучения: модель становится лучше не только в написании, но и в оценке качества решений.
Источник: arXiv cs.AI ↗
