Проблема: «Черный ящик» в оценке веб-кода
Современные большие языковые модели (LLM) уже способны генерировать полноценные веб-сайты по текстовому описанию. Однако ключевым узким местом остается дизайн функции вознаграждения (reward design) для обучения с подкреплением (RL). Ручное написание браузерных скриптов для проверки каждого запроса слишком дорого, а системы на базе VLM (визуальных языковых моделей) часто выносят вердикт, не дождавшись завершения критических действий на странице.
Решение: WebGrader и Flow Contract
Авторы из команды Boshui Chen, Huiping Liu и Shaolei Zhang предложили WebGrader — самоэволюционирующего программистского градера. Система работает по следующему алгоритму:
- Автоматический анализ: WebGrader автономно выводит необходимые сценарии взаимодействия (interaction flows) из каждого запроса на создание сайта.
- Flow Contract: Каждый сценарий представляется как исполняемый «Контракт потока».
- Сбор доказательств: Проект материализуется в живом браузере. Система сопоставляет целевые действия с исходным кодом и живым DOM, собирая визуальные, сетевые и состояния памяти доказательства.
- Offline-обучение: Офлайн-цикл на основе остаточных ошибок обнаруживает повторно используемые навыки верификации, тестирует их на отдельных страницах и замораживает граф навыков перед началом тренировки основной политики.
Результаты: 8B-модель бьет гигантов
Эксперименты показали, что использование WebGrader для обучения политики позволяет достичь высокой функциональной успешности даже на моделях среднего размера. 8-миллиардная модель, обученная с помощью WebGrader, превзошла как специализированные награды, так и крупные коммерческие модели.
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| WebGen-Bench (Functional Success) | 52.01% | Результат 8B-политики, обученной с WebGrader |
| Прирост над базой | +7.88 п. | По сравнению с наградой «внешний вид + скрипт» |
| WebGen-Bench (vs. SOTA) | Лучше | Превзошел o4-mini и DeepSeek-v4-flash |
| WG-core-250 (Full Score) | 44.953 | Результат обученной политики |
| WG-core-250 (vs. SOTA) | Лучше | Превзошел Qwen3-Coder-480B |
Почему это важно
WebGrader решает фундаментальную проблему масштабируемости проверки кода. Отделяя планирование тестов, привязку действий, сбор доказательств и семантическую оценку, система выносит вердикт «Pass» только после наблюдения за требуемым переходом состояния. Это позволяет использовать более эффективные и дешевые модели (8B) для задач, где ранее требовались гиганты вроде Qwen3-Coder-480B, значительно снижая порог входа в автоматизированную веб-разработку.
Источник: arXiv cs.AI ↗
