Исследования10 августа 2026 г., 09:17 МСК🤖 Auto

WebGrader: Как самообучающийся градер обучил 8B-модель к веб-разработке

Исследователи представили WebGrader — систему для обучения LLM через RL, которая автоматически генерирует тесты и оценивает функциональность сайтов. Новая методика позволила 8-миллиардной модели превзойти по качеству крупные специализированные аналог

Баннер новости 5408

Проблема: «Черный ящик» в оценке веб-кода

Современные большие языковые модели (LLM) уже способны генерировать полноценные веб-сайты по текстовому описанию. Однако ключевым узким местом остается дизайн функции вознаграждения (reward design) для обучения с подкреплением (RL). Ручное написание браузерных скриптов для проверки каждого запроса слишком дорого, а системы на базе VLM (визуальных языковых моделей) часто выносят вердикт, не дождавшись завершения критических действий на странице.

Решение: WebGrader и Flow Contract

Авторы из команды Boshui Chen, Huiping Liu и Shaolei Zhang предложили WebGrader — самоэволюционирующего программистского градера. Система работает по следующему алгоритму:

  • Автоматический анализ: WebGrader автономно выводит необходимые сценарии взаимодействия (interaction flows) из каждого запроса на создание сайта.
  • Flow Contract: Каждый сценарий представляется как исполняемый «Контракт потока».
  • Сбор доказательств: Проект материализуется в живом браузере. Система сопоставляет целевые действия с исходным кодом и живым DOM, собирая визуальные, сетевые и состояния памяти доказательства.
  • Offline-обучение: Офлайн-цикл на основе остаточных ошибок обнаруживает повторно используемые навыки верификации, тестирует их на отдельных страницах и замораживает граф навыков перед началом тренировки основной политики.

Результаты: 8B-модель бьет гигантов

Эксперименты показали, что использование WebGrader для обучения политики позволяет достичь высокой функциональной успешности даже на моделях среднего размера. 8-миллиардная модель, обученная с помощью WebGrader, превзошла как специализированные награды, так и крупные коммерческие модели.

Метрика / Модель Результат Примечание
WebGen-Bench (Functional Success) 52.01% Результат 8B-политики, обученной с WebGrader
Прирост над базой +7.88 п. По сравнению с наградой «внешний вид + скрипт»
WebGen-Bench (vs. SOTA) Лучше Превзошел o4-mini и DeepSeek-v4-flash
WG-core-250 (Full Score) 44.953 Результат обученной политики
WG-core-250 (vs. SOTA) Лучше Превзошел Qwen3-Coder-480B

Почему это важно

WebGrader решает фундаментальную проблему масштабируемости проверки кода. Отделяя планирование тестов, привязку действий, сбор доказательств и семантическую оценку, система выносит вердикт «Pass» только после наблюдения за требуемым переходом состояния. Это позволяет использовать более эффективные и дешевые модели (8B) для задач, где ранее требовались гиганты вроде Qwen3-Coder-480B, значительно снижая порог входа в автоматизированную веб-разработку.

Источник: arXiv cs.AI ↗