Проблема «зеленого» кода
Автономная генерация программного обеспечения (ASG) обещает превращать текстовые требования в готовые приложения. Однако, как показывают новые данные, успешная компиляция кода не гарантирует, что игра соответствует заявленным поведенческим требованиям. Исследователи из команды, возглавляемой Си Хуэем Чжаном (Xiuhui Zhang), создали GameASG-Bench — специализированный набор тестов, который делает поведенческую тестируемость ядром задачи генерации игр.
Методология: L1 и L2 проверки
В отличие от простых проверок на синтаксис, GameASG-Bench использует двухуровневую систему оценки, фиксируя легальные стартовые сценарии, действия игрока, стабильные снимки состояния (snapshots) и инварианты, оставляя при этом внутреннюю реализацию открытой для агентов:
- L1 (Static): Статический анализ исходного кода на соответствие спецификациям.
- L2 (Browser-executed): Динамическая проверка в браузере, сочетающая семантические наблюдения, реальный ввод пользователя и доказательства из времени выполнения (runtime evidence).
Масштаб и результаты
Бенчмарк включает 47 задач, охватывающих 12 основных жанров игр и взаимодействие как в 2D, так и в 3D. Каждая задача имеет исполняемые проверки и независимо верифицированную эталонную реализацию. Эксперименты с девятью различными стеками агентов выявили критический разрыв:
| Метрика | Значение | Интерпретация |
|---|---|---|
| Средний процент прохождения L2 | 93.2% | Высокий уровень локальной корректности кода |
| Строгий успех задачи (Strict Task Success) | 55.3% (26/47) | Только половина задач выполнена полностью (L1 + все L2) |
| Совпадение успешных задач между хarnессами | 10 из 18 | Низкая воспроизводимость даже у лучших моделей |
Влияние инструментов и бюджета
Исследование ответило на ключевые вопросы о производительности агентов. Для модели DeepSeek-V4-Flash полный доступ к инструментам и увеличенный бюджет «ходов» (turn budget) привели к большему количеству строгих успехов. Однако зависимость от усилий рассуждения (reasoning effort) не является монотонной — больше размышлений не всегда означает лучший результат.
Почему это важно
Результаты GameASG-Bench обнажают «пробелы на уровне задач», которые скрываются за высокими средними показателями прохождения проверок. Для индустрии это сигнал: текущие AI-агенты могут писать рабочий код, но struggle с комплексной логикой игровых механик. Это задает новую планку для разработки автономных разработчиков игр, смещая фокус с генерации кода на гарантию поведенческой целостности.
Источник: arXiv cs.AI ↗
