Исследования22 сентября 2026 г., 07:22 МСК🤖 Auto

GameASG-Bench: AI-генерация игр — 93% тестов пройдено, но 55% задач провалены

Исследователи представили GameASG-Bench — первый бенчмарк для оценки автономной генерации программного обеспечения (ASG) в геймдеве. Результаты показали разрыв между прохождением отдельных проверок и реальной работоспособностью игр.

Баннер новости 8010

Проблема «зеленого» кода

Автономная генерация программного обеспечения (ASG) обещает превращать текстовые требования в готовые приложения. Однако, как показывают новые данные, успешная компиляция кода не гарантирует, что игра соответствует заявленным поведенческим требованиям. Исследователи из команды, возглавляемой Си Хуэем Чжаном (Xiuhui Zhang), создали GameASG-Bench — специализированный набор тестов, который делает поведенческую тестируемость ядром задачи генерации игр.

Методология: L1 и L2 проверки

В отличие от простых проверок на синтаксис, GameASG-Bench использует двухуровневую систему оценки, фиксируя легальные стартовые сценарии, действия игрока, стабильные снимки состояния (snapshots) и инварианты, оставляя при этом внутреннюю реализацию открытой для агентов:

  • L1 (Static): Статический анализ исходного кода на соответствие спецификациям.
  • L2 (Browser-executed): Динамическая проверка в браузере, сочетающая семантические наблюдения, реальный ввод пользователя и доказательства из времени выполнения (runtime evidence).

Масштаб и результаты

Бенчмарк включает 47 задач, охватывающих 12 основных жанров игр и взаимодействие как в 2D, так и в 3D. Каждая задача имеет исполняемые проверки и независимо верифицированную эталонную реализацию. Эксперименты с девятью различными стеками агентов выявили критический разрыв:

Метрика Значение Интерпретация
Средний процент прохождения L2 93.2% Высокий уровень локальной корректности кода
Строгий успех задачи (Strict Task Success) 55.3% (26/47) Только половина задач выполнена полностью (L1 + все L2)
Совпадение успешных задач между хarnессами 10 из 18 Низкая воспроизводимость даже у лучших моделей

Влияние инструментов и бюджета

Исследование ответило на ключевые вопросы о производительности агентов. Для модели DeepSeek-V4-Flash полный доступ к инструментам и увеличенный бюджет «ходов» (turn budget) привели к большему количеству строгих успехов. Однако зависимость от усилий рассуждения (reasoning effort) не является монотонной — больше размышлений не всегда означает лучший результат.

Почему это важно

Результаты GameASG-Bench обнажают «пробелы на уровне задач», которые скрываются за высокими средними показателями прохождения проверок. Для индустрии это сигнал: текущие AI-агенты могут писать рабочий код, но struggle с комплексной логикой игровых механик. Это задает новую планку для разработки автономных разработчиков игр, смещая фокус с генерации кода на гарантию поведенческой целостности.

Источник: arXiv cs.AI ↗