Проблема: ИИ умеет играть, но не умеет открывать
Современные модели демонстрируют выдающиеся результаты в известных задачах, однако существует критический пробел в оценке их способности к открытию (discovery) — формированию новых обобщений через эксперименты в средах с неизвестными целями. DiG-bench (Discovery in Games) создан именно для заполнения этого разрыва, проверяя не просто выполнение инструкций, а способность агента сформировать гипотезу о работе системы с нуля.
Механика: 70 игр, 7 уровней сложности
Бенчмарк состоит из 70 независимых игр, каждая из которых закодирована в виде короткой строки. У каждой игры есть уникальные правила трансформации, которые агент должен выявить через взаимодействие. Важно, что условия победы на уровнях также скрыты от модели — она должна понять логику среды, чтобы успешно завершить челлендж.
Игры разделены на 7 уровней сложности. Самая низкая ступень доступна большинству современных моделей, тогда как высший уровень (Tier 7) требует продвинутых агентов с внешними инструментами (agentic harnesses). Для валидации сложности авторы отмечают, что все 70 игр были успешно решены хотя бы одним человеком с первой попытки.
Доступность и структура данных
Для открытого сообщества и тестирования опубликована подмножество из 21 игры. Остальные 49 игр остаются в закрытом доступе (private) для проведения безопасной и честной оценки без риска «загрязнения» данных (data leakage) через публичные форумы или предобученные веса.
| Параметр | Значение / Описание |
|---|---|
| Название бенчмарка | DiG-bench (Discovery in Games) |
| Общее количество игр | 70 |
| Публично доступные игры | 21 |
| Закрытые игры (для оценки) | 49 |
| Уровни сложности | 7 (от базовых до экспертных) |
| Ключевая метрика | Способность вывести правила среды без явного задания цели |
Почему это важно для индустрии
DiG-bench смещает фокус с «запоминания» паттернов на абстрактное рассуждение. Если модель может самостоятельно сформулировать правило игры, которую она никогда не видела, это свидетельствует о наличии навыков, близких к научному методу. Это критически важно для развития автономных AI-агентов, способных работать в новых, неструктурированных средах без постоянной дообучки.
Авторы и контекст
Работа выполнена коллективом из 16 авторов, включая исследователей из DeepMind, Meta AI, MIT и других ведущих лабораторий. Статья подана в arXiv 12 августа 2026 года (arXiv:2608.12593), что указывает на актуальность темы в контексте развития следующего поколения интеллектуальных систем.
Источник: arXiv cs.AI ↗
