Исследования14 августа 2026 г., 12:19 МСК🤖 Auto

DiG-bench: Новый тест на способность ИИ к научному открытию

Команда исследователей представила DiG-bench — бенчмарк из 70 игр, где ИИ должен самостоятельно выявлять скрытые правила, имитируя процесс научного открытия.

Баннер новости 5788

Проблема: ИИ умеет играть, но не умеет открывать

Современные модели демонстрируют выдающиеся результаты в известных задачах, однако существует критический пробел в оценке их способности к открытию (discovery) — формированию новых обобщений через эксперименты в средах с неизвестными целями. DiG-bench (Discovery in Games) создан именно для заполнения этого разрыва, проверяя не просто выполнение инструкций, а способность агента сформировать гипотезу о работе системы с нуля.

Механика: 70 игр, 7 уровней сложности

Бенчмарк состоит из 70 независимых игр, каждая из которых закодирована в виде короткой строки. У каждой игры есть уникальные правила трансформации, которые агент должен выявить через взаимодействие. Важно, что условия победы на уровнях также скрыты от модели — она должна понять логику среды, чтобы успешно завершить челлендж.

Игры разделены на 7 уровней сложности. Самая низкая ступень доступна большинству современных моделей, тогда как высший уровень (Tier 7) требует продвинутых агентов с внешними инструментами (agentic harnesses). Для валидации сложности авторы отмечают, что все 70 игр были успешно решены хотя бы одним человеком с первой попытки.

Доступность и структура данных

Для открытого сообщества и тестирования опубликована подмножество из 21 игры. Остальные 49 игр остаются в закрытом доступе (private) для проведения безопасной и честной оценки без риска «загрязнения» данных (data leakage) через публичные форумы или предобученные веса.

Параметр Значение / Описание
Название бенчмарка DiG-bench (Discovery in Games)
Общее количество игр 70
Публично доступные игры 21
Закрытые игры (для оценки) 49
Уровни сложности 7 (от базовых до экспертных)
Ключевая метрика Способность вывести правила среды без явного задания цели

Почему это важно для индустрии

DiG-bench смещает фокус с «запоминания» паттернов на абстрактное рассуждение. Если модель может самостоятельно сформулировать правило игры, которую она никогда не видела, это свидетельствует о наличии навыков, близких к научному методу. Это критически важно для развития автономных AI-агентов, способных работать в новых, неструктурированных средах без постоянной дообучки.

Авторы и контекст

Работа выполнена коллективом из 16 авторов, включая исследователей из DeepMind, Meta AI, MIT и других ведущих лабораторий. Статья подана в arXiv 12 августа 2026 года (arXiv:2608.12593), что указывает на актуальность темы в контексте развития следующего поколения интеллектуальных систем.

Источник: arXiv cs.AI ↗