Что такое ARC-AGI 3?
ARC-AGI (Abstraction and Reasoning Corpus) — это набор задач, разработанный для измерения способности искусственного интеллекта к абстрактному мышлению и обучению на основе небольшого количества примеров. Третья версия датасета, представленная командой Vercel, значительно расширяет предыдущие итерации, предлагая более сложные и разнообразные сценарии.
Ключевая особенность ARC-AGI 3 — фокус на генеративных навыках (Skill Issue). Модели должны не только классифицировать данные, но и создавать новые структуры, основываясь на выявленных закономерностях. Это требует от ИИ-систем более высокого уровня когнитивной гибкости.
Ключевые метрики и структура
Новый бенчмарк включает 1000 уникальных задач, каждая из которых требует от модели применить абстрактное рассуждение для решения. Задачи разделены на несколько категорий, отражающих различные аспекты интеллектуальной деятельности:
| Категория | Описание | Сложность |
|---|---|---|
| Пространственное мышление | Работа с 2D/3D структурами и трансформациями | Высокая |
| Логические операции | Применение правил и условий | Средняя |
| Семантическое понимание | Интерпретация контекста и смысла | Высокая |
| Генерация | Создание новых объектов на основе паттернов | Экстремальная |
Почему это важно?
Текущие большие языковые модели (LLM) часто демонстрируют высокие результаты в задачах, связанных с обработкой текста, но сталкиваются с трудностями в абстрактном рассуждении. ARC-AGI 3 служит индикатором прогресса в направлении к общему искусственному интеллекту (AGI). Успешное решение этих задач требует от модели не просто запоминания данных, а способности к переносу знаний (transfer learning) и индуктивному выводу.
Для разработчиков и исследователей ARC-AGI 3 предоставляет четкий ориентир для оценки реальных когнитивных способностей ИИ-систем, выходящих за рамки статистического анализа данных.
Как участвовать?
Датасет доступен для тестирования через платформу Vercel. Участники могут загружать свои модели и получать детальный отчет о производительности по каждой категории задач. Это позволяет не только оценить общий балл, но и выявить слабые места в архитектуре модели.
- Доступ к датасету: через официальный сайт Vercel
- Формат submissions: JSON-файлы с предсказаниями
- Критерии оценки: точность и эффективность решения
Источник: Vercel ↗
