Проблема существующих метрик
Современные модели ИИ демонстрируют выдающиеся результаты в задачах, требующих запоминания, сжатия и применения уже существующих человеческих знаний. Однако истинная цель достижения Искусственного Суперинтеллекта (ASI) — это способность выходить за рамки известного: исследовать неизвестное, создавать новые знания и превращать идеи в верифицируемые результаты. Существующие бенчмарки не способны оценить этот переход, так как они либо проверяют знание фактов, либо оценивают выполнение задач под тщательным руководством человека.
Что такое ASI-Bench
Команда из 42 исследователей, потратив более 31 000 человеко-часов, создала ASI-Bench — первый бенчмарк, оценивающий способность ИИ к инновационному исследованию и автономному научному выполнению задач. В набор данных вошли 60 проектов-задач, охватывающих 11 научных дисциплин. Ключевая особенность теста — прогрессивное снижение методологической помощи человеку. Агенты должны самостоятельно выбирать методы, проводить исследования и получать проверяемые результаты.
Результаты тестирования SOTA-моделей
Исследователи протестировали 18 конфигураций «агент-модель» (state-of-the-art). Результаты показали резкий спад производительности по мере уменьшения участия человека. Это доказывает, что текущие системы критически зависят от человеческого руководства и далеки от полноценного автономного научного цикла.
| Уровень помощи человека | Средний балл (Score) | Суть задачи для ИИ |
|---|---|---|
| Полное методологическое руководство | 50.91 | ИИ следует детальной инструкции по методу |
| Указан только метод | 29.10 | ИИ должен сам найти детали реализации метода |
| Метод не указан | 26.62 | ИИ самостоятельно выбирает метод исследования |
Почему это важно
Спад с 50.91 до 26.62 балла — это не просто статистика, а индикатор того, что ИИ пока не обладает «научным чутьем» или способностью к абстрактному планированию эксперимента. Все задачи в ASI-Bench проходят строгую проверку: экспертный обзор, аудит с помощью ИИ, выполнение в песочнице и валидацию оценщиками. Открытый доступ к бенчмарку призывает сообщество помочь ускорить путь человечества к настоящему суперинтеллекту, а не к его имитации.
Источник: arXiv cs.AI ↗
