Исследования19 августа 2026 г., 13:19 МСК🤖 Auto

ASI-Bench: ИИ провалил тест на самостоятельные научные открытия

Новый бенчмарк ASI-Bench показал, что современные AI-агенты не способны к автономному научному исследованию без жесткого человеческого контроля.

Баннер новости 6065

Проблема существующих метрик

Современные модели ИИ демонстрируют выдающиеся результаты в задачах, требующих запоминания, сжатия и применения уже существующих человеческих знаний. Однако истинная цель достижения Искусственного Суперинтеллекта (ASI) — это способность выходить за рамки известного: исследовать неизвестное, создавать новые знания и превращать идеи в верифицируемые результаты. Существующие бенчмарки не способны оценить этот переход, так как они либо проверяют знание фактов, либо оценивают выполнение задач под тщательным руководством человека.

Что такое ASI-Bench

Команда из 42 исследователей, потратив более 31 000 человеко-часов, создала ASI-Bench — первый бенчмарк, оценивающий способность ИИ к инновационному исследованию и автономному научному выполнению задач. В набор данных вошли 60 проектов-задач, охватывающих 11 научных дисциплин. Ключевая особенность теста — прогрессивное снижение методологической помощи человеку. Агенты должны самостоятельно выбирать методы, проводить исследования и получать проверяемые результаты.

Результаты тестирования SOTA-моделей

Исследователи протестировали 18 конфигураций «агент-модель» (state-of-the-art). Результаты показали резкий спад производительности по мере уменьшения участия человека. Это доказывает, что текущие системы критически зависят от человеческого руководства и далеки от полноценного автономного научного цикла.

Уровень помощи человека Средний балл (Score) Суть задачи для ИИ
Полное методологическое руководство 50.91 ИИ следует детальной инструкции по методу
Указан только метод 29.10 ИИ должен сам найти детали реализации метода
Метод не указан 26.62 ИИ самостоятельно выбирает метод исследования

Почему это важно

Спад с 50.91 до 26.62 балла — это не просто статистика, а индикатор того, что ИИ пока не обладает «научным чутьем» или способностью к абстрактному планированию эксперимента. Все задачи в ASI-Bench проходят строгую проверку: экспертный обзор, аудит с помощью ИИ, выполнение в песочнице и валидацию оценщиками. Открытый доступ к бенчмарку призывает сообщество помочь ускорить путь человечества к настоящему суперинтеллекту, а не к его имитации.

Источник: arXiv cs.AI ↗