Проблема «черного ящика» в оценке ИИ-ученых
Существующие бенчмарки для автономных ИИ-агентов оценивают только финальный результат: написанный код, гипотезы или статьи. Это скрывает сам процесс рассуждений, делая невозможным аудит научной методологии и диагностику сбоев. Авторы работы OpenDiscoveryTrace (Aayam Bansal, Keertan Balaji) предлагают решение: публичный датасет из 558 полных траекторий ИИ-агентов, фиксирующих не только результат, но и ход мыслей.
Структура данных и масштаб исследования
Каждый шаг в траектории записывается в виде структурированного трейса из 9 полей: мысли, вызовы инструментов, наблюдения, ошибки, триггеры пересмотра и самооценка уверенности. Датасет охватывает 124 научных задачи в четырех областях: открытие лекарств, материаловедение, геномика и анализ научной литературы. В исследовании участвовали 7 моделей:
- Frontier-модели (по 124 траектории): GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro.
- Open-weight модели (по 30 траекторий): Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, Qwen2.5-1.5B.
- Варианты с live-retrieval: 60 дополнительных траекторий.
Ключевые метрики: успех vs. надежность
Пилотный анализ 363 траекторий, оцененных LLM-судьями, выявил критическое различие между моделями. Все три флагманские модели показывают сопоставимый уровень успеха (84–89%), но кардинально различаются по качеству процесса. GPT-5.4 демонстрирует высочайшую стабильность, тогда как Claude Opus 4.6 склонен к грубым ошибкам в использовании инструментов.
| Модель | Успешность | Среднее кол-во ошибок на траекторию | Типичные ошибки |
|---|---|---|---|
| GPT-5.4 | 84–89% | 0.08 | 83.6% — ошибки рассуждения |
| Claude Opus 4.6 | 84–89% | 2.5 | 66.7% — misuse инструментов |
| Qwen2.5-7B | — | — | — |
Статистическая значимость различий подтверждена тестом Клиффа ($\delta = 0.613$, $p < 0.0001$). Разница в 30 раз по количеству ошибок делает GPT-5.4 предпочтительным выбором для задач, требующих высокой надежности, несмотря на то, что Claude Opus 4.6 может выдавать корректный финальный ответ.
Значение для AI Governance и науки
OpenDiscoveryTrace — это не просто набор данных, а инструмент для аудита. Открытые данные (CC BY 4.0), схема трейсов, хarness агента и определения бенчмарков позволяют исследователям строить модели, предсказывающие поведение агентов, и разрабатывать механизмы контроля. Работа получила награду Best Dataset на ICML 2026 Workshop on AI for Science, что подчеркивает важность перехода от оценки «что» к оценке «как» в развитии автономных научных агентов.
Источник: arXiv cs.AI ↗
