Исследования11 сентября 2026 г., 07:17 МСК🤖 Auto

OpenDiscoveryTrace: Почему GPT-5.4 надежнее Claude Opus 4.6 в науке

Новый датасет OpenDiscoveryTrace раскрывает процесс мышления ИИ-ученых. Анализ 558 траекторий показал, что при схожей успешности GPT-5.4 совершает в 30 раз меньше ошибок инструментов, чем Claude Opus 4.6.

Баннер новости 7241

Проблема «черного ящика» в оценке ИИ-ученых

Существующие бенчмарки для автономных ИИ-агентов оценивают только финальный результат: написанный код, гипотезы или статьи. Это скрывает сам процесс рассуждений, делая невозможным аудит научной методологии и диагностику сбоев. Авторы работы OpenDiscoveryTrace (Aayam Bansal, Keertan Balaji) предлагают решение: публичный датасет из 558 полных траекторий ИИ-агентов, фиксирующих не только результат, но и ход мыслей.

Структура данных и масштаб исследования

Каждый шаг в траектории записывается в виде структурированного трейса из 9 полей: мысли, вызовы инструментов, наблюдения, ошибки, триггеры пересмотра и самооценка уверенности. Датасет охватывает 124 научных задачи в четырех областях: открытие лекарств, материаловедение, геномика и анализ научной литературы. В исследовании участвовали 7 моделей:

  • Frontier-модели (по 124 траектории): GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro.
  • Open-weight модели (по 30 траекторий): Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, Qwen2.5-1.5B.
  • Варианты с live-retrieval: 60 дополнительных траекторий.

Ключевые метрики: успех vs. надежность

Пилотный анализ 363 траекторий, оцененных LLM-судьями, выявил критическое различие между моделями. Все три флагманские модели показывают сопоставимый уровень успеха (84–89%), но кардинально различаются по качеству процесса. GPT-5.4 демонстрирует высочайшую стабильность, тогда как Claude Opus 4.6 склонен к грубым ошибкам в использовании инструментов.

Модель Успешность Среднее кол-во ошибок на траекторию Типичные ошибки
GPT-5.4 84–89% 0.08 83.6% — ошибки рассуждения
Claude Opus 4.6 84–89% 2.5 66.7% — misuse инструментов
Qwen2.5-7B

Статистическая значимость различий подтверждена тестом Клиффа ($\delta = 0.613$, $p < 0.0001$). Разница в 30 раз по количеству ошибок делает GPT-5.4 предпочтительным выбором для задач, требующих высокой надежности, несмотря на то, что Claude Opus 4.6 может выдавать корректный финальный ответ.

Значение для AI Governance и науки

OpenDiscoveryTrace — это не просто набор данных, а инструмент для аудита. Открытые данные (CC BY 4.0), схема трейсов, хarness агента и определения бенчмарков позволяют исследователям строить модели, предсказывающие поведение агентов, и разрабатывать механизмы контроля. Работа получила награду Best Dataset на ICML 2026 Workshop on AI for Science, что подчеркивает важность перехода от оценки «что» к оценке «как» в развитии автономных научных агентов.

Источник: arXiv cs.AI ↗