Проблема «черного ящика» в научных агентах
Современные LLM-агенты для научных открытий (такие как AI Scientist-v2, Agent Laboratory) активно помогают в синтезе литературы и планировании экспериментов. Однако ключевая проблема остается нерешенной: первая исследовательская гипотеза, сгенерированная моделью, часто звучит правдоподобно, но не раскрывает механизм, допущения или потенциального «фальсификатора». Ученый не может проверить логику вывода, если она скрыта в промпте.
Решение: Research Question Certificate
Авторы предлагают фреймворк FirstResearch, центральным артефактом которого является структурированный Research Question Certificate (Сертификат исследовательского вопроса). Этот документ обязывает модель явно зафиксировать:
- Примитивные определения и допущения;
- Модель механизма (как именно работает эффект);
- Напряжение или противоречие, которое решает гипотеза;
- Фальсифицируемую гипотезу;
- Минимальный решающий тест;
- Правило обновления при ошибке.
Это позволяет инспектору (человеку или другой модели) оценить обоснованность вопроса до начала дорогостоящих вычислительных экспериментов.
Результаты бенчмарков
Система протестирована на 10 темах научных исследований. Оценка проводилась с использованием LLM-судей (DeepSeek и Gemini-2.5-Flash) по сравнению с базовыми промпт-уровнями. Результаты показывают статистически значимое превосходство FirstResearch:
| Метрика / Модель | FirstResearch | Лучший базовый метод | Примечание |
|---|---|---|---|
| Оценка DeepSeek (изначально) | 4.86 / 5.0 | 4.38 / 5.0 | Первичный судья |
| Оценка Gemini-2.5-Flash | 4.86 / 5.0 | 4.38 / 5.0 | Независимый рескоринг, корреляция Пирсона 0.865 |
| Абляция (только сертификат) | 4.90 (DeepSeek) 4.88 (Gemini) |
— | Доказывает, что структура сертификата — ключевой драйвер качества |
| Без сертификата (ablation) | < 1.0 / 5.0 | — | Качество падает катастрофически без структурированного вывода |
Значение для науки
Результаты подтверждают узкий, но важный научный тезис: явные ограничения на вывод (explicit derivation constraints) делают сгенерированные LLM вопросы более аудируемыми. Хотя оценка проводилась ИИ-судьями, а не людьми-экспертами, падение качества до уровня «ниже 1/5» при удалении сертификата доказывает, что именно структура, а не просто «умный промпт», обеспечивает надежность гипотезы. Код и скрипты репродукции доступны в открытом доступе.
Источник: arXiv cs.AI ↗
