Исследования8 июля 2026 г., 08:16 МСК🤖 Auto

FirstResearch: Как сделать научные гипотезы LLM проверяемыми

Исследователь Yufeng Wang представил FirstResearch — систему, превращающую абстрактные идеи LLM в структурированные, аудируемые научные сертификаты с четкими механизмами фальсификации.

Баннер новости 3085

Проблема «черного ящика» в научных агентах

Современные LLM-агенты для научных открытий (такие как AI Scientist-v2, Agent Laboratory) активно помогают в синтезе литературы и планировании экспериментов. Однако ключевая проблема остается нерешенной: первая исследовательская гипотеза, сгенерированная моделью, часто звучит правдоподобно, но не раскрывает механизм, допущения или потенциального «фальсификатора». Ученый не может проверить логику вывода, если она скрыта в промпте.

Решение: Research Question Certificate

Авторы предлагают фреймворк FirstResearch, центральным артефактом которого является структурированный Research Question Certificate (Сертификат исследовательского вопроса). Этот документ обязывает модель явно зафиксировать:

  • Примитивные определения и допущения;
  • Модель механизма (как именно работает эффект);
  • Напряжение или противоречие, которое решает гипотеза;
  • Фальсифицируемую гипотезу;
  • Минимальный решающий тест;
  • Правило обновления при ошибке.

Это позволяет инспектору (человеку или другой модели) оценить обоснованность вопроса до начала дорогостоящих вычислительных экспериментов.

Результаты бенчмарков

Система протестирована на 10 темах научных исследований. Оценка проводилась с использованием LLM-судей (DeepSeek и Gemini-2.5-Flash) по сравнению с базовыми промпт-уровнями. Результаты показывают статистически значимое превосходство FirstResearch:

Метрика / Модель FirstResearch Лучший базовый метод Примечание
Оценка DeepSeek (изначально) 4.86 / 5.0 4.38 / 5.0 Первичный судья
Оценка Gemini-2.5-Flash 4.86 / 5.0 4.38 / 5.0 Независимый рескоринг, корреляция Пирсона 0.865
Абляция (только сертификат) 4.90 (DeepSeek)
4.88 (Gemini)
Доказывает, что структура сертификата — ключевой драйвер качества
Без сертификата (ablation) < 1.0 / 5.0 Качество падает катастрофически без структурированного вывода

Значение для науки

Результаты подтверждают узкий, но важный научный тезис: явные ограничения на вывод (explicit derivation constraints) делают сгенерированные LLM вопросы более аудируемыми. Хотя оценка проводилась ИИ-судьями, а не людьми-экспертами, падение качества до уровня «ниже 1/5» при удалении сертификата доказывает, что именно структура, а не просто «умный промпт», обеспечивает надежность гипотезы. Код и скрипты репродукции доступны в открытом доступе.

Источник: arXiv cs.AI ↗