Автономные агенты на базе больших языковых моделей (LLM) всё чаще берут на себя роль исследователей. Однако их работа часто напоминает «черный ящик»: гипотезы, тесты и выводы теряются в неструктурированных логах, что делает невозможной проверку научного метода. Авторы работы Izumi Takahara и Teruyasu Mizoguchi предлагают решение — Hypothesis Evolution Protocol (HEP), который формализует цикл «гипотеза — тест — доказательство — убеждение».
Проблема невидимого научного метода
Современные планирующие агенты (planning-style agents) часто не способны к итеративному обновлению знаний. HEP выступает в роли «хarness» (системной обвязки), которая выносит процессы генерации, оценки и эволюции гипотез на уровень явных, аудируемых операций. Это позволяет исследователю не просто получить ответ, а проследить логику принятия решений ИИ.
Результаты тестирования в материаловедении
Протокол был протестирован на задачах материаловедения. Ключевые выводы исследования:
- Генерализация: HEP успешно работает с различными научными вопросами, не требуя переобучения под каждую новую задачу.
- Масштабируемость: Эффективность протокола напрямую зависит от мощности базовой LLM: чем совершеннее модель, тем полнее она использует возможности HEP.
- Аудируемость: Процесс становится прозрачным для верификации человеком.
Значение для науки
Представленная работа — это шаг к созданию «проверяемых AI-ученых». В условиях, когда доверие к результатам ИИ-исследований критически важно, HEP обеспечивает инфраструктуру, необходимую для интеграции автономных агентов в реальные научные открытия.
Источник: arXiv cs.AI ↗
