Проблема: «Галлюцинации» и фейковые данные
Современные LLM часто генерируют правдоподобный, но научно несостоятельный текст. Основные проблемы существующих систем: утверждения не привязаны к проверяемой литературе, экспериментальные результаты выдуманы, а нет стандарта оценки качества. Команда из 6 исследователей во главе с Рамшой Камран решила эту проблему, создав многоагентную архитектуру Prompt-to-Paper.
Архитектура: Три ключевых инновации
Система работает по принципу «от промпта до статьи» и включает три интегрированных модуля:
- Детерминированная RAG-генерация: Каждое утверждение проверяется по корпусу из 60–100 научных работ. Используется скоринг релевантности и «снежный ком» цитирования для исключения вымысла.
- Автономный код-агент: Вместо генерации чисел на основе вероятностей, ИИ пишет и исполняет реальный код для биологических экспериментов, получая настоящие числовые результаты.
- 8-мерный скорер качества: Автоматическая оценка рукописи по 8 параметрам с штрафами за галлюцинации. Система использует цикл улучшений: каждые 10 итераций запускается глубокий поиск и пересчет.
Результаты в цифрах
Система протестирована на пяти кейсах биоинформатики. Все сгенерированные PDF-файлы были готовы к подаче, а количество «вылетевших» (out-of-range) цитат составило ноль. Ниже приведено сравнение метрик качества и стоимости:
| Метрика | Значение / Результат | Примечание |
|---|---|---|
| Улучшение качества | +17.96 баллов (в среднем) | Масштаб 0–100, макс. прирост +26.04 |
| Оценка человеком | 7.0 из 10 | Средний балл от внешнего рецензента |
| Стоимость статьи | ~0.31 USD | Затраты на вычислительные ресурсы |
| Цитирование | 0 ошибок | Все ссылки верифицированы и существуют |
Значение для науки
Prompt-to-Paper демонстрирует переход от генерации текста к генерации научного знания. Способность системы самостоятельно запускать вычисления и проверять ссылки делает её прототипом будущего «автономного исследователя». Это снижает порог входа для биоинформатики, но требует строгой верификации, так как даже 7/10 от человека — это лишь базовый уровень приемлемости, а не гарантия открытия.
Источник: arXiv cs.AI ↗
