Проблема воспроизводимости и решение через MCP
Научные статьи по машинному обучению часто содержат код, который трудно запустить из-за сложных зависимостей и ошибок конфигурации. Команда под руководством Цзячэн Мяо и Джеймса Зоу из Стэнфорда представила Paper2Agent — систему, превращающую статью и её репозиторий в сервер Model Context Protocol (MCP). Теперь любой совместимый агент (например, Claude Code) может выполнять методы исследования через естественный язык, выступая в роли «виртуального автора-корреспондента».
Как работает пайплайн: 6 шагов и строгая валидация
Система работает на базе SDK Claude Code. Оркестратор распределяет задачи между специализированными суб-агентами по следующему алгоритму:
- Поиск и скачивание кодовой базы.
- Создание изолированной виртуальной среды.
- Индексация обучающих туториалов из репозитория.
- Запуск туториалов для получения эталонных результатов.
- Извлечение инструментов и их тестирование.
- Сборка валидированных инструментов в единый MCP-сервер.
Критерии прохождения валидации жесткие: числовые результаты должны совпадать с точностью до 3%, а фигуры — иметь расстояние Хэмминга по перцептивному хэшу менее 20. У агента есть до 6 попыток на функцию; неудачные инструменты исключаются.
Результаты бенчмарков: Paper2Agent против Claude + Repo и Biomni
В исследовании использовалась модель Claude Sonnet 4. Агент AlphaGenome был создан за 45 минут за $14, все 22 инструмента прошли валидацию без участия человека. Ниже приведены сравнительные результаты на различных типах запросов:
| Тип запроса | Paper2Agent | Claude + Repo | Biomni |
|---|---|---|---|
| 15 запросов по туториалам | 98.7 ± 1.3% | 82.7 ± 3.4% | 37.3 ± 4.0% |
| 15 новых (novel) запросов | 100.0 ± 0.0% | 78.7 ± 4.4% | 56.0 ± 3.4% |
| 30 открытых запросов | 82.7 ± 2.4% | 56.7 ± 2.3% | 72.2 ± 2.2% |
На запросах по туториалам медианное время выполнения сократилось в 1.9 раза по сравнению с Claude + Repo и в 3.1 раза по сравнению с Biomni. При этом агент не только воспроизвел результаты, но и пересмотрел выводы оригинальной статьи AlphaGenome, выделив ген SORT1 как вероятную причинную мишень для варианта LDL-холестерина, в то время как оригинал акцентировал внимание на CELSR2 и PSRC1.
Масштабируемость и экономическая эффективность
Тестирование на корпусе из 100 статей bioRxiv показало, что 74 статьи были успешно «агентифицированы», а 593 из 599 предложенных инструментов прошли валидацию. Для 300 вопросов Paper2Agent набрал 91.2% точности, обойдя базовые модели Claude Sonnet 4 (80.3%) и 4.6 (86.3%).
Экономические показатели также впечатляют: стоимость одного запроса составляет $0.20 при времени выполнения 1.6 минуты, тогда как у конкурентов (Claude + Repo) это $0.38 и 4.3 минуты соответственно. Агент успешно справился с задачами на небиологических данных (TabPFN, SAM 2), показав 98.1% точности, и полностью отклонил запросы вне своей компетенции.
Коллаборация агентов и выводы
Исследователи продемонстрировали способность трех агентов (AlphaGenome, MPRA-coupled scCRISPRi и CD4+ T cell Perturb-seq) совместно работать. В результате совместного анализа был предложен ген GPR137 как вероятная причинная мишень для псориаза, что было подтверждено корреляцией сигнатур при стимуляции. Код проекта распространяется под лицензией MIT, а готовые серверы доступны на Hugging Face Spaces и через интерфейс paper2agent.ai.
Источник: MarkTechPost ↗
