Релиз модели17 сентября 2026 г., 03:19 МСК🤖 Auto

Paper2Agent: Stanford превращает статьи в работающие AI-агенты

Исследователи из Стэнфорда опубликовали в Nature метод Paper2Agent, который автоматически конвертирует научные статьи с кодом в валидированные MCP-серверы, позволяя агентам воспроизводить результаты и работать с новыми данными.

Баннер новости 7676

Проблема воспроизводимости и решение через MCP

Научные статьи по машинному обучению часто содержат код, который трудно запустить из-за сложных зависимостей и ошибок конфигурации. Команда под руководством Цзячэн Мяо и Джеймса Зоу из Стэнфорда представила Paper2Agent — систему, превращающую статью и её репозиторий в сервер Model Context Protocol (MCP). Теперь любой совместимый агент (например, Claude Code) может выполнять методы исследования через естественный язык, выступая в роли «виртуального автора-корреспондента».

Как работает пайплайн: 6 шагов и строгая валидация

Система работает на базе SDK Claude Code. Оркестратор распределяет задачи между специализированными суб-агентами по следующему алгоритму:

  • Поиск и скачивание кодовой базы.
  • Создание изолированной виртуальной среды.
  • Индексация обучающих туториалов из репозитория.
  • Запуск туториалов для получения эталонных результатов.
  • Извлечение инструментов и их тестирование.
  • Сборка валидированных инструментов в единый MCP-сервер.

Критерии прохождения валидации жесткие: числовые результаты должны совпадать с точностью до 3%, а фигуры — иметь расстояние Хэмминга по перцептивному хэшу менее 20. У агента есть до 6 попыток на функцию; неудачные инструменты исключаются.

Результаты бенчмарков: Paper2Agent против Claude + Repo и Biomni

В исследовании использовалась модель Claude Sonnet 4. Агент AlphaGenome был создан за 45 минут за $14, все 22 инструмента прошли валидацию без участия человека. Ниже приведены сравнительные результаты на различных типах запросов:

Тип запроса Paper2Agent Claude + Repo Biomni
15 запросов по туториалам 98.7 ± 1.3% 82.7 ± 3.4% 37.3 ± 4.0%
15 новых (novel) запросов 100.0 ± 0.0% 78.7 ± 4.4% 56.0 ± 3.4%
30 открытых запросов 82.7 ± 2.4% 56.7 ± 2.3% 72.2 ± 2.2%

На запросах по туториалам медианное время выполнения сократилось в 1.9 раза по сравнению с Claude + Repo и в 3.1 раза по сравнению с Biomni. При этом агент не только воспроизвел результаты, но и пересмотрел выводы оригинальной статьи AlphaGenome, выделив ген SORT1 как вероятную причинную мишень для варианта LDL-холестерина, в то время как оригинал акцентировал внимание на CELSR2 и PSRC1.

Масштабируемость и экономическая эффективность

Тестирование на корпусе из 100 статей bioRxiv показало, что 74 статьи были успешно «агентифицированы», а 593 из 599 предложенных инструментов прошли валидацию. Для 300 вопросов Paper2Agent набрал 91.2% точности, обойдя базовые модели Claude Sonnet 4 (80.3%) и 4.6 (86.3%).

Экономические показатели также впечатляют: стоимость одного запроса составляет $0.20 при времени выполнения 1.6 минуты, тогда как у конкурентов (Claude + Repo) это $0.38 и 4.3 минуты соответственно. Агент успешно справился с задачами на небиологических данных (TabPFN, SAM 2), показав 98.1% точности, и полностью отклонил запросы вне своей компетенции.

Коллаборация агентов и выводы

Исследователи продемонстрировали способность трех агентов (AlphaGenome, MPRA-coupled scCRISPRi и CD4+ T cell Perturb-seq) совместно работать. В результате совместного анализа был предложен ген GPR137 как вероятная причинная мишень для псориаза, что было подтверждено корреляцией сигнатур при стимуляции. Код проекта распространяется под лицензией MIT, а готовые серверы доступны на Hugging Face Spaces и через интерфейс paper2agent.ai.

Источник: MarkTechPost ↗