Исследования7 июля 2026 г., 14:23 МСК🤖 Auto

VERITAS: AI-агент для автоматической проверки научных статей

Исследователи представили VERITAS — универсальный фреймворк на базе CLI-агентов, который автоматически воспроизводит эксперименты из научных работ и оценивает их достоверность.

Баннер новости 3032

Проблема верификации в эпоху AI

Скорость публикации научных статей, ускоренная инструментами ИИ, опережает возможности систем их рецензирования. Ручная репликация результатов становится слишком дорогой и медленной. Существующие решения часто представляют собой изолированные бенчмарки с привязанными агентами, которые не могут работать вне своей специфической среды. Авторы работы из arXiv (2607.02931) предлагают решение этой проблемы через создание доменно-независимого инструмента VERITAS.

Как работает VERITAS

VERITAS — это фреймворк, построенный вокруг CLI-агентов (интерфейса командной строки). Система работает по следующему алгоритму:

  • Извлечение: Анализирует статью и/или репозиторий с кодом, выделяя ключевые утверждения (claims).
  • Запуск: Автоматически запускает методологию, описанную в работе.
  • Решение проблем: В реальном времени выявляет и исправляет ошибки в коде или настройках среды.
  • Оценка: Сопоставляет полученные экспериментальные данные с исходными утверждениями авторов.

Результаты и метрики

Команда протестировала VERITAS на наборах данных CORE-Bench и ReplicationBench, охватывающих 65 статей из компьютерных наук, социальных наук, медицины и астрофизики. Инструмент сравнивался с сильными базовыми моделями Claude Code, работающими в той же среде. VERITAS показал state-of-the-art результаты, лидируя по всем метрикам.

Ключевые выходные данные системы включают:

  • Replication Score: Взвешенный по значимости балл репликации.
  • Severity-rated log: Журнал всех примененных исправлений с оценкой их серьезности.
  • Patched codebase: Исправленная версия кода, готовая к использованию.
Метрика / Характеристика VERITAS Claude Code (Baseline)
Общий подход Универсальный фреймворк с CLI-агентами Базовая модель в той же среде
Охват дисциплин CS, социальные науки, медицина, астрофизика Информация недостаточна
Количество тестовых статей 65 (CORE-Bench + ReplicationBench) 65
Результат сравнения State-of-the-art, лидер по всем метрикам Уступает VERITAS

Почему это важно

VERITAS закрывает критический пробел в научном сообществе, предлагая не просто бенчмарк, а рабочий инструмент для независимой проверки. Автоматизация процесса исправления кода и верификации утверждений позволяет снизить барьер для воспроизводимости исследований, что особенно актуально в условиях роста публикаций, сгенерированных или ускоренных с помощью ИИ.

Источник: arXiv cs.AI ↗