Проблема верификации в эпоху AI
Скорость публикации научных статей, ускоренная инструментами ИИ, опережает возможности систем их рецензирования. Ручная репликация результатов становится слишком дорогой и медленной. Существующие решения часто представляют собой изолированные бенчмарки с привязанными агентами, которые не могут работать вне своей специфической среды. Авторы работы из arXiv (2607.02931) предлагают решение этой проблемы через создание доменно-независимого инструмента VERITAS.
Как работает VERITAS
VERITAS — это фреймворк, построенный вокруг CLI-агентов (интерфейса командной строки). Система работает по следующему алгоритму:
- Извлечение: Анализирует статью и/или репозиторий с кодом, выделяя ключевые утверждения (claims).
- Запуск: Автоматически запускает методологию, описанную в работе.
- Решение проблем: В реальном времени выявляет и исправляет ошибки в коде или настройках среды.
- Оценка: Сопоставляет полученные экспериментальные данные с исходными утверждениями авторов.
Результаты и метрики
Команда протестировала VERITAS на наборах данных CORE-Bench и ReplicationBench, охватывающих 65 статей из компьютерных наук, социальных наук, медицины и астрофизики. Инструмент сравнивался с сильными базовыми моделями Claude Code, работающими в той же среде. VERITAS показал state-of-the-art результаты, лидируя по всем метрикам.
Ключевые выходные данные системы включают:
- Replication Score: Взвешенный по значимости балл репликации.
- Severity-rated log: Журнал всех примененных исправлений с оценкой их серьезности.
- Patched codebase: Исправленная версия кода, готовая к использованию.
| Метрика / Характеристика | VERITAS | Claude Code (Baseline) |
|---|---|---|
| Общий подход | Универсальный фреймворк с CLI-агентами | Базовая модель в той же среде |
| Охват дисциплин | CS, социальные науки, медицина, астрофизика | Информация недостаточна |
| Количество тестовых статей | 65 (CORE-Bench + ReplicationBench) | 65 |
| Результат сравнения | State-of-the-art, лидер по всем метрикам | Уступает VERITAS |
Почему это важно
VERITAS закрывает критический пробел в научном сообществе, предлагая не просто бенчмарк, а рабочий инструмент для независимой проверки. Автоматизация процесса исправления кода и верификации утверждений позволяет снизить барьер для воспроизводимости исследований, что особенно актуально в условиях роста публикаций, сгенерированных или ускоренных с помощью ИИ.
Источник: arXiv cs.AI ↗
