Исследования3 августа 2026 г., 07:17 МСК🤖 Auto

AI Scientist Benchmark: FARS vs Sakana, CycleResearcher, Data-to-Paper

Первое масштабное сравнение автономных AI-ученых показало, что система FARS генерирует статьи в 2 раза качественнее конкурентов. Исследование ввело новый стандарт оценки через автоматизированную рецензию тремя топовыми LLM.

Баннер новости 4925

Проблема оценки качества AI-науки

Автономные системы, способные проводить исследования без участия человека, ускоряют научные открытия, но отсутствие единого стандарта оценки их результатов тормозит развитие области. Исследователи Vaibhava Lakshmi Ravideshik и Mayank Kejriwal из компании FARS предложили решение: автоматизированную систему многомодельной рецензии (Automated Multi-Model Review), которая оценивает статьи по четырем ключевым параметрам: оригинальность, научная строгость, ясность изложения и значимость.

Методология: 60 статей и 3 рецензента

Для тестирования был выбран набор из 15 исследовательских предложений. На их основе были сгенерированы статьи четырьмя ведущими фреймворками: Sakana AI (v1 & v2), CycleResearcher и Data-to-Paper. Всего было создано 60 статей, которые оценивались вместе с 15 эталонными статьями от самой компании FARS. В качестве независимых экспертов выступили три передовые языковые модели: GPT-5.4, Google Gemini и Anthropic Claude.

Результаты: Явное лидерство FARS

Результаты тестирования выявили существенный разрыв между системой FARS и её конкурентами. Эталонные статьи FARS получили средние баллы в диапазоне 2.14–2.47 по 5-балльной шкале, тогда как другие системы набрали лишь 1.00–1.87. Особенно заметна разница при оценке моделями Gemini и Claude, где показатели FARS превышают результаты конкурентов более чем в два раза.

Система / Модель Средний балл (1-5) Ключевая метрика
FARS (Benchmark) 2.14 – 2.47 Лидер по всем параметрам
Sakana AI / CycleResearcher / Data-to-Paper 1.00 – 1.87 Значительно уступают лидеру
Согласие Gemini и Claude ρ = 0.907 Высокая надежность оценки
Согласие с синтезом (Gemini/Claude) ρ = 0.961 Корреляция с качеством
Согласие GPT-5.4 с другими ρ ≈ 0.32 Иные критерии оценки

Валидация метода и расхождения моделей

Исследование подтвердило, что автоматизированная оценка надежна: модели Gemini и Claude демонстрируют сильное согласие (ρ = 0.907) и высокую корреляцию с итоговым синтезом качества (ρ = 0.961). Однако модель GPT-5.4 показала слабое согласие с остальными (ρ ≈ 0.32), что указывает на использование иных критериев при оценке научной ценности текстов. Это открытие подчеркивает важность использования мульти-модельного подхода для объективного бенчмаркинга.

Значение для индустрии

Работа устанавливает первый количественный бенчмарк для систем AI Scientist. Доказано, что автоматизированная рецензия с использованием нескольких топовых LLM является масштабируемым и последовательным инструментом для оценки качества автономных научных публикаций, что критически важно для доверия к AI-генерируемой науке.

Источник: arXiv cs.AI ↗