Проблема оценки качества AI-науки
Автономные системы, способные проводить исследования без участия человека, ускоряют научные открытия, но отсутствие единого стандарта оценки их результатов тормозит развитие области. Исследователи Vaibhava Lakshmi Ravideshik и Mayank Kejriwal из компании FARS предложили решение: автоматизированную систему многомодельной рецензии (Automated Multi-Model Review), которая оценивает статьи по четырем ключевым параметрам: оригинальность, научная строгость, ясность изложения и значимость.
Методология: 60 статей и 3 рецензента
Для тестирования был выбран набор из 15 исследовательских предложений. На их основе были сгенерированы статьи четырьмя ведущими фреймворками: Sakana AI (v1 & v2), CycleResearcher и Data-to-Paper. Всего было создано 60 статей, которые оценивались вместе с 15 эталонными статьями от самой компании FARS. В качестве независимых экспертов выступили три передовые языковые модели: GPT-5.4, Google Gemini и Anthropic Claude.
Результаты: Явное лидерство FARS
Результаты тестирования выявили существенный разрыв между системой FARS и её конкурентами. Эталонные статьи FARS получили средние баллы в диапазоне 2.14–2.47 по 5-балльной шкале, тогда как другие системы набрали лишь 1.00–1.87. Особенно заметна разница при оценке моделями Gemini и Claude, где показатели FARS превышают результаты конкурентов более чем в два раза.
| Система / Модель | Средний балл (1-5) | Ключевая метрика |
|---|---|---|
| FARS (Benchmark) | 2.14 – 2.47 | Лидер по всем параметрам |
| Sakana AI / CycleResearcher / Data-to-Paper | 1.00 – 1.87 | Значительно уступают лидеру |
| Согласие Gemini и Claude | ρ = 0.907 | Высокая надежность оценки |
| Согласие с синтезом (Gemini/Claude) | ρ = 0.961 | Корреляция с качеством |
| Согласие GPT-5.4 с другими | ρ ≈ 0.32 | Иные критерии оценки |
Валидация метода и расхождения моделей
Исследование подтвердило, что автоматизированная оценка надежна: модели Gemini и Claude демонстрируют сильное согласие (ρ = 0.907) и высокую корреляцию с итоговым синтезом качества (ρ = 0.961). Однако модель GPT-5.4 показала слабое согласие с остальными (ρ ≈ 0.32), что указывает на использование иных критериев при оценке научной ценности текстов. Это открытие подчеркивает важность использования мульти-модельного подхода для объективного бенчмаркинга.
Значение для индустрии
Работа устанавливает первый количественный бенчмарк для систем AI Scientist. Доказано, что автоматизированная рецензия с использованием нескольких топовых LLM является масштабируемым и последовательным инструментом для оценки качества автономных научных публикаций, что критически важно для доверия к AI-генерируемой науке.
Источник: arXiv cs.AI ↗
