Проблема: разброс оценок достигает 30%
Оценка соответствия геоданных принципам FAIR (Findability, Accessibility, Interoperability, Reusability) сталкивается с серьезными проблемами. Существующие инструменты используют разные рубрики и источники доказательств, часто терпят неудачу на страницах с JavaScript или не распознают специфические идентификаторы репозиториев. На выборке из 50 датасетов из 10 репозиториев стандартное отклонение нормированных оценок между различными инструментами в среднем составляет 15,0 процентных пунктов, а для одного датасета достигает 30,3%.
Решение: 13 специализированных агентов и критик
Команда разработала AgentFAIR — многоагентную систему, сочетающую извлечение структурированных метаданных с 13 LLM-оценщиками, каждый из которых отвечает за конкретный субпринцип FAIR. Архитектура включает «критика» (critic), который проверяет доказательства и согласованность, запрашивая целевую переоценку при необходимости. Каждый агент выдает оценку зрелости от 0 до 3, цитируемые доказательства и рекомендации.
Результаты: высокая согласованность и низкая стоимость
Система демонстрирует высокую внутреннюю согласованность. На подмножестве из 10 датасетов, оцененных повторно, среднее согласие субпринципов составляет 89% (стандартное отклонение: 3 процентных пункта), по сравнению с 71% без использования критика. Предварительное исследование с участием экспертов показало коэффициент Каппы Флейсса 0,71 и 82% совпадения с экспертным консенсусом. Стоимость API составляет около $0,054 на датасет.
| Метрика | Значение | Примечание |
|---|---|---|
| Средний балл Findability | 79,7% | Найдимость |
| Средний балл Accessibility | 70,4% | Доступность |
| Средний балл Interoperability | 45,3% | Взаимодействие |
| Средний балл Reusability | 72,0% | Повторное использование |
| Согласие субпринципов (с критиком) | 89% | SD: 3 п.п. |
| Согласие субпринципов (без критика) | 71% | Базовый уровень |
| Стоимость API | $0,054 | На один датасет |
Ограничения и значимость
Ранговые корреляции с четырьмя базовыми инструментами варьируются от 0,31 до 0,61, а сравнение с FAIR-enough не является статистически значимым. Авторы отмечают, что результаты поддерживают проверяемость (auditability) и осуществимость подхода, но ограниченный бенчмарк, неполные абляции и валидация на одном семействе моделей сужают утверждения об точности и обобщаемости. Тем не менее, система предлагает новый стандарт для аудита геоданных.
Источник: arXiv cs.AI ↗
