Проблема статических датасетов
Традиционные бенчмарки для веб-поиска (RAG и агентов) страдают от одной критической уязвимости: если ответы хранятся в публичных датасетах, поисковый агент может просто скачать их, минуя реальное извлечение информации. Кроме того, модели могут опираться на параметрическую память, а не на актуальный поиск. Keenable AI решает эту проблему с помощью NEEDLE (News, Everyday, Expert, Deep-tail, and Legal Evaluation) — живого фреймворка, который пересобирает набор запросов каждые несколько часов.
Архитектура и источники данных
NEEDLE не использует фиксированный набор вопросов. Вместо этого он генерирует запросы из свежих публичных источников, что делает невозможным переобучение (overfitting) на тестовых данных. Система охватывает пять вертикалей:
- News: Запросы генерируются ежечасно на основе RSS-лент и Google Trends.
- Finance: Данные из Wikidata, GLEIF и отчетов SEC XBRL (формат 10-Q).
- Scholar: Научные статьи из arXiv, Europe PMC с трансформацией заголовков в 4 типа запросов.
- Deep-tail: Редкие сущности из логов агентов (DeepResearchGym, OpenResearcher, LRAT).
- Legal: Решения федеральных судов США (CourtListener) и eCFR.
Метрика «Ultimate Ceiling»
Ключевое отличие NEEDLE — использование ultimate (пулового оракульного движка). Результаты всех 15 протестированных API объединяются, ранжируются по релевантности и формируют «потолок» качества. Разница между результатом конкретного API и этим потолком показывает, является ли проблема в плохом ранжировании (engine failed to surface) или в отсутствии информации в сети в целом (retrieval problem).
Результаты тестирования (окно до 28.08.2026)
Тестирование проводилось в условиях изоляции: один запрос в секунду, без параллельных нагрузок, с ограничением контекста в 2000 символов. Ниже приведены средние значения за 7 дней для ключевых метрик.
| Вертикаль | Метрика | Лидер (Exa) | Keenable | Ultimate Ceiling | |
|---|---|---|---|---|---|
| Finance | Answer-Recall@5 | 0.910 | 0.872 | 0.847 | 0.965 |
| Scholar | Identifier Match | — | 0.774 | — | 0.869 |
| Deep-tail | nDCG@5 (до потолка) | 0.557 | 0.470 | 0.199 | 1.000 (база) |
Особое внимание стоит уделить задержке (latency), критичной для агентов. Keenable-realtime показал медианную задержку 193 мс (p50) и 284 мс (p95), тогда как Exa — 1876 мс, а Bing — 2767 мс (p50).
Открытый доступ и запуск
NEEDLE распространяется под лицензией MIT. Фреймворк представляет собой Python CLI, устанавливаемую через uv sync. Для запуска требуется ключ OpenRouter для судейства (LLM Judge) и API-ключи тестируемых движков. Артефакты каждого запуска публикуются в Hugging Face, а код доступен на GitHub, что позволяет воспроизводить результаты в CI/CD пайплайнах.
Источник: MarkTechPost ↗
