Инструменты1 сентября 2026 г., 03:17 МСК🤖 Auto

Keenable AI выпустил NEEDLE: живой бенчмарк поиска, обновляемый каждый час

Keenable AI представила NEEDLE — первый открытый бенчмарк для оценки веб-поиска, который динамически генерирует запросы из реальных источников, исключая возможность «зазубривания» ответов моделями.

Баннер новости 6458

Проблема статических датасетов

Традиционные бенчмарки для веб-поиска (RAG и агентов) страдают от одной критической уязвимости: если ответы хранятся в публичных датасетах, поисковый агент может просто скачать их, минуя реальное извлечение информации. Кроме того, модели могут опираться на параметрическую память, а не на актуальный поиск. Keenable AI решает эту проблему с помощью NEEDLE (News, Everyday, Expert, Deep-tail, and Legal Evaluation) — живого фреймворка, который пересобирает набор запросов каждые несколько часов.

Архитектура и источники данных

NEEDLE не использует фиксированный набор вопросов. Вместо этого он генерирует запросы из свежих публичных источников, что делает невозможным переобучение (overfitting) на тестовых данных. Система охватывает пять вертикалей:

  • News: Запросы генерируются ежечасно на основе RSS-лент и Google Trends.
  • Finance: Данные из Wikidata, GLEIF и отчетов SEC XBRL (формат 10-Q).
  • Scholar: Научные статьи из arXiv, Europe PMC с трансформацией заголовков в 4 типа запросов.
  • Deep-tail: Редкие сущности из логов агентов (DeepResearchGym, OpenResearcher, LRAT).
  • Legal: Решения федеральных судов США (CourtListener) и eCFR.

Метрика «Ultimate Ceiling»

Ключевое отличие NEEDLE — использование ultimate (пулового оракульного движка). Результаты всех 15 протестированных API объединяются, ранжируются по релевантности и формируют «потолок» качества. Разница между результатом конкретного API и этим потолком показывает, является ли проблема в плохом ранжировании (engine failed to surface) или в отсутствии информации в сети в целом (retrieval problem).

Результаты тестирования (окно до 28.08.2026)

Тестирование проводилось в условиях изоляции: один запрос в секунду, без параллельных нагрузок, с ограничением контекста в 2000 символов. Ниже приведены средние значения за 7 дней для ключевых метрик.

Вертикаль Метрика Лидер (Exa) Keenable Google Ultimate Ceiling
Finance Answer-Recall@5 0.910 0.872 0.847 0.965
Scholar Identifier Match 0.774 0.869
Deep-tail nDCG@5 (до потолка) 0.557 0.470 0.199 1.000 (база)

Особое внимание стоит уделить задержке (latency), критичной для агентов. Keenable-realtime показал медианную задержку 193 мс (p50) и 284 мс (p95), тогда как Exa — 1876 мс, а Bing — 2767 мс (p50).

Открытый доступ и запуск

NEEDLE распространяется под лицензией MIT. Фреймворк представляет собой Python CLI, устанавливаемую через uv sync. Для запуска требуется ключ OpenRouter для судейства (LLM Judge) и API-ключи тестируемых движков. Артефакты каждого запуска публикуются в Hugging Face, а код доступен на GitHub, что позволяет воспроизводить результаты в CI/CD пайплайнах.

Источник: MarkTechPost ↗