Инструменты10 сентября 2026 г., 00:17 МСК🤖 Auto

Scry.io: 500 ТБ интернета для AI-агентов через MCP

Scry.io представил обновленную платформу для программных интернет-исследований, предоставляя AI-агентам доступ к 500 ТБ структурированных данных через протокол MCP.

Баннер новости 7119

Масштаб индекса и доступность

По состоянию на 7 сентября 2026 года база данных Scry.io достигла объема в 500 ТБ в несжатом виде. Платформа позволяет AI-агентам, поддерживающим Model Context Protocol (MCP), выполнять сложные запросы на SQL и Datalog. Это превращает разрозненные интернет-данные в единый, программируемый источник истины для агентов.

Структура данных: что именно доступно

Разработчик Xyra Sinclair акцентирует внимание на «суперкластере» технологических, академических и финансовых данных. Индекс охватывает критически важные источники, необходимые для глубокого анализа:

  • Академическая среда: 90 миллионов полнотекстовых научных статей с графом цитирования OpenAlex.
  • Финансовая отчетность: 59 миллионов документов SEC (комиссия по ценным бумагам и биржам США).
  • Социальные сети: Более 94% контента Reddit, а также форумы, блоги и рассылки в технологическом и финансовом секторах.
  • Медиа и прогнозы: Миллиарды транскрипций видео и данные с крупнейших предсказательных рынков.

Технические детали и эмбеддинги

Для эффективной работы с данными используется семейство эмбеддингов Voyage-4 (2048-мерные, формат f16). Платформа предоставляет операторы, позволяющие агентам использовать композиционные свойства векторов для поиска смысловых связей. Через MCP агенты получают не только результаты запросов, но и метаданные о источниках и их актуальности (freshness).

Значение для индустрии

Обновление Scry.io закрывает одну из главных проблем AI-агентов — доступ к качественным, структурированным данным. Предоставление прямого SQL/Datalog-доступа к такому массиву информации позволяет создавать автономные системы, способные проводить глубокий аналитический поиск без необходимости ручного сбора данных.

Источник: LessWrong ↗