Масштаб индекса и доступность
По состоянию на 7 сентября 2026 года база данных Scry.io достигла объема в 500 ТБ в несжатом виде. Платформа позволяет AI-агентам, поддерживающим Model Context Protocol (MCP), выполнять сложные запросы на SQL и Datalog. Это превращает разрозненные интернет-данные в единый, программируемый источник истины для агентов.
Структура данных: что именно доступно
Разработчик Xyra Sinclair акцентирует внимание на «суперкластере» технологических, академических и финансовых данных. Индекс охватывает критически важные источники, необходимые для глубокого анализа:
- Академическая среда: 90 миллионов полнотекстовых научных статей с графом цитирования OpenAlex.
- Финансовая отчетность: 59 миллионов документов SEC (комиссия по ценным бумагам и биржам США).
- Социальные сети: Более 94% контента Reddit, а также форумы, блоги и рассылки в технологическом и финансовом секторах.
- Медиа и прогнозы: Миллиарды транскрипций видео и данные с крупнейших предсказательных рынков.
Технические детали и эмбеддинги
Для эффективной работы с данными используется семейство эмбеддингов Voyage-4 (2048-мерные, формат f16). Платформа предоставляет операторы, позволяющие агентам использовать композиционные свойства векторов для поиска смысловых связей. Через MCP агенты получают не только результаты запросов, но и метаданные о источниках и их актуальности (freshness).
Значение для индустрии
Обновление Scry.io закрывает одну из главных проблем AI-агентов — доступ к качественным, структурированным данным. Предоставление прямого SQL/Datalog-доступа к такому массиву информации позволяет создавать автономные системы, способные проводить глубокий аналитический поиск без необходимости ручного сбора данных.
Источник: LessWrong ↗
