databendlabs/databend

Data Agent Ready Warehouse: единое решение для аналитики, поиска, AI и Python Sandbox. Построено с нуля. Единая архитектура на базе S3.

Данные⭐ 9 447Rustпоследний релиз: v1.2.881
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Databend — это open-source хранилище данных на Rust, объединяющее аналитику, полнотекстовый и векторный поиск в единой архитектуре с поддержкой облачных хранилищ S3.

Зачем нужен

Инструмент решает задачу создания единой платформы для AI-агентов и аналитики, позволяя запускать изолированные Python-скрипты (Sandbox UDF) прямо внутри SQL-запросов. Это обеспечивает безопасное выполнение логики агентов, оркестрацию через SQL и работу с данными без необходимости выносить вычисления за пределы хранилища.

Что можно реализовать

  • Создание AI-агентов с изолированной средой выполнения (Sandbox UDF) для вызова LLM и использования инструментов
  • Оркестрация логики агентов с использованием SQL-запросов
  • Построение систем RAG с поддержкой векторного и полнотекстового поиска
  • Масштабируемая SQL-аналитика больших данных с эластичным вычислительным кластером
  • Безопасное экспериментирование с данными с помощью ветвления (branching), похожего на Git

Ключевые возможности

  • Sandbox UDF: возможность писать логику агентов на Python и выполнять её в изолированном окружении
  • Единый движок: аналитика, векторный поиск и полнотекстовый поиск в одной системе
  • Data Branching: ветвление данных для безопасной работы агентов с снимками (snapshots) продакшн-данных
  • Cloud-native архитектура: разделение хранения и вычислений, поддержка S3, Azure, GCS
  • Open-source лицензия (Apache 2.0 / Elastic 2.0) и кроссплатформенность (Linux, macOS, ARM)

👤 Кому подойдёт: Data-инженеры, разработчики AI-агентов и аналитики, ищущие единое решение для хранения, поиска и выполнения логики агентов без сложной инфраструктуры.

Релизы

v1.2.881minor
🕐 5 мес назад · релиз на GitHub ↗

Поддержка Iceberg (ORC, кэш, партиции), управление нагрузкой, виртуальные колонки, NgramIndex и загрузка из AVRO.

  • Added: Расширенная поддержка Iceberg: создание таблиц с партициями, кэширование данных, чтение из ORC и удаление позиций при merge-on-read.
  • Added: Управление рабочей нагрузкой (workload groups): атомарное управление метаданными, квотами и контроль ресурсов через SQL и HTTP-хендлер.
  • Added: Оптимизация и производительность: NgramIndex для LIKE-запросов, декорреляция подзапросов в JOIN, виртуальные колонки и асинхронный merge.
  • Added: Новые возможности: загрузка данных из AVRO, сохранение порядка при выгрузке, расширенные типы Variant (Decimal, Binary, Date и др.).
  • Added: Улучшения мета-сервиса: генерация семфоров по временным меткам для снижения конфликтов, кэширование владения и флаги инициализации.