Инструменты17 сентября 2026 г., 19:20 МСК🤖 Auto

DuckLake: Открытый движок для Lakehouse-архитектуры на базе DuckDB

Команда DuckDB представила DuckLake — открытый движок, позволяющий объединять локальные файлы Parquet с облачными данными в единую аналитическую модель без перемещения данных.

Баннер новости 7726

Решение проблемы разрозненных данных

Разработка современных аналитических систем часто сталкивается с проблемой разделения данных: часть хранится локально в форматах вроде Parquet, а часть — в облачных хранилищах. Традиционные решения требуют сложной оркестрации или перемещения данных. DuckLake предлагает альтернативу, интегрируясь с экосистемой DuckDB и позволяя выполнять JOIN-операции между локальными файлами и облачными источниками в реальном времени.

Ключевые технические характеристики

DuckLake позиционируется как открытый движок (open-source engine), который абстрагирует сложность работы с распределенными данными. Архитектура позволяет:

  • Использовать локальные файлы Parquet как часть запроса.
  • Подключаться к облачным хранилищам (S3, GCS, Azure Blob) без предварительной загрузки.
  • Выполнять сложные аналитические запросы, объединяющие эти источники, используя оптимизатор DuckDB.

Преимущества для Data Engineers

Подход «Lakehouse» с использованием DuckLake снижает операционные издержки. Инженерам данных не нужно поддерживать сложные конвейеры ETL для синхронизации локальных и облачных данных перед аналитикой. Запросы выполняются напрямую к источникам, что ускоряет получение инсайтов и упрощает архитектуру хранения.

Статус проекта

На данный момент DuckLake представлен как новая инициатива от создателей DuckDB. Проект направлен на демократизацию доступа к мощной аналитике поверх больших объемов данных, хранящихся в гибридных средах. Разработчикам рекомендуется следить за обновлениями репозитория для получения инструкций по интеграции.

Источник: Towards Data Science ↗