apache/seatunnel

SeaTunnel — это мультимодальный, высокопроизводительный распределенный инструмент для интеграции больших данных.

Данные⭐ 9 661Javaпоследний релиз: 2.3.13
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SeaTunnel — это распределенный инструмент высокой производительности для интеграции данных, поддерживающий синхронизацию огромных объемов информации ежедневно.

Зачем нужен

Инструмент решает задачи разнородной интеграции данных, объединяя структурированные, неструктурированные текстовые данные, видео, изображения и бинарные файлы. Он полезен для настройки сложных сценариев синхронизации (в реальном времени, CDC, полная выгрузка) с минимальным потреблением ресурсов и гарантией отсутствия потерь или дубликатов данных.

Что можно реализовать

  • Синхронизация данных между сотнями различных источников и приемников в реальном времени
  • Интеграция мультимедийных данных (видео, изображения, бинарные файлы) вместе с текстовыми данными
  • Полная и инкрементальная синхронизация баз данных с использованием CDC
  • Объединение пакетной (batch) и потоковой (stream) обработки в едином конвейере
  • Мониторинг качества данных и предотвращение дублирования при массовых переносах

Ключевые возможности

  • Поддержка более 160 коннекторов для разнообразных источников и приемников
  • Работа на нескольких движках: SeaTunnel Zeta, Flink и Spark
  • Распределенный алгоритм снимков (snapshot) для обеспечения согласованности данных
  • JDBC-мультиплексирование и парсинг логов для эффективной синхронизации множества таблиц
  • Встроенные средства мониторинга и контроля качества данных

👤 Кому подойдёт: инженеры по данным, архитекторы ETL/ELT, разработчики, управляющие большими объемами разнородных данных

Релизы

2.3.13minor
🕐 6 мес назад · релиз на GitHub ↗

Релиз SeaTunnel 2.3.13: поддержка Flink 1.20.1, новые коннекторы (DuckDB, AWS DSQL, IoTDB 2.X), оптимизация чтения больших файлов и улучшенные метрики.

  • Added: Добавлена поддержка Flink 1.20.1 и эволюция схемы CDC в Flink-движке.
  • Added: Появились новые коннекторы: DuckDB (источник/приемник), AWS DSQL, IoTDB 2.X, Lance и HugeGraph.
  • Added: Реализован параллельный чтение больших файлов (CSV, JSON, Parquet) и поддержка ViewFs в HDFS.
  • Added: Добавлены новые трансформации: мультимодальные эмбеддинги и RegexExtract, а также API для управления чекпоинтами.
  • Fixed: Исправлены ошибки в Redis Cluster, чтение первой колонки CSV и улучшена обработка метрик задач.