AIKraft/Skills/Сводка происхождения данных

Сводка происхождения данных

Summarizes Google Cloud Data Lineage graphs to help users debug data quality issues and understand data provenance for BQ/GCS. Use when summarizing upstream and downstream data flows, and presenting complex lineage data as an intuitive Markdown report. Don't use for generic BigQuery queries, editing lineage relationships, or downstream deprecation. Don't use for downstream blast-radius impact anal

GOGoogle official Документы

Что делает навык

Навык исследует и суммирует графы происхождения данных (Data Lineage) для конкретных таблиц или столбцов, предоставляя понятное описание потоков данных слева направо. Он помогает отлаживать проблемы качества данных и понимать происхождение данных в BigQuery и GCS, абстрагируясь от сложных технических деталей узлов и связей.

Когда применять

  • Суммирование восходящих (upstream) и нисходящих (downstream) потоков данных для конкретного актива.
  • Представление сложных графов происхождения данных в виде наглядного Markdown-отчёта.
  • Анализ происхождения данных на уровне столбцов (Column-Level Lineage) для конкретных полей.
  • Исследование происхождения данных на уровне таблиц (Table-Level Lineage) с учётом связанных столбцов.

Как работает

  1. Использовать инструмент read_url для получения актуального списка регионов (locations) из Knowledge Catalog Locations.
  2. Выполнить два вызова MCP-инструмента search_lineage: один с direction 'UPSTREAM', другой с 'DOWNSTREAM', используя параметры maxDepth=10, maxResults=5000, maxProcessPerLink=10.
  3. Для анализа на уровне столбцов (CLL) настроить поле field в rootCriteria: использовать '*' для всех столбцов таблицы или указать конкретное имя столбца.
  4. Сгенерировать сводку в формате Markdown, начиная с общего типа потока и систем, затем детализируя Upstream и Downstream lineage.
  5. Включить в отчёт метаданные запроса (поиск по регионам, родительский путь, лимиты глубины и процессов) и совет пользователю.
  6. Соблюдать ограничения детализации: явно перечислять активы, если их меньше 5, иначе агрегировать по количеству; не повторять имена проектов избыточно.

Примеры запросов агенту

Проанализируй происхождение данных для таблицы bigquery:project.dataset.table и покажи восходящие и нисходящие потоки.
Сведи граф lineage для столбца efficiency_score в таблице bigquery:project.dataset.table.
Объясни, как данные попадают в таблицу bigquery:project.dataset.table и откуда они уходят дальше, используя данные Knowledge Catalog.

Что понадобится

  • Google Cloud Data Lineage (Knowledge Catalog) MCP Server
  • Доступ к инструменту search_lineage с возможностью запросов в направлениях UPSTREAM и DOWNSTREAM
  • Доступ к инструменту read_url для получения списка регионов Knowledge Catalog

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «datalineage-summary» из репозитория: # https://github.com/google/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r datalineage-summary/ ~/.claude/skills/datalineage-summary/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.