AIKraft/Skills/TAO генерация grounding изображений

TAO генерация grounding изображений

Two-step image grounding pipeline: extracts referring expressions from (image, caption) pairs and grounds them to pixel-space bounding boxes via a VLM. Use when the user wants to ground captions to bboxes, generate phrase-grounded annotations, auto-label images for grounding, or run the image_grounding pipeline. Triggers include 'image grounding', 'phrase grounding', 'ground captions', 'auto-label

nvidia official Дизайн

Что делает навык

Двухэтапный конвейер для создания аннотаций с привязкой фраз к изображениям (image grounding). Он преобразует пары (изображение, подпись) в очищенные тексты, реферирующие выражения с указанием символьных интервалов и пиксельные bounding box, используя одну VLM (Gemini или OpenAI-compatible) в качестве учителя.

Когда применять

  • Генерация тренировочных данных для моделей referring-expression и grounding.
  • Автоматическая разметка изображений для задач image grounding.
  • Привязка текстовых подписей к конкретным областям на изображении (bbox).
  • Генерация аннотаций с grounding по фразам из исходных описаний.

Как работает

  1. Запустить навык tao-setup, если сессия не инициализирована плагином TAO skill bank.
  2. Шаг 0: VLM очищает подпись, извлекает реферирующие выражения и их символьные интервалы (char spans), анализируя изображение.
  3. Шаг 1: VLM возвращает набор пиксельных bounding box и оценки (scores) для каждого выражения.
  4. Результаты сохраняются в чекпоинты step_<N>_*/.ckpt/<sample_id>.json; при повторном запуске уже обработанные записи пропускаются.
  5. Настроить параметры workflow.steps для выбора этапов и workflow.force_reprocess: true для принудительной переработки.

Примеры запросов агенту

Запусти image grounding для этой папки с картинками и подписями.
Сгенерируй аннотации с grounding по фразам из этих данных.
Выполни auto-label для разметки изображений через phrase grounding.

Что понадобится

  • Инициализация через плагин TAO skill bank или ручной запуск tao-setup (хост, учетные данные, discovery).
  • Доступ к VLM: Gemini или любой endpoint, совместимый с OpenAI.

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «tao-generate-image-grounding» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r tao-generate-image-grounding/ ~/.claude/skills/tao-generate-image-grounding/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.