AIKraft/Skills/TileGym: конвертация cuTile в Triton

TileGym: конвертация cuTile в Triton

Converts cuTile GPU kernels (@ct.kernel) to Triton (@triton.jit). Handles standard in-repo conversion, debugging (cudaErrorIllegalAddress, shape mismatch, numerical mismatch), and mapping cuTile idioms (ct.load/ct.store, ct.Constant, ct.launch) to Triton equivalents. Covers dual-kernel layout flags (e.g. transpose=True/False + autotune grid via META) per translations/advanced-patterns.md. Use when

nvidia official Разработка

Что делает навык

Навык конвертирует GPU-ядра cuTile (@ct.kernel) в эквивалент Triton (@triton.jit), обеспечивая маппинг API, отладку ошибок и поддержку продвинутых паттернов. Он решает задачу миграции существующих оптимизированных ядер с сохранением производительности и корректности вычислений.

Когда применять

  • Стандартная конвертация существующих ядер TileGym из cuTile в Triton.
  • Обработка ядер с двойной раскладкой (transpose/transpose_v, MLA-style), требующих создания двух ядер и META-сетки.
  • Оптимизация чувствительных к производительности операций, таких как attention, FMHA, sliding window, soft cap или GQA.
  • Отладка runtime-ошибок, таких как cudaErrorIllegalAddress, несовпадение размерностей или числовые расхождения.

Как работает

  1. Выполнить pre-flight анализ cuTile-источника (подсчет @ct.kernel, поиск TMA-операций ct.load/ct.store, ct.launch, Constant и флагов layout).
  2. Изучить references/api-mapping.md для маппинга API и, при необходимости, references/debugging.md для устранения ошибок.
  3. Выбрать путь конвертации: стандартный режим или advanced-patterns.md для ядер с dual layouts.
  4. При работе с attention/FMHA/GQA применить optimization-strategy.md и Gemma FMHA checklist перед конвертацией внутреннего цикла.
  5. Выполнить конвертацию, используя tl.make_tensor_descriptor (TMA) для 2D+ блоков и синтаксис запуска kernel[grid](args) с autotune META.
  6. Пройти фазы validate, test и benchmark согласно workflow.md.

Примеры запросов агенту

Конвертируй ядро gemma_attention из cuTile в Triton, применив стратегию оптимизации для FMHA.
Переведи стандартное ядро TileGEMM из @ct.kernel в @triton.jit, используя TMA для загрузки блоков.
Исправь ошибку cudaErrorIllegalAddress в конвертированном ядре Triton, следуя инструкциям из debugging.md.

Что понадобится

  • Доступ к репозиторию https://github.com/nvidia/skills и файлам SKILL.md, translations/, references/.
  • Среда выполнения Triton и CUDA для тестирования и бенчмарков.
  • Знание синтаксиса cuTile (@ct.kernel) и Triton (@triton.jit).

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «tilegym-converting-cutile-to-triton» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r tilegym-converting-cutile-to-triton/ ~/.claude/skills/tilegym-converting-cutile-to-triton/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.