TileGym: конвертация cuTile в Triton
Converts cuTile GPU kernels (@ct.kernel) to Triton (@triton.jit). Handles standard in-repo conversion, debugging (cudaErrorIllegalAddress, shape mismatch, numerical mismatch), and mapping cuTile idioms (ct.load/ct.store, ct.Constant, ct.launch) to Triton equivalents. Covers dual-kernel layout flags (e.g. transpose=True/False + autotune grid via META) per translations/advanced-patterns.md. Use when
Что делает навык
Навык конвертирует GPU-ядра cuTile (@ct.kernel) в эквивалент Triton (@triton.jit), обеспечивая маппинг API, отладку ошибок и поддержку продвинутых паттернов. Он решает задачу миграции существующих оптимизированных ядер с сохранением производительности и корректности вычислений.
Когда применять
- Стандартная конвертация существующих ядер TileGym из cuTile в Triton.
- Обработка ядер с двойной раскладкой (transpose/transpose_v, MLA-style), требующих создания двух ядер и META-сетки.
- Оптимизация чувствительных к производительности операций, таких как attention, FMHA, sliding window, soft cap или GQA.
- Отладка runtime-ошибок, таких как cudaErrorIllegalAddress, несовпадение размерностей или числовые расхождения.
Как работает
- Выполнить pre-flight анализ cuTile-источника (подсчет @ct.kernel, поиск TMA-операций ct.load/ct.store, ct.launch, Constant и флагов layout).
- Изучить references/api-mapping.md для маппинга API и, при необходимости, references/debugging.md для устранения ошибок.
- Выбрать путь конвертации: стандартный режим или advanced-patterns.md для ядер с dual layouts.
- При работе с attention/FMHA/GQA применить optimization-strategy.md и Gemma FMHA checklist перед конвертацией внутреннего цикла.
- Выполнить конвертацию, используя tl.make_tensor_descriptor (TMA) для 2D+ блоков и синтаксис запуска kernel[grid](args) с autotune META.
- Пройти фазы validate, test и benchmark согласно workflow.md.
Примеры запросов агенту
Что понадобится
- Доступ к репозиторию https://github.com/nvidia/skills и файлам SKILL.md, translations/, references/.
- Среда выполнения Triton и CUDA для тестирования и бенчмарков.
- Знание синтаксиса cuTile (@ct.kernel) и Triton (@triton.jit).
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
SKILL.md к навыкам ассистентаНавык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.