Прорыв в оптимизации AMD GPU
Команда AMD представила AMDKernelVault — масштабный открытый корпус данных и фреймворк обучения для оптимизации ядер на GPU архитектуры CDNA. В отличие от существующих решений, сфокусированных на CUDA/NVIDIA, AMDKernelVault закрывает критический пробел в экосистеме ROCm, предлагая инструменты для агентной генерации кода на HIP и Triton.
Масштаб датасета: более 100 тысяч проверенных примеров
Ключевая ценность проекта — в объеме и качестве данных. Датасет включает более 100 тысяч образцов, прошедших проверку на выполнение, что позволяет обучать модели без необходимости бесконечных вызовов фронтенд-LLM для рефлексии. Структура данных выглядит следующим образом:
| Компонент датасета | Количество образцов | Описание |
|---|---|---|
| HIP Kernel Samples | 62,153 | Выполняемые образцы HIP-ядер |
| Triton Kernels | 39,893 | Ядра на языке Triton |
| ROCm Libraries QA | 2,377 | Записи из производственной среды ROCm |
Результаты обучения Qwen3-8B
Для демонстрации полезности датасета команда провела дообучение модели Qwen3-8B с использованием контролируемого обучения (SFT) и обучения с подкреплением, учитывающего выполнение кода (execution-aware RL). Модель показала выдающиеся результаты в сравнении с другими LLM-агентами при фиксированных вычислительных бюджетах:
| Бенчмарк | Метрика | Результат Qwen3-8B |
|---|---|---|
| PyTorch-to-HIP | Pass@1 (Correctness) | 34.0% |
| TritonBench-G | Corr@3 (Correctness) | 33.2% |
| ROCmBench | Corr@3 (Correctness) | 41.94% |
Важно отметить: модель лидирует по метрикам корректности (correctness), но не всегда выигрывает в метриках компиляции или скорости выполнения, что указывает на направление для дальнейших оптимизаций.
Почему это важно?
AMDKernelVault вводит новые стандарты для агентной оптимизации GPU. Пайплайны HIPKernelGen и TritonKernelGen автоматически преобразуют референсные PyTorch-коды в оптимизированные HIP/Triton ядра, компилируют их в среде ROCm и профилируют задержки на реальном железе AMD. Это снижает порог входа для разработчиков, желающих максимизировать производительность на GPU CDNA, используя AI-ассистентов.
Код и документация проекта доступны в открытом доступе, что позволяет исследователям и инженерам сразу приступить к использованию и расширению датасета.
Источник: arXiv cs.CL ↗
