Инструменты14 сентября 2026 г., 17:17 МСК🤖 Auto

AMD выпустила KernelVault: 100k+ ядер для обучения AI-агентов оптимизации GPU

AMD представила AMDKernelVault — крупнейший открытый датасет для HIP и Triton ядер, а также обученную на нем модель Qwen3-8B, превосходящую аналоги в генерации кода для GPU.

Баннер новости 7458

Прорыв в оптимизации AMD GPU

Команда AMD представила AMDKernelVault — масштабный открытый корпус данных и фреймворк обучения для оптимизации ядер на GPU архитектуры CDNA. В отличие от существующих решений, сфокусированных на CUDA/NVIDIA, AMDKernelVault закрывает критический пробел в экосистеме ROCm, предлагая инструменты для агентной генерации кода на HIP и Triton.

Масштаб датасета: более 100 тысяч проверенных примеров

Ключевая ценность проекта — в объеме и качестве данных. Датасет включает более 100 тысяч образцов, прошедших проверку на выполнение, что позволяет обучать модели без необходимости бесконечных вызовов фронтенд-LLM для рефлексии. Структура данных выглядит следующим образом:

Компонент датасета Количество образцов Описание
HIP Kernel Samples 62,153 Выполняемые образцы HIP-ядер
Triton Kernels 39,893 Ядра на языке Triton
ROCm Libraries QA 2,377 Записи из производственной среды ROCm

Результаты обучения Qwen3-8B

Для демонстрации полезности датасета команда провела дообучение модели Qwen3-8B с использованием контролируемого обучения (SFT) и обучения с подкреплением, учитывающего выполнение кода (execution-aware RL). Модель показала выдающиеся результаты в сравнении с другими LLM-агентами при фиксированных вычислительных бюджетах:

Бенчмарк Метрика Результат Qwen3-8B
PyTorch-to-HIP Pass@1 (Correctness) 34.0%
TritonBench-G Corr@3 (Correctness) 33.2%
ROCmBench Corr@3 (Correctness) 41.94%

Важно отметить: модель лидирует по метрикам корректности (correctness), но не всегда выигрывает в метриках компиляции или скорости выполнения, что указывает на направление для дальнейших оптимизаций.

Почему это важно?

AMDKernelVault вводит новые стандарты для агентной оптимизации GPU. Пайплайны HIPKernelGen и TritonKernelGen автоматически преобразуют референсные PyTorch-коды в оптимизированные HIP/Triton ядра, компилируют их в среде ROCm и профилируют задержки на реальном железе AMD. Это снижает порог входа для разработчиков, желающих максимизировать производительность на GPU CDNA, используя AI-ассистентов.

Код и документация проекта доступны в открытом доступе, что позволяет исследователям и инженерам сразу приступить к использованию и расширению датасета.

Источник: arXiv cs.CL ↗