Автономная оптимизация GPU-ядер
Команда исследователей, включая Joyjit Kundu, Ben Stoffelen и Kaili Wang, представила KernelArc — многоагентную фреймворк-систему для автономной оптимизации вычислительных ядер (kernels) на графических процессорах. В отличие от традиционных подходов, где инженеры вручную пишут CUDA-код, KernelArc использует параллельно работающих специализированных агентов. Эти агенты координируют действия через разделяемую память, детерминированный бенчмарк-контроль и механизм «черновиков» при достижении плато производительности.
Результаты на SOL-ExecBench
Оценка проводилась на новейших архитектурах NVIDIA H100 и B200 с использованием репрезентативных рабочих нагрузок из набора SOL-ExecBench. По состоянию на 30 июля 2026 года, решения, сгенерированные KernelArc, заняли первое место в следующих категориях:
- Задачи L1 (базовые линейные алгебраические операции);
- Задачи L2 (оптимизация памяти и кэширования);
- Задачи квантования;
- Задачи FlashInfer (аттеншн-механизмы).
Технические достижения
Система смогла автоматически сгенерировать высокоэффективные реализации для сложных сценариев, которые ранее требовали глубокой экспертизы. Среди ключевых достижений:
| Компонент/Задача | Решение KernelArc |
|---|---|
| Матричные умножения | Кастомная реализация BF16 GEMM |
| cuBLASLt | Статические таблицы конфигурации Expert-API |
| Mixture-of-Experts (MoE) | Fused backward pass (слитый обратный проход) |
| Decoder Layers | Shape-gated fusion (слияние с гейтами по форме) |
| Attention (NVFP4) | Native grouped-query attention |
| Prefill | Paged prefill attention |
Почему это важно
Результаты подтверждают гипотезу авторов: совместный многоагентный поиск позволяет расширить пространство исследований (exploration) и найти более сильные решения в рамках фиксированного бюджета кандидатов. Это снижает порог входа для оптимизации GPU и ускоряет разработку высокопроизводительных моделей для LLM. Система демонстрирует, что ИИ-агенты могут не просто помогать, а полностью заменять рутинную работу по тьюнингу низкоуровневых вычислений.
Источник: arXiv cs.AI ↗
