Инструменты19 августа 2026 г., 09:17 МСК🤖 Auto

KernelArc: AI-агенты захватили топ SOL-ExecBench на NVIDIA H100/B200

Новая система KernelArc от исследователей из Meta и других лабораторий демонстрирует, как многоагентный поиск превосходит ручную оптимизацию GPU-ядер, заняв первые места в ключевых задачах LLM.

Баннер новости 6048

Автономная оптимизация GPU-ядер

Команда исследователей, включая Joyjit Kundu, Ben Stoffelen и Kaili Wang, представила KernelArc — многоагентную фреймворк-систему для автономной оптимизации вычислительных ядер (kernels) на графических процессорах. В отличие от традиционных подходов, где инженеры вручную пишут CUDA-код, KernelArc использует параллельно работающих специализированных агентов. Эти агенты координируют действия через разделяемую память, детерминированный бенчмарк-контроль и механизм «черновиков» при достижении плато производительности.

Результаты на SOL-ExecBench

Оценка проводилась на новейших архитектурах NVIDIA H100 и B200 с использованием репрезентативных рабочих нагрузок из набора SOL-ExecBench. По состоянию на 30 июля 2026 года, решения, сгенерированные KernelArc, заняли первое место в следующих категориях:

  • Задачи L1 (базовые линейные алгебраические операции);
  • Задачи L2 (оптимизация памяти и кэширования);
  • Задачи квантования;
  • Задачи FlashInfer (аттеншн-механизмы).

Технические достижения

Система смогла автоматически сгенерировать высокоэффективные реализации для сложных сценариев, которые ранее требовали глубокой экспертизы. Среди ключевых достижений:

Компонент/Задача Решение KernelArc
Матричные умножения Кастомная реализация BF16 GEMM
cuBLASLt Статические таблицы конфигурации Expert-API
Mixture-of-Experts (MoE) Fused backward pass (слитый обратный проход)
Decoder Layers Shape-gated fusion (слияние с гейтами по форме)
Attention (NVFP4) Native grouped-query attention
Prefill Paged prefill attention

Почему это важно

Результаты подтверждают гипотезу авторов: совместный многоагентный поиск позволяет расширить пространство исследований (exploration) и найти более сильные решения в рамках фиксированного бюджета кандидатов. Это снижает порог входа для оптимизации GPU и ускоряет разработку высокопроизводительных моделей для LLM. Система демонстрирует, что ИИ-агенты могут не просто помогать, а полностью заменять рутинную работу по тьюнингу низкоуровневых вычислений.

Источник: arXiv cs.AI ↗