Прорыв в производительности на новой архитектуре
Компания Together AI объявила о успешном портировании своей модели ThunderKittens на новейшую аппаратную платформу NVIDIA Vera Rubin NVL72. Ключевым достижением стала переработка библиотеки GEMM (General Matrix Multiplication) с использованием формата NVFP4. Это позволило не просто запустить модель, но и максимизировать использование вычислительных ресурсов нового чипа.
От 42% к лидерству: метрики эффективности
До оптимизации под новую архитектуру производительность составляла лишь 42% от теоретического предела (roofline). После внедрения специфичных для Vera Rubin улучшений в ISA (Instruction Set Architecture) и перестройки GEMM-ядра, Together AI достигла показателя более 22 PFLOPS. Этот результат ставит их реализацию в один ряд с промышленными стандартами, такими как cuBLAS и CuTe DSL, доказывая, что кастомные оптимизации могут конкурировать с оптимизациями от NVIDIA.
Технические детали и сравнение
Основной фокус работы был сделан на адаптации под изменения в инструкции процессора (ISA) и эффективном использовании памяти. Ниже приведена сводка ключевых изменений и результатов:
| Параметр | До оптимизации | После оптимизации (NVIDIA Vera Rubin NVL72) |
|---|---|---|
| Использование roofline | 42% | > 90% (конкурентно с cuBLAS) |
| Пиковая производительность | Информация недостаточна | > 22 PFLOPS |
| Формат данных | Стандартный | NVFP4 (NVIDIA FP4) |
| Сопоставимые решения | — | cuBLAS, CuTe DSL |
Почему это важно для индустрии
Достижение 22 PFLOPS на NVL72 демонстрирует, что архитектура Vera Rubin готова к обработке тяжелых нагрузок LLM (Large Language Models) с минимальными задержками. Использование формата NVFP4 позволяет значительно сократить требования к памяти и пропускной способности, что критически важно для развертывания больших моделей на ограниченных ресурсах. Для разработчиков и дата-центров это означает путь к более дешевому и быстрому инференсу и обучению моделей следующего поколения.
Источник: Together AI ↗
