Релиз модели10 сентября 2026 г., 21:02 МСК🤖 Auto

ThunderKittens на NVIDIA Vera Rubin: 22 PFLOPS и NVFP4

Together AI портировала модель ThunderKittens на архитектуру NVIDIA Vera Rubin NVL72, достигнув производительности 22 PFLOPS за счет оптимизации GEMM-операций в формате NVFP4.

Баннер новости 7201

Прорыв в производительности на новой архитектуре

Компания Together AI объявила о успешном портировании своей модели ThunderKittens на новейшую аппаратную платформу NVIDIA Vera Rubin NVL72. Ключевым достижением стала переработка библиотеки GEMM (General Matrix Multiplication) с использованием формата NVFP4. Это позволило не просто запустить модель, но и максимизировать использование вычислительных ресурсов нового чипа.

От 42% к лидерству: метрики эффективности

До оптимизации под новую архитектуру производительность составляла лишь 42% от теоретического предела (roofline). После внедрения специфичных для Vera Rubin улучшений в ISA (Instruction Set Architecture) и перестройки GEMM-ядра, Together AI достигла показателя более 22 PFLOPS. Этот результат ставит их реализацию в один ряд с промышленными стандартами, такими как cuBLAS и CuTe DSL, доказывая, что кастомные оптимизации могут конкурировать с оптимизациями от NVIDIA.

Технические детали и сравнение

Основной фокус работы был сделан на адаптации под изменения в инструкции процессора (ISA) и эффективном использовании памяти. Ниже приведена сводка ключевых изменений и результатов:

Параметр До оптимизации После оптимизации (NVIDIA Vera Rubin NVL72)
Использование roofline 42% > 90% (конкурентно с cuBLAS)
Пиковая производительность Информация недостаточна > 22 PFLOPS
Формат данных Стандартный NVFP4 (NVIDIA FP4)
Сопоставимые решения cuBLAS, CuTe DSL

Почему это важно для индустрии

Достижение 22 PFLOPS на NVL72 демонстрирует, что архитектура Vera Rubin готова к обработке тяжелых нагрузок LLM (Large Language Models) с минимальными задержками. Использование формата NVFP4 позволяет значительно сократить требования к памяти и пропускной способности, что критически важно для развертывания больших моделей на ограниченных ресурсах. Для разработчиков и дата-центров это означает путь к более дешевому и быстрому инференсу и обучению моделей следующего поколения.

Источник: Together AI ↗