Суть обновления: от ACE к AVX10_V2_AUX
Инженер AMD Дипеш Шарма (Dipesh Sharma) опубликовал серию из 7 патчей для GNU Compiler Collection (GCC), которые добавляют поддержку архитектуры AVX10_V2_AUX. Это расширение является частью спецификации ACE v1 (AI Compute Extensions), разработанной в рамках x86 Ecosystem Advisory Group совместно с Intel. Цель — стандартизировать ускорение AI/ML-вычислений на платформе x86, дополняя существующие AVX-инструкции новыми возможностями обработки данных.
Технические детали и метрики
Ключевая особенность AVX10_V2_AUX — аппаратная поддержка конвертации данных между различными форматами с плавающей запятой, что критически важно для инференса нейросетей. Патчи реализуют:
- Обнаружение инструкций через
cpuid. - Встроенные функции (builtins) и интринсики (intrinsics) для новых инструкций.
- Поддержку форматов сжатия данных, таких как FP4 и FP6.
- Расширенную поддержку форматов микромасштабирования OCP (Open Compute Project).
- Новые режимы округления.
Сравнение форматов данных в ACE v1
Новый набор инструкций позволяет эффективно работать с низкоточными форматами, экономя пропускную способность памяти и увеличивая вычислительную плотность. Ниже приведена таблица поддерживаемых преобразований:
| Исходный формат | Целевой формат | Значение для AI/ML |
|---|---|---|
| FP32 (32-bit float) | FP8 (8-bit float) | Снижение требований к памяти при хранении весов моделей |
| FP32 / FP8 | FP4 (4-bit float) | Экстремальное сжатие для инференса, ускорение вычислений |
| FP32 / FP8 | FP6 (6-bit float) | Компромисс между точностью и эффективностью памяти |
| FP8 | FP4 / FP6 | Динамическая конвертация в процессе вычислений |
Сроки и статус разработки
Патчи уже отправлены на рассмотрение в список рассылки разработчиков GCC. Инженеры AMD и Intel демонстрируют тесную коллаборацию: ранее Intel уже представила начальные патчи для ACE, а теперь AMD закрывает вопрос с детальной поддержкой AVX10_V2_AUX. Ожидается, что полная поддержка ACE v1 будет интегрирована в стабильный релиз GCC 17.1, который запланирован на следующий год. Это позволит разработчикам компилировать код, использующий новые AI-инструкции, без необходимости использования проприетарных компиляторов.
Источник: Phoronix ↗
