Поддержка Rubin SM107a, NVFP4 на SM120/121, cuDNN FP8 attention, torch.compile и оптимизации MoE/MLA.
- Added: Добавлена поддержка архитектуры Rubin SM107a при сборке с CUDA 13.4+
- Added: Реализована поддержка NVFP4 stochastic-rounding и RHT split-quantization для GPU SM120 и SM121
- Added: Добавлена поддержка cuDNN FP8 fused attention для packed THD inputs и context-parallel execution
- Added: Включена поддержка torch.compile(fullgraph=True) для FlashAttention и unfused attention бэкенда
- Added: Оптимизирован экспериментальный MoE Block в JAX и добавлена поддержка Fused MLA Q up-projection в PyTorch