Добавлена поддержка Qwen-Turbo-1M, LLaMA-3-70B-1M, FlexPrefill и xAttention, обновлена совместимость с transformers.
- Added: Добавлена поддержка моделей Qwen-Turbo-1M и LLaMA-3-70B-1M с возможностью многопроцессорного параллелизма.
- Added: Внедрены новые функции: FlexPrefill, xAttention, поддержка SGLang/vLLM и chunk MLP.
- Added: Добавлен бенчмарк SCBench и обновлена версия CUDA для релиза.
- Added: Обновлена поддержка библиотеки transformers (версия >=4.46.0).
- Fixed: Исправлены ошибки в поисковых паттернах, вычислениях residual, работе с кэшем и конфигурациях Qwen.