v2.8.3.post1patch
Вышла версия v2.8.3.post1.
Быстрое и эффективное по памяти точное внимание
FlashAttention — это библиотека для PyTorch, обеспечивающая быстрое и энергоэффективное вычисление механизма внимания (attention) за счет оптимизации работы с памятью GPU.
Инструмент решает проблему высокой нагрузки на память и узкой пропускной способности при обучении и инференсе больших языковых моделей (LLM). Он ускоряет вычисления и снижает потребление VRAM, что позволяет работать с более длинными контекстами и большими моделями на существем оборудовании.
👤 Кому подойдёт: ML-инженеры, исследователи в области NLP, разработчики LLM и дата-сайентисты, работающие с обучением и развертыванием больших моделей.
Вышла версия v2.8.3.post1.