Medusa v0.1: фреймворк для ускорения генерации LLM через легкие декодирующие головы без необходимости в draft-модели.
- Added: Демократизация методов ускорения генерации больших языковых моделей.
- Added: Использование нескольких легких декодирующих голов (decoding heads).
- Added: Отказ от необходимости использования draft-модели.