hao-ai-lab/LookaheadDecoding

[ICML 2024] Преодоление последовательной зависимости в LLM inference с помощью Lookahead Decoding

Инференс⭐ 1 343Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Lookahead Decoding — это алгоритм параллельного декодирования для LLM, ускоряющий генерацию текста в 1.5–2.3 раза без использования моделей-черновиков (draft models).

Зачем нужен

Инструмент решает проблему последовательной зависимости в авторегрессионном выводе LLM, позволяя генерировать несколько токенов за один шаг. Он полезен для снижения задержки (latency) при инференсе, так как использует метод Якоби для параллельной генерации и верификации n-грамм, не требуя дополнительных моделей или баз данных.

Что можно реализовать

  • Ускорение генерации ответов в чат-ботах на базе LLaMA-2 и других моделей
  • Оптимизация инференса LLM на одном GPU для снижения времени отклика
  • Интеграция в существующие пайплайны LLM через переменные окружения (USE_LADE=1)
  • Исследование методов параллельного декодирования без использования speculative decoding

Ключевые возможности

  • Ускорение инференса в 1.5x–2.3x на одном GPU
  • Отсутствие необходимости в модели-черновике (draft model) или базе данных
  • Параллельная генерация и верификация n-грамм через два ветвления (lookahead и verification branches)
  • Простая установка через pip (пакет lade) и использование через флаги окружения
  • Поддержка FlashAttention и интеграция в собственный код

👤 Кому подойдёт: разработчики LLM, ML-инженеры, исследователи в области оптимизации инференса

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.