epfml/landmark-attention

Landmark Attention: бесконечная длина контекста с произвольным доступом для трансформеров

LLM⭐ 428Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Реализация механизма Landmark Attention для трансформеров, позволяющая обрабатывать бесконечный контекст с произвольным доступом.

Зачем нужен

Инструмент решает проблему ограничения длины контекста в LLM, заменяя стандартное внимание на аппроксимацию с использованием ключевых маркерных токенов. Это полезно для задач, требующих анализа очень длинных документов или последовательностей без необходимости их фрагментации.

Что можно реализовать

  • Обучение языковых моделей на длинных последовательностях (PG19, arXiv Math) с увеличенным контекстом
  • Дообучение (fine-tuning) моделей семейства LLaMA для работы с расширенным контекстом
  • Инференс с использованием кэширования маркерных токенов (mem_cache) для ускорения обработки
  • Исследование архитектуры внимания для замены стандартного SDPA на fused_landmark_attention

Ключевые возможности

  • Поддержка Triton-реализации в связке с Flash Attention для снижения потребления памяти и роста скорости
  • Готовый код для fine-tuning LLaMA 7B с опубликованными весами (weight diff)
  • Возможность добавления маркерных токенов через регулярные интервалы (настраиваемый mem_freq)
  • Бенчмарки на датасетах PG19 и arXiv Math для оценки качества языкового моделирования

👤 Кому подойдёт: ML-инженеры, исследователи архитектуры LLM, разработчики, занимающиеся оптимизацией и дообучением больших языковых моделей

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.