epfml/landmark-attention
Landmark Attention: бесконечная длина контекста с произвольным доступом для трансформеров
LLM⭐ 428Python
Что это за инструмент
Реализация механизма Landmark Attention для трансформеров, позволяющая обрабатывать бесконечный контекст с произвольным доступом.
Зачем нужен
Инструмент решает проблему ограничения длины контекста в LLM, заменяя стандартное внимание на аппроксимацию с использованием ключевых маркерных токенов. Это полезно для задач, требующих анализа очень длинных документов или последовательностей без необходимости их фрагментации.
Что можно реализовать
- Обучение языковых моделей на длинных последовательностях (PG19, arXiv Math) с увеличенным контекстом
- Дообучение (fine-tuning) моделей семейства LLaMA для работы с расширенным контекстом
- Инференс с использованием кэширования маркерных токенов (mem_cache) для ускорения обработки
- Исследование архитектуры внимания для замены стандартного SDPA на fused_landmark_attention
Ключевые возможности
- Поддержка Triton-реализации в связке с Flash Attention для снижения потребления памяти и роста скорости
- Готовый код для fine-tuning LLaMA 7B с опубликованными весами (weight diff)
- Возможность добавления маркерных токенов через регулярные интервалы (настраиваемый mem_freq)
- Бенчмарки на датасетах PG19 и arXiv Math для оценки качества языкового моделирования
👤 Кому подойдёт: ML-инженеры, исследователи архитектуры LLM, разработчики, занимающиеся оптимизацией и дообучением больших языковых моделей
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.