RecurrentGemma — семейство языковых моделей с открытыми весами от Google DeepMind, использующих архитектуру Griffin для ускорения генерации длинных последовательностей.
Зачем нужен
Инструмент решает задачу эффективного вывода (inference) и тонкой настройки (fine-tuning) LLM за счет замены глобального внимания на локальное внимание и линейные рекуррентные слои. Это позволяет значительно ускорить обработку длинных контекстов по сравнению с классическими трансформерами.
Что можно реализовать
Генерация длинных текстовых последовательностей с высокой скоростью
Тонкая настройка моделей для специфических задач (например, перевод с английского на французский)
Исследование архитектуры Griffin и линейных рекуррентных слоев
Развертывание LLM на TPU, GPU или CPU с использованием оптимизированных реализаций Flax или PyTorch
Ключевые возможности
Архитектура Griffin: смесь локального внимания и линейных рекуррентных слоев для быстрого инференса
Оптимизированная реализация на Flax (JAX) с низкоуровневыми ядрами Pallas для TPU
Доступность весов через Kaggle и наличие готовых примеров кода
Поддержка как JAX, так и PyTorch (в неоптимизированном виде)
Открытая лицензия Apache 2.0
👤 Кому подойдёт: Исследователи в области NLP, разработчики, работающие с оптимизацией LLM, и инженеры, использующие TPU или GPU для развертывания моделей.