google-deepmind/recurrentgemma

Open weights language model from Google DeepMind, based on Griffin.

LLM⭐ 685Pythonпоследний релиз: v1.0.1
Открыть на GitHub ↗

Что это за инструмент

RecurrentGemma — семейство языковых моделей с открытыми весами от Google DeepMind, использующих архитектуру Griffin для ускорения генерации длинных последовательностей.

Зачем нужен

Инструмент решает задачу эффективного вывода (inference) и тонкой настройки (fine-tuning) LLM за счет замены глобального внимания на локальное внимание и линейные рекуррентные слои. Это позволяет значительно ускорить обработку длинных контекстов по сравнению с классическими трансформерами.

Что можно реализовать

  • Генерация длинных текстовых последовательностей с высокой скоростью
  • Тонкая настройка моделей для специфических задач (например, перевод с английского на французский)
  • Исследование архитектуры Griffin и линейных рекуррентных слоев
  • Развертывание LLM на TPU, GPU или CPU с использованием оптимизированных реализаций Flax или PyTorch

Ключевые возможности

  • Архитектура Griffin: смесь локального внимания и линейных рекуррентных слоев для быстрого инференса
  • Оптимизированная реализация на Flax (JAX) с низкоуровневыми ядрами Pallas для TPU
  • Доступность весов через Kaggle и наличие готовых примеров кода
  • Поддержка как JAX, так и PyTorch (в неоптимизированном виде)
  • Открытая лицензия Apache 2.0

👤 Кому подойдёт: Исследователи в области NLP, разработчики, работающие с оптимизацией LLM, и инженеры, использующие TPU или GPU для развертывания моделей.

Релизы