Релиз модели7 октября 2026 г., 01:19 МСК🤖 Auto

Google DeepMind выпустил EmbeddingGemma 2: 740M параметров для мультимодального RAG

Google DeepMind открыла веса модели EmbeddingGemma 2 (740M параметров), способной обрабатывать текст, код, изображения, видео и аудио в едином векторном пространстве. Модель оптимизирована для работы на edge-устройствах с потреблением RAM от 191 МБ.

Баннер новости 9072

Архитектура и возможности

EmbeddingGemma 2 построена на базе архитектуры Gemma 4 и поддерживает контекстное окно объемом 8192 токенов (в 4 раза больше, чем у версии 1). Ключевая особенность — модульная структура, позволяющая разработчикам загружать только необходимые компоненты:

  • Текст и код (270M параметров): Базовый бэкбон (130M transformer + 140M embedder).
  • Визуальный энкодер (170M параметров): Опционально для работы с изображениями.
  • Аудио энкодер (300M параметров): Опционально для работы со звуком.

Все модальности проецируются в единое 768-мерное пространство. Поддерживается Matryoshka Representation Learning (MRL), позволяющая обрезать векторы до 512, 256 или 128 измерений для экономии памяти без критической потери качества.

Бенчмарки и сравнение с предшественником

Модель демонстрирует значительный прогресс в поиске кода по сравнению с EmbeddingGemma 1. Ниже приведены результаты на полных весах (768 dim, FP16):

Бенчмарк EmbeddingGemma 2 EmbeddingGemma 1
MTEB Code v1 78.68 68.76
MTEB multilingual v2 61.36 61.15
MIEB lite (image) 64.64 n/a
MMEB v2 overall 59.01 n/a
MSEB retrieval (sound) 69.54 n/a
MAEB (audio) 49.39 n/a

Эффективность на устройствах (Edge AI)

Модель спроектирована для работы на смартфонах и ноутбуках. При квантовании (INT4/INT8) на Pixel 11 Pro активная память (RAM) составляет:

  • ~191 МБ для текстовой версии (270M параметров).
  • ~567 МБ для полной мультимодальной версии (740M параметров).

Скорость обработки изображения на MacBook M5 Pro GPU составляет 37.3 мс. Для сравнения, конкурент Qwen3-VL-Embedding-2B требует 2B параметров и не поддерживает аудио, а Gemini Embedding 2 доступен только через платный API.

Доступность и лицензия

Модель распространяется под лицензией Apache 2.0, что позволяет коммерческое использование. Веса доступны на Hugging Face и Kaggle. Поддерживаются форматы GGUF (llama.cpp), LiteRT и интеграция с Ollama. Ожидается поддержка NPU-ускорения через ML Kit для Android в ближайшие недели.

Бенчмарки

БенчмаркEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.36%61.15%
MTEB Code v178.68%68.76%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗