Релиз модели6 октября 2026 г., 19:22 МСК🤖 Auto

EmbeddingGemma 2: мультимодальный эмбеддинг для edge-устройств

Google DeepMind выпустила EmbeddingGemma 2 — легкую мультимодальную модель (740 млн параметров) для локального поиска по тексту, коду, аудио и видео с поддержкой 8K контекста.

Баннер новости 9045

Новый стандарт для on-device AI

Google DeepMind представила EmbeddingGemma 2, модель для создания векторных представлений (эмбеддингов), которая расширяет возможности своего предшественника. Если первая версия работала только с текстом, то EmbeddingGemma 2 объединяет в едином пространстве текст, код, изображения, видео и аудио. Модель построена на архитектуре Gemma 4 и лицензирована под Apache 2.0, что делает её коммерчески привлекательной для разработчиков.

Ключевая особенность — оптимизация для работы на устройствах (on-device). Модель требует всего ~191 МБ оперативной памяти для текстовых задач и ~567 МБ для полной мультимодальной версии на Google Pixel 11 Pro, обеспечивая приватность данных за счет локальной обработки без отправки запросов в облако.

Технические характеристики и эффективность

EmbeddingGemma 2 демонстрирует выдающиеся результаты для модели размером менее 1 миллиарда параметров. Она превосходит многие более крупные аналоги в задачах семантического поиска и классификации. Важным нововведением стала поддержка Matryoshka Representation Learning (MRL), позволяющая динамически уменьшать размер вектора с 768 до 128 измерений, что сокращает потребление памяти в 6 раз.

Характеристика Значение / Метрика
Количество параметров 740 млн (общее), 270 млн (только текст)
Размер контекстного окна 8 000 токенов (в 4 раза больше v1)
Производительность (MTEB Code) 78.68 (рост на 9.92 пункта по сравнению с v1)
Потребление RAM (Pixel 11 Pro) ~191 МБ (текст) / ~567 МБ (полная версия)
Максимальная длина медиа 5.5 мин аудио, 29 изображений или 58 кадров видео

Практическое применение

Модель предназначена для создания систем локального поиска и RAG (Retrieval-Augmented Generation). Разработчики могут использовать её для:

  • Поиска по медиатеке: Нахождение видео или аудио по текстовому запросу или другому медиафайлу.
  • Работы с кодом: Семантический поиск по базам кода и индексация репозиториев прямо на устройстве.
  • Классификации и маршрутизации: Использование в MediaPipe Decision Task API для принятия решений на основе мультимодального контекста в реальном времени.

Интеграция и доступность

Весы модели доступны на Hugging Face и Kaggle. EmbeddingGemma 2 совместима с популярными инструментами, включая transformers.js, WebGPU, MLX, vLLM, llama.cpp, Ollama и LMStudio. Для оптимизации под мобильные устройства Google рекомендует использовать LiteRT и MediaPipe. Также доступна документация по тонкой настройке (fine-tuning) с помощью Unsloth.

Бенчмарки

БенчмаркEmbeddingGemma 2EmbeddingGemma 1
MTEB Code78.68%68.76%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Google DeepMind ↗