Новый стандарт для on-device AI
Google DeepMind представила EmbeddingGemma 2, модель для создания векторных представлений (эмбеддингов), которая расширяет возможности своего предшественника. Если первая версия работала только с текстом, то EmbeddingGemma 2 объединяет в едином пространстве текст, код, изображения, видео и аудио. Модель построена на архитектуре Gemma 4 и лицензирована под Apache 2.0, что делает её коммерчески привлекательной для разработчиков.
Ключевая особенность — оптимизация для работы на устройствах (on-device). Модель требует всего ~191 МБ оперативной памяти для текстовых задач и ~567 МБ для полной мультимодальной версии на Google Pixel 11 Pro, обеспечивая приватность данных за счет локальной обработки без отправки запросов в облако.
Технические характеристики и эффективность
EmbeddingGemma 2 демонстрирует выдающиеся результаты для модели размером менее 1 миллиарда параметров. Она превосходит многие более крупные аналоги в задачах семантического поиска и классификации. Важным нововведением стала поддержка Matryoshka Representation Learning (MRL), позволяющая динамически уменьшать размер вектора с 768 до 128 измерений, что сокращает потребление памяти в 6 раз.
| Характеристика | Значение / Метрика |
|---|---|
| Количество параметров | 740 млн (общее), 270 млн (только текст) |
| Размер контекстного окна | 8 000 токенов (в 4 раза больше v1) |
| Производительность (MTEB Code) | 78.68 (рост на 9.92 пункта по сравнению с v1) |
| Потребление RAM (Pixel 11 Pro) | ~191 МБ (текст) / ~567 МБ (полная версия) |
| Максимальная длина медиа | 5.5 мин аудио, 29 изображений или 58 кадров видео |
Практическое применение
Модель предназначена для создания систем локального поиска и RAG (Retrieval-Augmented Generation). Разработчики могут использовать её для:
- Поиска по медиатеке: Нахождение видео или аудио по текстовому запросу или другому медиафайлу.
- Работы с кодом: Семантический поиск по базам кода и индексация репозиториев прямо на устройстве.
- Классификации и маршрутизации: Использование в MediaPipe Decision Task API для принятия решений на основе мультимодального контекста в реальном времени.
Интеграция и доступность
Весы модели доступны на Hugging Face и Kaggle. EmbeddingGemma 2 совместима с популярными инструментами, включая transformers.js, WebGPU, MLX, vLLM, llama.cpp, Ollama и LMStudio. Для оптимизации под мобильные устройства Google рекомендует использовать LiteRT и MediaPipe. Также доступна документация по тонкой настройке (fine-tuning) с помощью Unsloth.
Бенчмарки
| Бенчмарк | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB Code | 78.68% | 68.76% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Google DeepMind ↗
