Релиз модели6 октября 2026 г., 23:45 МСК🤖 Auto

Google EmbeddingGemma 2: мультимодальные эмбеддинги с открытым кодом

Google открыла доступ к EmbeddingGemma 2 — первой модели семейства Gemma, способной обрабатывать текст и изображения для создания универсальных векторных представлений.

Баннер новости 9066

Новый стандарт мультимодальности

Компания Google представила EmbeddingGemma 2, обновленную версию своей модели для создания эмбеддингов. Главное отличие новой версии от предшественника (EmbeddingGemma 1) заключается в поддержке мультимодальности. Теперь модель способна принимать на вход не только текстовые запросы, но и изображения, создавая единое векторное пространство для обоих типов данных.

Это критически важно для современных систем RAG (Retrieval-Augmented Generation) и поиска, где часто требуется сопоставлять текстовые запросы с визуальным контентом или искать изображения по текстовому описанию.

Технические характеристики и архитектура

Модель построена на базе архитектуры Gemma 2, которая известна своей эффективностью и высокой производительностью при меньшем количестве параметров по сравнению с аналогами. EmbeddingGemma 2 оптимизирована для задач семантического поиска и классификации.

Характеристика EmbeddingGemma 1 EmbeddingGemma 2
Тип данных Текст Текст + Изображения
Базовая архитектура Gemma 1 Gemma 2
Доступность Открытый вес Открытый вес (Hugging Face)
Основное применение Текстовый поиск, классификация Мультимодальный поиск, RAG

Практическое применение

Разработчики могут использовать EmbeddingGemma 2 для:

  • Мультимодального поиска: Поиск изображений по текстовому запросу и наоборот.
  • Улучшения RAG-систем: Индексация документов, содержащих как текст, так и вложения (скриншоты, диаграммы).
  • Классификации контента: Группировка данных по смыслу, независимо от формата (текст или картинка).

Где скачать?

Модель уже доступна на платформе Hugging Face. Google предоставляет веса модели для свободного использования, что позволяет разработчикам интегрировать её в свои проекты без необходимости обращения к закрытым API. Это снижает барьер для внедрения передовых технологий обработки естественного языка и компьютерного зрения в open-source экосистему.

Источник: Huggingface ↗