Релиз модели5 августа 2026 г., 19:45 МСК🤖 Auto

UEmbed: Единая модель для плотного и разреженного поиска от Alibaba

Alibaba и CASIA представили UEmbed — первую decoder-only модель, объединяющую плотные и разреженные эмбеддинги для текста и мультимедиа в одном проходе.

Баннер новости 5142

Революция в архитектуре: от Encoder к Decoder

Традиционные системы поиска опирались на двунаправленные (encoder-style) архитектуры, которые плохо масштабируются на мультимедиа. UEmbed решает эту проблему, используя decoder-only архитектуру на базе семейства Qwen3.5. Ключевая инновация — разделение словаря на N (16) непересекающихся подмножеств с помощью семантической кластеризации (k-means). Каждое из 16 специальных токенов «специализируется» на своей теме, предсказывая веса для разреженного вектора. Это устраняет «бутылочное горлышко» однократного токена, характерное для причинных моделей.

Масштабы и результаты на MMEB-v2

Модель выпущена в трех версиях: 2B, 4B и 9B параметров. UEmbed-9B демонстрирует state-of-the-art результаты среди моделей, обученных на публичных данных. Важно отметить, что разрыв между плотным и разреженным поиском минимален — всего 0.8 балла для 9B модели, что делает её универсальным решением.

Модель Параметры MMEB-v2 (Dense) MMEB-v2 (Sparse) BEIR (Dense nDCG@10)
UEmbed-9B 9B 71.8 71.0 56.3
UEmbed-4B 4B 70.4 69.7 56.0
UEmbed-2B 2B 66.5
RzenEmbed-V2-7B 7B 71.1
Qwen3-VL-Embedding-8B 8B 72.0* 55.5

*Qwen3-VL-Embedding-8B использует проприетарные данные, UEmbed-9B лидирует среди open-source решений.

Технические детали и эффективность

Обучение велось на 3.94 млн публичных сэмплов (Echo-embedding, MLDR, MMEB) с использованием hard negatives, извлеченных моделью Qwen3-VL-Embedding-8B. Архитектура позволяет:

  • Экономить ресурсы: Для плотного поиска специальные токены можно игнорировать, не увеличивая вычислительные затраты.
  • Поддерживать мультимедиа: Модель работает с текстом, изображениями, видео и визуальными документами.
  • Обеспечивать разреженность: Использование регуляризаторов FLOPS и специфической температуры softmax (τ=32) делает разреженные векторы эффективными для индексации в стандартных inverted indexes.

Почему это важно

UEmbed устраняет необходимость в двух разных моделях для плотного (семантического) и разреженного (лексического) поиска. Это упрощает инфраструктуру RAG-систем и поисковых движков, позволяя использовать один checkpoint для всех задач. Особенно сильны результаты на визуально насыщенных документах, где разрыв между режимами практически исчезает.

Бенчмарки

БенчмаркUEmbed-4B (dense)UEmbed-9B (dense)UEmbed-9B (sparse)Qwen3-VL-Embedding-8BRzenEmbed-V2-7B
MMEB-v271.8%71%71.8%71.1%
BEIR56%56.3%55.2%55.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗