Революция в архитектуре: от Encoder к Decoder
Традиционные системы поиска опирались на двунаправленные (encoder-style) архитектуры, которые плохо масштабируются на мультимедиа. UEmbed решает эту проблему, используя decoder-only архитектуру на базе семейства Qwen3.5. Ключевая инновация — разделение словаря на N (16) непересекающихся подмножеств с помощью семантической кластеризации (k-means). Каждое из 16 специальных токенов «специализируется» на своей теме, предсказывая веса для разреженного вектора. Это устраняет «бутылочное горлышко» однократного токена, характерное для причинных моделей.
Масштабы и результаты на MMEB-v2
Модель выпущена в трех версиях: 2B, 4B и 9B параметров. UEmbed-9B демонстрирует state-of-the-art результаты среди моделей, обученных на публичных данных. Важно отметить, что разрыв между плотным и разреженным поиском минимален — всего 0.8 балла для 9B модели, что делает её универсальным решением.
| Модель | Параметры | MMEB-v2 (Dense) | MMEB-v2 (Sparse) | BEIR (Dense nDCG@10) |
|---|---|---|---|---|
| UEmbed-9B | 9B | 71.8 | 71.0 | 56.3 |
| UEmbed-4B | 4B | 70.4 | 69.7 | 56.0 |
| UEmbed-2B | 2B | 66.5 | — | — |
| RzenEmbed-V2-7B | 7B | 71.1 | — | — |
| Qwen3-VL-Embedding-8B | 8B | 72.0* | — | 55.5 |
*Qwen3-VL-Embedding-8B использует проприетарные данные, UEmbed-9B лидирует среди open-source решений.
Технические детали и эффективность
Обучение велось на 3.94 млн публичных сэмплов (Echo-embedding, MLDR, MMEB) с использованием hard negatives, извлеченных моделью Qwen3-VL-Embedding-8B. Архитектура позволяет:
- Экономить ресурсы: Для плотного поиска специальные токены можно игнорировать, не увеличивая вычислительные затраты.
- Поддерживать мультимедиа: Модель работает с текстом, изображениями, видео и визуальными документами.
- Обеспечивать разреженность: Использование регуляризаторов FLOPS и специфической температуры softmax (τ=32) делает разреженные векторы эффективными для индексации в стандартных inverted indexes.
Почему это важно
UEmbed устраняет необходимость в двух разных моделях для плотного (семантического) и разреженного (лексического) поиска. Это упрощает инфраструктуру RAG-систем и поисковых движков, позволяя использовать один checkpoint для всех задач. Особенно сильны результаты на визуально насыщенных документах, где разрыв между режимами практически исчезает.
Бенчмарки
| Бенчмарк | UEmbed-4B (dense) | UEmbed-9B (dense) | UEmbed-9B (sparse) | Qwen3-VL-Embedding-8B | RzenEmbed-V2-7B |
|---|---|---|---|---|---|
| MMEB-v2 | — | 71.8% | 71% | 71.8% | 71.1% |
| BEIR | 56% | 56.3% | 55.2% | 55.5% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
