Релиз модели24 сентября 2026 г., 13:47 МСК🤖 Auto

Ovis-Omni-Embedding-3B: Новый лидер кросс-модального поиска от Alibaba

Команда Alibaba ATH-MaaS представила универсальную модель эмбеддингов Ovis-Omni-Embedding-3B, способную обрабатывать текст, изображения, видео, аудио и документы в едином пространстве. Модель показала рекордные результаты на бенчмарке MMEB-v3.

Баннер новости 8186

Архитектура и подход

Ovis-Omni-Embedding-3B — это модель с 3 миллиардами параметров, разработанная на базе Qwen2.5-Omni-3B. В отличие от подходов, использующих отдельные башни для каждого модальности, эта модель сохраняет нативные текстовый токенизатор, визуальный и аудиоэнкодеры, а также общий бэкбон Thinker. Для получения векторного представления используется скрытое состояние последнего слоя на позиции последнего непустого токена. Модули генерации речи (Talker) и языкового моделирования удалены, что оптимизирует модель исключительно для задач поиска и понимания.

Результаты на MMEB-v3

Модель протестирована на бенчмарке Massive Multimodal Embedding Benchmark (MMEB) версии 3, который включает 190 наборов данных по шести категориям: изображение, видео, визуальный документ, текст, аудио и агент. Ovis-Omni-Embedding-3B заняла первое место по совокупному баллу, превзойдя сильнейший базовый вариант на 5.19 пункта.

Группа модальностей Ovis-Omni-Embedding-3B Лучший базовый вариант Преимущество
Изображение 77.55 73.83 +3.72
Видео 64.99 59.37 +5.62
Визуальный документ 78.26 75.37 +2.89
Текст 47.15 43.62 +3.53
Аудио 50.08 43.17 +6.90
Агент 45.52 39.42 +6.10
Все 190 наборов (итого) 58.46 53.27 +5.19

В полном сравнении по 31 агрегированной записи модель заняла первое место в 22 случаях и второе — в 8. Исключение составил только один показатель в MultiConIR.

Дополнительные бенчмарки

Помимо MMEB, модель продемонстрировала высокую эффективность на других специализированных наборах данных, часто превосходя более крупные аналоги (например, 7B-параметровую LCO-Embedding-Omni-7B):

  • MAEB (beta): 57.29 (среднее по 30 аудио-задачам). Для сравнения, LCO-Embedding-Omni-7B показала 53.54.
  • MVEB (beta): 61.77 (среднее по 23 видео- и аудио-видео задачам). LCO-Embedding-Omni-7B показала 57.58.
  • RTEB: 67.35 (15 задач английского публичного поиска). Результат близок к Qwen3-Embedding-4B (67.27).

Технические характеристики и доступность

Модель поддерживает эластичную размерность эмбеддинга: 2048 (по умолчанию), а также 1024, 512, 256 и 128. Страница модели доступна на Hugging Face, а технический отчет опубликован на arXiv (arXiv:2609.25165). Веса модели пока не открыты, но их релиз ожидается в ближайшее время. Проект распространяется под лицензией Apache 2.0.

Бенчмарки

БенчмаркOvis-Omni-Embedding-3BBest compared baselineLCO-Embedding-Omni-7BQwen3-Embedding-4B
MMEB-v358.46%53.27%——
MAEB (beta)57.29%—53.54%—
MVEB (beta)61.77%—57.58%—
RTEB67.35%——67.27%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗