Релиз модели1 октября 2026 г., 23:19 МСК🤖 Auto

Cohere Embed 5: Прорыв в RAG с 128K контекстом и гибридным поиском

Cohere выпустила семейство моделей Embed 5 для Enterprise AI. Ключевая фишка — единое векторное пространство для Pro и Fast версий, что позволяет индексировать данные одной моделью, а искать другой, экономя до 256x в хранении.

Баннер новости 8725

Две модели, одна цель: Pro и Fast

Cohere представила Embed 5 — новое поколение эмбеддингов, разделенное на два тарифа для оптимизации Enterprise-задач. Обе модели поддерживают ввод текста, изображений и их комбинаций, работают с 100+ языками и обрабатывают до 128K токенов на запрос.

  • Embed 5 Pro (ID: embed-v5.0-pro): Фокус на максимальное качество поиска. Цена: $0.12 за 1M токенов.
  • Embed 5 Fast (ID: embed-v5.0-fast): Фокус на скорость и стоимость. Цена: $0.08 за 1M токенов.

Главное архитектурное решение: Pro и Fast используют единое векторное пространство. Это позволяет индексировать базу данных с помощью точной Pro-модели, а на этапе запроса использовать быструю Fast-модель. Тесты показывают, что такой гибрид (Pro index + Fast query) дает 98.4% от качества чистого Pro, при этом Fast обрабатывает 377.3 документа/сек против 159.7 у Pro.

Сравнение с конкурентами

В бенчмарках Cohere использует новую метрику RCP-nDCG@10. Embed 5 Pro демонстрирует лидерство в общих задачах и финансах, значительно опережая OpenAI и обгоняя Voyage 4 Large и Gemini Embedding 2.

Модель ViDoRe V3 FinanceBench Max Context Цена (текст, $/1M)
Cohere Embed 5 Pro 85.8 80.1 128K $0.12
Cohere Embed 5 Fast 84.5 89.0 (FinQA) 128K $0.08
Voyage 4 Large 83.7 83.6 (PDF) 32K $0.12
Gemini Embedding 2 83.2 — 8.2K $0.20
OpenAI text-embedding-3-large 75.5 — 8.2K $0.13

Экономия хранения: Matryoshka и бинарные векторы

Модель поддерживает динамическое уменьшение размерности (Matryoshka) и различные форматы вывода (float32, int8, binary). Это критично для масштабируемости:

  • Вектор 2048 dim (float32): 8 KB на запись.
  • Вектор 1024 dim (int8): 1 KB на запись (рекомендуемый баланс).
  • Вектор 256 dim (binary): 32 байта на запись.

Для базы из 100 млн чанков это снижает объем хранения с 819 GB до 3.2 GB при использовании бинарных векторов.

Где запустить

Модели доступны через Cohere API, Microsoft Foundry и Amazon SageMaker. Для private VPC или on-prem развертывания поддерживается vLLM. Модель уже интегрирована в агентные системы для RAG, где низкая задержка запросов так же важна, как и точность.

Бенчмарки

БенчмаркEmbed 5 FastEmbed 5 ProGemini Embedding 2Voyage 4 Large
ViDoRe V384.5%85.8%83.2%83.7%
Parsed PDFs—84.8%—83.6%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗