Две модели, одна цель: Pro и Fast
Cohere представила Embed 5 — новое поколение эмбеддингов, разделенное на два тарифа для оптимизации Enterprise-задач. Обе модели поддерживают ввод текста, изображений и их комбинаций, работают с 100+ языками и обрабатывают до 128K токенов на запрос.
- Embed 5 Pro (ID:
embed-v5.0-pro): Фокус на максимальное качество поиска. Цена: $0.12 за 1M токенов. - Embed 5 Fast (ID:
embed-v5.0-fast): Фокус на скорость и стоимость. Цена: $0.08 за 1M токенов.
Главное архитектурное решение: Pro и Fast используют единое векторное пространство. Это позволяет индексировать базу данных с помощью точной Pro-модели, а на этапе запроса использовать быструю Fast-модель. Тесты показывают, что такой гибрид (Pro index + Fast query) дает 98.4% от качества чистого Pro, при этом Fast обрабатывает 377.3 документа/сек против 159.7 у Pro.
Сравнение с конкурентами
В бенчмарках Cohere использует новую метрику RCP-nDCG@10. Embed 5 Pro демонстрирует лидерство в общих задачах и финансах, значительно опережая OpenAI и обгоняя Voyage 4 Large и Gemini Embedding 2.
| Модель | ViDoRe V3 | FinanceBench | Max Context | Цена (текст, $/1M) |
|---|---|---|---|---|
| Cohere Embed 5 Pro | 85.8 | 80.1 | 128K | $0.12 |
| Cohere Embed 5 Fast | 84.5 | 89.0 (FinQA) | 128K | $0.08 |
| Voyage 4 Large | 83.7 | 83.6 (PDF) | 32K | $0.12 |
| Gemini Embedding 2 | 83.2 | — | 8.2K | $0.20 |
| OpenAI text-embedding-3-large | 75.5 | — | 8.2K | $0.13 |
Экономия хранения: Matryoshka и бинарные векторы
Модель поддерживает динамическое уменьшение размерности (Matryoshka) и различные форматы вывода (float32, int8, binary). Это критично для масштабируемости:
- Вектор 2048 dim (float32): 8 KB на запись.
- Вектор 1024 dim (int8): 1 KB на запись (рекомендуемый баланс).
- Вектор 256 dim (binary): 32 байта на запись.
Для базы из 100 млн чанков это снижает объем хранения с 819 GB до 3.2 GB при использовании бинарных векторов.
Где запустить
Модели доступны через Cohere API, Microsoft Foundry и Amazon SageMaker. Для private VPC или on-prem развертывания поддерживается vLLM. Модель уже интегрирована в агентные системы для RAG, где низкая задержка запросов так же важна, как и точность.
Бенчмарки
| Бенчмарк | Embed 5 Fast | Embed 5 Pro | Gemini Embedding 2 | Voyage 4 Large |
|---|---|---|---|---|
| ViDoRe V3 | 84.5% | 85.8% | 83.2% | 83.7% |
| Parsed PDFs | — | 84.8% | — | 83.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
