Проблема «узкого конуса»
Стандартная практика в векторных базах данных опирается на косинусное сходство для поиска семантически близких документов. Однако новое исследование из Towards AI вскрывает фундаментальное противоречие: эмбеддинги, полученные через mean-pooling в моделях типа BERT, не распределены равномерно в пространстве. Вместо этого они занимают так называемый «узкий конус» (narrow cone).
Это геометрическое свойство означает, что векторы естественным образом сближаются друг с другом независимо от их смыслового содержания. В результате, косинусное сходство перестает быть индикатором семантической близости и становится артефактом распределения данных.
Цифры, которые пугают
Ключевой вывод исследования заключается в экстремально высоких значениях сходства для заведомо разных текстов. Авторы демонстрируют, что пары семантически не связанных предложений могут демонстрировать косинусное сходство на уровне 0.99. Это критически важно для систем RAG (Retrieval-Augmented Generation), где неточная выборка контекста ведет к галлюцинациям LLM.
Сравнение метрик
Традиционное косинусное сходство игнорирует плотность распределения векторов, в то время как альтернативные подходы пытаются учесть эту специфику. Ниже приведена сравнительная характеристика подхода:
| Метрика | Предположение | Поведение на «узком конусе» | Риск для RAG |
|---|---|---|---|
| Cosine Similarity | Равномерное распределение | Завышает сходство (до 0.99) | Высокий: шум в контексте |
| Dot Product | Учет длины вектора | Сильная корреляция с Cosine | Высокий: аналогичные искажения |
| Angular Distance | Геометрическая коррекция | Более точная оценка углов | Средний: требует калибровки |
Почему это важно для разработчиков
Если вы используете стандартные эмбеддинги (например, из `sentence-transformers` с mean-pooling) и косинусное сходство для ранжирования, ваша система может возвращать релевантные документы с низкой уверенностью или, наоборот, отбрасывать правильные из-за «шума» в высоких значениях сходства. Исследование призывает пересмотреть выбор метрик расстояния или использовать нормализованные эмбеддинги, которые лучше соответствуют гипотезам косинусного сходства.
Источник: Towards AI pub ↗
