Исследования4 сентября 2026 г., 16:18 МСК🤖 Auto

Косинусное сходство лжёт: почему эмбеддинги занимают узкий конус

Исследование показывает, что mean-pooled BERT-эмбеддинги имеют косинусное сходство 0.99 даже для семантически разных пар, что делает стандартные метрики ненадёжными для RAG-систем.

Баннер новости 6777

Проблема «узкого конуса»

Стандартная практика в векторных базах данных опирается на косинусное сходство для поиска семантически близких документов. Однако новое исследование из Towards AI вскрывает фундаментальное противоречие: эмбеддинги, полученные через mean-pooling в моделях типа BERT, не распределены равномерно в пространстве. Вместо этого они занимают так называемый «узкий конус» (narrow cone).

Это геометрическое свойство означает, что векторы естественным образом сближаются друг с другом независимо от их смыслового содержания. В результате, косинусное сходство перестает быть индикатором семантической близости и становится артефактом распределения данных.

Цифры, которые пугают

Ключевой вывод исследования заключается в экстремально высоких значениях сходства для заведомо разных текстов. Авторы демонстрируют, что пары семантически не связанных предложений могут демонстрировать косинусное сходство на уровне 0.99. Это критически важно для систем RAG (Retrieval-Augmented Generation), где неточная выборка контекста ведет к галлюцинациям LLM.

Сравнение метрик

Традиционное косинусное сходство игнорирует плотность распределения векторов, в то время как альтернативные подходы пытаются учесть эту специфику. Ниже приведена сравнительная характеристика подхода:

Метрика Предположение Поведение на «узком конусе» Риск для RAG
Cosine Similarity Равномерное распределение Завышает сходство (до 0.99) Высокий: шум в контексте
Dot Product Учет длины вектора Сильная корреляция с Cosine Высокий: аналогичные искажения
Angular Distance Геометрическая коррекция Более точная оценка углов Средний: требует калибровки

Почему это важно для разработчиков

Если вы используете стандартные эмбеддинги (например, из `sentence-transformers` с mean-pooling) и косинусное сходство для ранжирования, ваша система может возвращать релевантные документы с низкой уверенностью или, наоборот, отбрасывать правильные из-за «шума» в высоких значениях сходства. Исследование призывает пересмотреть выбор метрик расстояния или использовать нормализованные эмбеддинги, которые лучше соответствуют гипотезам косинусного сходства.

Источник: Towards AI pub ↗