Исследования2 сентября 2026 г., 06:18 МСК🤖 Auto

BGE-M3 vs COMETKiwi: кто лучше ловит ошибки в переводе

Исследование показало, что мультимодельные эмбеддинги (BGE-M3) уступают специализированной модели COMETKiwi в детекции ошибок, но остаются незаменимы для семантического анализа.

Баннер новости 6556

Суть исследования

Команда исследователей под руководством Eleftherios Kalogeros провела сравнительный анализ пяти популярных моделей мультимодельных эмбеддингов и модели оценки качества машинного перевода COMETKiwi. Цель — понять, насколько хорошо современные векторные представления могут выявлять тонкие ошибки в переводах с английского на греческий язык. Для этого был создан контрастный датасет из 1 850 примеров, отфильтрованных экспертами, охватывающий 15 категорий ошибок: от фактических неточностей до проблем с временами и местоимениями.

Лидеры и аутсайдеры

Результаты показали четкое разделение на два класса моделей. Специализированная метрика COMETKiwi продемонстрировала наивысшую точность, в то время как среди универсальных эмбеддингов лучшим оказался BGE-M3. Важно отметить, что эмбеддинги лучше справляются с явными лексическими и фактическими изменениями, тогда как COMETKiwi эффективнее выявляет сложные лингвистические нюансы, такие как согласование времен и семантические роли.

Модель Тип Точность (Accuracy) Сильные стороны
COMETKiwi MT Quality Estimation 94.49% Времена, местоимения, семантические роли
BGE-M3 Sentence Embedding 89.30% Фактические и лексические ошибки
Multilingual E5 Sentence Embedding Уступает BGE-M3
Multilingual MPNet Sentence Embedding Уступает BGE-M3
LaBSE Sentence Embedding Уступает BGE-M3
Jina Embeddings v3 Sentence Embedding Уступает BGE-M3

Ключевые выводы для разработчиков

  • Комплементарность: Модели не конкурируют, а дополняют друг друга. Эмбеддинги дают быстрый сигнал о семантической адекватности, а COMETKiwi — о лингвистической корректности.
  • Слабые места: Ни одна из моделей не показала высокой чувствительности к ошибкам, связанным с датами, временем и числами. Это указывает на необходимость специализированных проверок для этих категорий.
  • Рекомендация: Использовать эмбеддинги как самостоятельный метрик для детекции ошибок неэффективно. Оптимальная стратегия — их интеграция в более широкие фреймворки оценки качества перевода.

Почему это важно

Для разработчиков локализации и NLP-сервисов исследование служит четким ориентиром: полагаться только на косинусное сходство векторов (cosine similarity) для проверки качества перевода рискованно. Внедрение гибридных подходов, сочетающих семантические эмбеддинги и специализированные модели оценки (как COMET), позволит снизить количество пропущенных ошибок на 5-6% по сравнению с использованием только эмбеддингов.

Источник: arXiv cs.CL ↗