Исследования3 августа 2026 г., 09:16 МСК🤖 Auto

Qwen3.5-9B для KG: как снизить дубликаты и повысить recall до 95%

Исследователи представили слой извлечения для графов знаний, использующий Qwen3.5-9B и онтологическое руководство. Система увеличила точность поиска с 70% до 95% и устранила критические ошибки слияния сущностей.

Баннер новости 4930

Проблема неструктурированных данных

Большие языковые модели (LLM) часто извлекают сущности и связи из документов непоследовательно: словарные типы фрагментируются, одни и те же люди появляются под разными вариациями имен, а отношения дублируются. Это приводит к «тихому слиянию» различных личностей с одинаковыми именами и снижению качества графов знаний.

Архитектура решения

Авторы разработали производственный слой извлечения, который преобразует живой поток документов в валидированный граф знаний, выровненный по формальной онтологии. Система потребляет метаданные из Kafka и маршрутизирует PDF, таблицы, Office-файлы и изображения через специализированные обработчики. Извлечение происходит в два прохода с использованием локально развернутой модели Qwen3.5-9B, дообученной на онтологии.

Онтологическое руководство и оптимизация

Ключевым компонентом является извлечение, направляемое онтологией. Актуальный срез курируемой онтологии извлекается в реальном времени из графовой базы данных с помощью эмбеддингового сходства и внедряется в промпт. Это снижает накладные расходы на каталогизацию примерно на 94% по сравнению со статическими доменными срезами.

Пайплайн очистки и дедупликации

Извлеченные результаты проходят через пятиэтапный конвейер:

  • Детерминированная очистка;
  • Объединение по чанкам;
  • Второй проход для извлечения отношений;
  • Шесть алгоритмов дедупликации, не требующих инференса модели;
  • Подсистема разрешения эмбеддингов с защитой от конфликтов, которую невозможно обойти только высоким баллом сходства.

Результаты на разведывательных корпусах

Оценка на разведывательных данных показала значительное улучшение метрик. Система исправила семь классов «тихих» дефектов качества, включая баг, усечение исходного текста на один символ, и систематическое дублирование сущностей с префиксами титулов.

Метрика До внедрения После внедрения
Recall поиска ~70% 95%
Ложные слияния (False Merges) Присутствовали 0
Снижение накладных расходов онтологии ~94%

Источник: arXiv cs.AI ↗