Исследования8 сентября 2026 г., 03:18 МСК🤖 Auto

LentEx: LLM-модель для извлечения скрытых сущностей через синтетические данные

Исследователи представили LentEx — первую систему, использующую instruction-tuned LLM и синтетические данные для извлечения неявных сущностей, превосходящую SOTA в кластеризации MTEB.

Баннер новости 6981

Проблема неявных сущностей

Традиционные методы извлечения сущностей (NER) отлично справляются с явными объектами (имена, даты, локации), но терпят неудачу при работе с latent entities — скрытыми, контекстуально выведенными понятиями. Например, из текста "он опоздал на встречу, потому что застрял в пробке" можно вывести сущность "пробка" или "транспортный коллапс", хотя слово "пробка" в тексте отсутствует. Именно эту нишу заполняет новый фреймворк LentEx.

Архитектура и методология

Авторы (Umesh Bodhwani, Yuan Ling и соавт.) предлагают подход, основанный на двух ключевых элементах:

  • Генерация синтетических данных: Используется шаблонный подход для создания разнообразных, контекстуально богатых датасетов, имитирующих реальные распределения данных. Это решает проблему нехватки размеченных данных для обучения.
  • Instruction Fine-Tuning: Модели малого и среднего размера (small/efficient LLMs) дообучаются на инструкциях, что позволяет им эффективно извлекать абстрактные сущности без необходимости использования гигантских моделей.

Результаты и бенчмарки

LentEx демонстрирует значительное улучшение метрик по сравнению с существующими решениями. Особое внимание уделено задаче кластеризации текстов, где извлечение скрытых сущностей играет ключевую роль. Модель показала лучшие результаты на бенчмарке MTEB Clustering Benchmark, превзойдя state-of-the-art модели.

Характеристика Значение / Описание
Название модели LentEx
Основная задача Latent Entity Extraction (извлечение скрытых сущностей)
Ключевая технология Синтетические данные + Instruction-tuned LLMs
Ключевой бенчмарк MTEB Clustering Benchmark
Результат Превосходство над SOTA моделями в кластеризации
Применение RAG, анализ клиентских персон, обогащение графов знаний

Значение для индустрии

Опубликованная в IJCNN 2025 работа устанавливает новый стандарт для понимания контекста в NLP. Способность LentEx обобщать знания на новые, невидимые во время обучения домены делает её критически важной для систем RAG (Retrieval-Augmented Generation), где точность извлечения контекста напрямую влияет на качество ответов генеративной модели.

Источник: arXiv cs.CL ↗