google/langextract

Python-библиотека для извлечения структурированной информации из неструктурированного текста с использованием LLM, точной привязкой к источнику и интерактивной визуализацией.

Инструменты⭐ 38 632Pythonпоследний релиз: v1.7.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

LangExtract — это Python-библиотека для извлечения структурированной информации из неструктурированного текста с использованием LLM, обеспечивающая точную привязку результатов к исходному тексту.

Зачем нужен

Инструмент решает задачу преобразования больших объемов неструктурированных данных (например, медицинских отчетов или литературных текстов) в четкие структуры данных. Он полезен тем, что гарантирует верифицируемость результатов за счет визуализации и точного указания цитат в источнике, а также эффективно обрабатывает длинные документы.

Что можно реализовать

  • Извлечение сущностей из клинических заметок и радиологических отчетов (RadExtract)
  • Анализ литературных текстов: выделение персонажей, эмоций и отношений
  • Структурирование медицинских данных, таких как списки лекарств
  • Обработка длинных документов с использованием чанкинга и параллельной обработки

Ключевые возможности

  • Точная привязка к источнику (Source Grounding): каждая сущность связана с точным местом в тексте, что позволяет верифицировать данные
  • Интерактивная визуализация: генерация HTML-файла для удобного обзора и проверки извлеченных данных
  • Оптимизация для длинных документов: стратегия чанкинга и многопроходной обработки для повышения полноты извлечения
  • Гибкая поддержка моделей: работа с облачными LLM (Gemini, OpenAI) и локальными моделями через Ollama
  • Контролируемая генерация: использование few-shot примеров для обеспечения стабильной структуры вывода

👤 Кому подойдёт: разработчики, исследователи данных, аналитики, работающие с неструктурированными текстами

Релизы

v1.7.0minorbreaking
🕐 7 дн назад · релиз на GitHub ↗

Исправлена генерация плагинов и маршрутизация моделей, улучшено выравнивание источников, добавлены настройки токенов для Gemini.

  • Added: Улучшено выравнивание источников для повторяющихся упоминаний с возможностью сохранения старого алгоритма.
  • Added: Добавлена передача настроек генерации Gemini, включая лимиты токенов.
  • Fixed: Исправлена генерация плагинов, схем и упаковка.
  • Fixed: Исправлена маршрутизация моделей OpenAI и GPT-3.5, добавлено автоматическое обнаружение ключей для reasoning-моделей.
  • Breaking: Некорректные ответы Gemini/OpenAI теперь выдаются как ошибки инференса; для GPT-3.5 требуется use_schema_constraints=False.
v1.6.0minor
🕐 2 мес назад · релиз на GitHub ↗

Добавлена поддержка пользовательских схем вывода для Gemini и OpenAI, а также JSON-чат для Ollama GPT-OSS.

  • Added: Добавлена поддержка пользовательских схем вывода (output_schema) для моделей Gemini и OpenAI.
  • Added: Реализована поддержка JSON-чата для модели GPT-OSS в Ollama.
v1.5.0minor
🕐 4 мес назад · релиз на GitHub ↗

Добавлена поддержка OpenAI Batch API и обновлена модель Gemini Flash по умолчанию до версии gemini-3.5-flash.

  • Added: Добавлена поддержка OpenAI Batch API.
  • Added: Модель Gemini Flash по умолчанию обновлена до gemini-3.5-flash.