namuan/dr-doc-search

Общайся с книгой — создано с помощью GPT-3

RAG⭐ 598Pythonпоследний релиз: 1.6.3
Открыть на GitHub ↗

Что это за инструмент

Инструмент на Python для создания локального индекса PDF-документов с возможностью задавать вопросы по их содержимому через CLI или веб-интерфейс.

Зачем нужен

Позволяет извлекать информацию из книг и отчетов, используя RAG-подход: текст извлекается (включая OCR для сканов), векторизуется и ищется по запросу. Полезен для быстрого анализа больших объемов текста без необходимости писать код для парсинга.

Что можно реализовать

  • Интерактивный поиск ответов в технических спецификациях или научных статьях (PDF)
  • Анализ отсканированных документов с помощью Tesseract OCR
  • Локальное исследование книг или отчетов через простой веб-интерфейс
  • Быстрое получение цитат или фактов из длинных текстовых файлов

Ключевые возможности

  • Поддержка двух режимов генерации эмбеддингов: OpenAI GPT-3 или локальные модели HuggingFace
  • Встроенный OCR (Tesseract) для обработки сканированных PDF-файлов
  • Готовый веб-интерфейс (на базе HoloViz Panel) для общения с документом
  • Простая установка через pip и запуск через командную строку
  • Использование LangChain для построения цепочек обработки текста

👤 Кому подойдёт: разработчики, исследователи, аналитики данных, работающие с PDF-документами

Релизы

1.6.3patch
🕐 43 мес назад · релиз на GitHub ↗

Исправлена поддержка ImageMagick в Windows-версии приложения.

  • Fixed: Устранена проблема с поддержкой ImageMagick на Windows.