HKUDS/RAG-Anything

"RAG-Anything: All-in-One RAG Framework"

RAG⭐ 23 373Pythonпоследний релиз: v1.4.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

RAG-Anything — это фреймворк для мультимодального RAG, позволяющий обрабатывать не только текст, но и изображения, таблицы и формулы.

Зачем нужен

Инструмент решает проблему традиционных RAG-систем, которые не могут эффективно работать с разнородным контентом документов. Он объединяет обработку текста, визуальных данных и таблиц в едином конвейере, исключая необходимость использования множества специализированных инструментов.

Что можно реализовать

  • Анализ научных статей, содержащих сложные формулы и диаграммы
  • Поиск информации в отчетах с таблицами и графиками
  • Обработка документов с изображениями через VLM-Enhanced Query
  • Создание систем знаний для мультимедийных архивов
  • Интеллектуальный поиск по документам с учетом контекста

Ключевые возможности

  • Поддержка мультимодальных запросов (текст, изображения, таблицы, уравнения)
  • Интеграция VLM-Enhanced Query для анализа изображений в документах
  • Модуль контекстной обработки (context configuration module)
  • Построен на базе LightRAG
  • Доступен как Python-пакет (pip) и через uv

👤 Кому подойдёт: разработчики, исследователи, инженеры данных

Релизы

v1.4.1major
🕐 19 дн назад · релиз на GitHub ↗

Добавлена поддержка аудио и видео как полноценных модальностей, прямая обработка медиафайлов и извлечение изображений из Markdown.

  • Added: Аудио и видео стали полноценными модальностями: добавлены AudioModalProcessor (faster-whisper) и VideoModalProcessor (SceneDetect + OpenCV + VLM) с оконной обработкой длинных файлов.
  • Added: Медиафайлы (mp3, mp4 и др.) теперь можно передавать напрямую в process_document_complete, минуя парсер документов, с автоматическим хешированием для дедупликации.
  • Added: Изображения из ссылок Markdown (![alt](path)) теперь корректно извлекаются и обрабатываются через тот же мульти модальный конвейер, что и картинки из PDF.
  • Fixed: Исправлена порча sys.modules в тестах из-за некорректного teardown в test_modalprocessors_config.py, устраняющая зависимость результатов от порядка запуска.
  • Added: Добавлены рекомендации по настройке моделей Whisper (WHISPER_MODEL=medium) для улучшения распознавания китайской речи и устранения искажений имен собственных.
v1.4.0majorbreaking
🕐 19 дн назад · релиз на GitHub ↗

v1.4.0: нативная поддержка MinerU v2, прямое парсинге .txt/.md, оптимизация vision-промптов и важные исправления кэширования.

  • Added: Добавлена нативная поддержка MinerU v2 с сохранением структуры контента и фильтрацией вёрстки.
  • Added: Внедрено прямое парсинге .txt и .md файлов, что ускоряет обработку в 3 раза и исключает ошибки OCR.
  • Added: Улучшены vision-промпты для точного распознавания диаграмм, узлов и топологии схем.
  • Breaking: Изменены идентификаторы документов для .txt/.md и кэши парсинга, что требует повторного ингреста.
  • Fixed: Исправлены критические ошибки: пропуск документов в LightRAG, коллизии кэша запросов и крахи MinerU.
v1.3.1patch
🕐 4 мес назад · релиз на GitHub ↗

Исправлена логика дедупликации текста в RAG-системе путём отложенного создания статуса документа.

  • Fixed: Исправлено обнаружение дубликатов для текстового контента за счёт отложенного создания doc_status после выполнения LightRAG ainsert.
  • Fixed: Применена та же логика отложенного создания статуса к обработанным документам, содержащим текст.
  • Fixed: Сохранено раннее создание doc_status для мультимодального контента, не вызывающего ainsert.
  • Added: Добавлены регрессионные тесты для проверки корректности обработки дубликатов в списках контента и парсерах.