opendatalab/MinerU

Преобразует сложные документы, такие как PDF и Office-файлы, в формат markdown/JSON, готовый для LLM, для ваших Agentic-рабочих процессов.

Инструменты⭐ 80 346Pythonпоследний релиз: mineru-4.0.5-released
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

MinerU — это инструмент для извлечения данных из сложных документов (PDF, Office), который преобразует их в структурированный Markdown или JSON, готовые к использованию в LLM-пайплайнах.

Зачем нужен

Инструмент решает проблему неструктурированности исходных файлов, автоматически извлекая текст, таблицы и формулы с сохранением логической структуры. Это критически важно для подготовки качественных данных в RAG-системах и Agentic-рабочих процессах, где точность извлечения информации напрямую влияет на качество ответов LLM.

Что можно реализовать

  • Создание баз знаний (RAG) для корпоративных документов, научных статей и отчетов
  • Извлечение структурированных данных из таблиц и формул для последующей обработки LLM
  • Подготовка датасетов для fine-tuning моделей путем конвертации PDF/Office в чистый Markdown
  • Автоматизация обработки входящей документации в Agentic-воркфлоу

Ключевые возможности

  • Поддержка сложных форматов: PDF, Word, PowerPoint
  • Высокое качество извлечения текста, таблиц и математических формул
  • Вывод в форматах Markdown и JSON, оптимизированных для LLM
  • Интеграция с экосистемой OpenDataLab и наличие демо на HuggingFace/ModelScope

👤 Кому подойдёт: Разработчики AI-приложений, инженеры данных, исследователи, работающие с RAG и LLM

Релизы

mineru-4.0.5-releasedminor
🕐 22 ч назад · релиз на GitHub ↗

Версия 4.0.5: добавлена поддержка CUDA ONNX для таблиц, унифицирована настройка потоков и обновлены требования к зависимостям.

  • Added: Добавлена опциональная поддержка CUDA ONNX для модели таблиц с автоматическим включением и замером времени.
  • Added: Унифицирована конфигурация потоков для ONNX-сессий с возможностью переопределения через переменные окружения.
  • Added: Обновлен формат именования сохраненных изображений и улучшена обработка их разрешения.
  • Added: Повышена минимальная требуемая версия библиотеки docvortex до 0.4.20.
mineru-4.0.4-releasedminor
🕐 вчера · релиз на GitHub ↗

Версия 4.0.4: оптимизация работы с GPU, снижение шума в логах, исправление зависимостей и улучшение обработки длинных имён файлов.

  • Fixed: Оптимизирована логика использования видеопамяти GPU на устройствах с большим объёмом VRAM.
  • Fixed: Логи загрузки моделей, производительности и приоритета таблиц переведены из уровня info в debug.
  • Fixed: Флаг --log-level теперь влияет только на серверные логи, не затрагивая другие компоненты.
  • Fixed: Исправлено дублирование при сохранении файлов с именем длиннее 120 байт.
  • Added: Требование к mineru-vl-utils повышено до 2.0.5 для исправления сбоев lmdeploy.
mineru-4.0.3-releasedminorbreaking
🕐 2 дн назад · релиз на GitHub ↗

MinerU 4.0.3: поддержка векторной геометрии PDF, оптимизация AMD RDNA, исправления VLM и API.

  • Added: В контентную обработку добавлена поддержка векторной геометрии страниц PDF.
  • Added: В CLI добавлены флаги для работы с Docker-репозиториями и улучшена обработка алиасов аргументов.
  • Fixed: Улучшена работа VLM server: корректное соблюдение offline-режима, обработка окружения и оптимизация для AMD RDNA.
  • Breaking: Удален параметр language из API server и опция latex delimiters, теперь управляемая через конфиг.
  • Fixed: Ускорен возврат при сбое探测 парсинга и исправлена ошибка токенизатора LoRA.
mineru-4.0.2-releasedpatch
🕐 3 дн назад · релиз на GitHub ↗

В MinerU 4.0.2 улучшена безопасность HTML-превью, исправлено декодирование BOM и обновлены зависимости.

  • Added: Добавлена возможность предварительной настройки глобального уровня логирования перед операциями рендеринга и разбора.
  • Added: Внедрена замена OFD-превью на HTML-источники для просмотра документов.
  • Fixed: Устранена уязвимость SSRF: HTML-превью больше не загружают удалённые изображения, а внешние ссылки остаются кликабельными.
  • Fixed: Исправлена ошибка декодирования HTML-файлов с BOM в кодировках UTF-16 и UTF-32.
  • Added: Повышена минимальная требуемая версия зависимости docvortex до 0.4.12.
mineru-4.0.0-releasedmajorbreaking
🕐 5 дн назад · релиз на GitHub ↗

Масштабный релиз MinerU 4.0: переосмысленная архитектура с четырьмя уровнями качества, нативная поддержка множества форматов и локальная библиотека документов.

  • Added: Внедрены четыре уровня качества парсинга: flash, basic, standard и advanced, заменяющие старую логику выбора бэкенда.
  • Added: Добавлена нативная поддержка DOCX, PPTX, XLSX, EPUB, OFD и других форматов без конвертации в PDF.
  • Added: Реализована локальная библиотека документов с новыми CLI-командами для чтения, поиска и управления контекстом.
  • Added: Возможность независимой настройки движков для малых моделей и VLM, а также поддержка новых бандлов моделей.
  • Breaking: Ломающие изменения: обновлены CLI-команды, структура пакетов, конфигурация и API, устарела старая схема результатов.
mineru-3.4.5-releasedpatch
🕐 1 мес назад · релиз на GitHub ↗

Исправлено удаление таблиц из DOCX при наличии спецсимволов и улучшена обработка Unicode-пар в PDF.

  • Fixed: Исправлена проблема, при которой таблицы из DOCX файлов молча удалялись, если ячейки содержали специальные символы, отличные от текста.
  • Fixed: Реализовано восстановление суррогатных пар для улучшения корректности извлечения текста из PDF-документов.
mineru-3.4.4-releasedpatch
🕐 2 мес назад · релиз на GitHub ↗

Исправления: улучшен анализ шрифтов PDF (Latin/CJK) и обнаружение дубликатов символов для точного рендеринга текста.

  • Fixed: Улучшен анализ шрифтов PDF за счёт добавления обнаружения использования шрифтов Latin и CJK.
  • Fixed: Добавлено обнаружение дубликатов символов со смещением для повышения качества рендеринга текста (исправление #5238).