Инструменты9 июля 2026 г., 15:17 МСК🤖 Auto

Datalab Lift: 9B-модель для извлечения данных из PDF с точностью 90.2%

Datalab представила Lift — 9-миллиардную визуальную модель, которая превращает PDF и изображения в структурированный JSON за один проход, обгоняя NuExtract3 по точности и уступая только Gemini Flash 3.5.

Баннер новости 3205

Суть прорыва: Schema-First вместо парсинга

Datalab Lift позиционируется не как OCR-движок или конвертер в Markdown, а как извлекатель данных, ориентированный на схему (schema-first extractor). В отличие от традиционных пайплайнов, где документ сначала преобразуется в текст, а затем LLM извлекает поля, Lift читает рендеринг страниц и выдает готовый JSON, соответствующий заданной схеме, за один проход. Это снижает сложность инфраструктуры, но требует четкого понимания разницы между «парсингом» (восстановлением структуры документа) и «извлечением» (получением конкретных полей для приложения).

Бенчмарки: Lift против NuExtract3 и Gemini Flash 3.5

В сравнительном тестировании Datalab Lift демонстрирует сильные результаты в точности извлечения полей. Модель превосходит ближайшего открытого конкурента NuExtract3 (4B) и показывает конкурентоспособность против флагманских облачных решений, хотя и уступает им в абсолютной точности ради скорости.

Модель / Сервис Тип Точность полей (Field Accuracy) Медианная задержка (Latency) Ключевая особенность
Datalab Lift 9B VLM (Open-weight) 90.2% 9.5 сек Schema-constrained decoding, локальный запуск
NuExtract3 4B VLM (Apache 2.0) 81.5% Не указано Меньший размер, конвертация в Markdown
Gemini Flash 3.5 Frontier Multimodal LLM Выше 90.2% 28.1 сек Высокая точность, облачное использование
Azure Content Understanding Cloud Platform Ниже Lift Выше Lift Цитирование, enterprise-инфраструктура

Почему это важно для разработчиков

Выбор между Lift и альтернативами зависит от приоритетов проекта:

  • Скорость и контроль: Lift идеален для сценариев с высоким объемом документов, где критична задержка (9.5 сек против 28.1 сек у Gemini) и требуется самостойкий хостинг (self-hosting) для соблюдения политик безопасности данных.
  • Точность vs. Размер: Если важна максимальная точность и есть возможность ждать дольше, Gemini Flash 3.5 выигрывает. Если нужен компактный open-weight модель для локального развертывания, NuExtract3 проще, но менее точен.
  • Модель vs. Платформа: Lift — это «сырая» модель. В отличие от Reducto, LlamaExtract или Azure Document Intelligence, она не предоставляет встроенных инструментов для верификации, цитирования источников или human-in-the-loop процессов. Для этих задач Datalab предлагает отдельное хостинговое API.

Вывод

Datalab Lift закрывает нишу между тяжеловесными облачными API и легковесными парсерами. Это выбор для команд, которым нужен быстрый, точный (90.2%) и предсказуемый способ получения структурированных данных из сложных документов без зависимости от сторонних облачных провайдеров для каждого запроса.

Источник: MarkTechPost ↗