От пассивного чтения к активному поиску
Традиционные системы RAG (Retrieval-Augmented Generation) и агенты часто ограничены статическим индексом или замороженными промптами. Команда исследователей представила DocAtlas — систему, которая рассматривает понимание длинных документов как процесс поиска информации с изменяемым состоянием (mutable-state). Вместо того чтобы просто загружать весь текст, DocAtlas использует внешнюю среду — «документную упряжку» (document harness), которая управляет тем, какая информация ищется, читается, сохраняется и показывается модели на каждом шаге.
Ключевые метрики и бенчмарки
Главное достижение DocAtlas — способность эффективно работать в условиях жесткого ограничения контекстного окна, используя активную рабочую память. Система демонстрирует выдающиеся результаты на сложном датасете MMLongBench-Doc, который требует поиска и объединения доказательств из множества страниц, таблиц и графиков.
| Модель / Конфигурация | Результат (MMLongBench-Doc) | Примечание |
|---|---|---|
| DocAtlas + GPT-5.4 | 71.4% | Превосходит человеческий эталон (65.8%) |
| Qwen3.5-4B (с RL в DocAtlas) | 63.7% | Компактная модель, обученная end-to-end |
| Qwen3.5-4B (прямой ввод) | 54.4% | Базовая линия без DocAtlas |
Техническая реализация
DocAtlas внедряет четыре основных инструмента взаимодействия:
- Поиск (Search): Нахождение релевантных фрагментов.
- Чтение (Reading): Детальный анализ выбранных секций.
- Заметки (Note-taking): Фиксация ключевых доказательств.
- Обзор (Review): Проверка накопленной информации.
Система поддерживает как инференс с крупными мультимодальными языковыми моделями (VLM), так и сквозное обучение с подкреплением (end-to-end RL) для компактных агентов. Разница в 9.3% между обученной и базовой версией Qwen3.5-4B доказывает эффективность архитектуры «изменяемого состояния» для малых моделей.
Почему это важно
DocAtlas решает фундаментальную проблему масштабирования: как заставить модель «думать» над документом в 500+ страниц, не выходя за пределы контекстного окна. Переход от статического извлечения к динамическому, самообучающемуся процессу позволяет достигать точности выше уровня эксперта-человека, что критично для юридической, медицинской и научной аналитики.
Источник: arXiv cs.CL ↗
