Проблема: ИИ игнорирует видео в пользу текста
Исследователи выявили два критических недостатка современных мультимодальных агентов при работе с видеопотоками. Во-первых, модальная предвзятость (modality bias): агенты систематически избегают использования визуальных инструментов, предпочитая текстовый поиск. В тестах сильнейшие open-source модели вызывали визуальные инструменты лишь 0,10 раза на задачу, тогда как текстовый поиск срабатывал 1,27 раза. Во-вторых, утечка параметрических знаний (parametric knowledge leakage): модели решают задачи, полагаясь на внутреннюю память, а не на реальный поиск в сети. Например, GPT-5 достиг 57% точности, практически не вызывая никаких инструментов.
Решение: Декомпозиция восприятия и исследования
Команда представила Video-DeepResearch (Video-DR) — фреймворк с разделенным конвейером восприятия и исследования. Ключевая инновация — поэтапное разблокирование инструментов:
- Этап 1 (Визуальное заземление): Доступен только инструмент
select_crop_search. Агент обязан сканировать кадры, выделять области интереса и делать обратный поиск изображений. Текстовый поиск заблокирован, что исключает возможность «обмана» через текстовые запросы. - Этап 2 (Открытый веб-поиск): После сбора визуальных доказательств разблокируются инструменты
searchиvisitдля синтеза ответа на основе найденной информации.
Обучение проводилось в два этапа: сначала SFT (Supervised Fine-Tuning) для улучшения качества траекторий, затем GRPO (Group Relative Policy Optimization) для автономного исследования, что позволило агенту превзойти своего учителя по SFT.
Результаты: Open-source побеждает гигантов
Модель Video-DeepResearch-35B-A3B установила новый SOTA на бенчмарке Video-DR, показав 68,0% точности. Это на 5,0 процентных пункта выше, чем у Claude 4.5 Sonnet (63,0%), и значительно превосходит GPT-5 (57,0%) и Gemini 2.5 Pro (62,0%).
Сравнение производительности на бенчмарках Video-DR и VideoDR-Bench:
| Модель | Video-DR Acc. (%) | VideoDR-Bench Avg. (%) | Примечание |
|---|---|---|---|
| Video-DeepResearch-35B-A3B (Ours) | 68.0 | 64.0 | Новый SOTA |
| Claude-4.5-Sonnet | 63.0 | 59.0 | Проприетарный лидер (бывший) |
| Video-DeepResearch-30B-A3B (Ours) | 62.0 | 59.3 | Компактная версия |
| Gemini 2.5 Pro | 62.0 | 57.5 | — |
| GPT-5 | 57.0 | 52.5 | — |
| Qwen3.5-397B-A13B | 58.0 | 52.8 | Open-source (большая модель) |
Почему это важно
Результаты демонстрируют, что рецепт обучения важнее количества параметров. Базовая модель Qwen3.5-35B-A3B с улучшенным обучением подняла точность с 42,8% до 64,0% (+21,2 pp), что превышает разницу между моделями разных размеров. Кроме того, созданный датасет из 30 000 пар QA и 7 000 траекторий гарантирует, что задачи требуют как визуального анализа, так и внешнего поиска, закрывая лазейки для использования только внутренней памяти модели.
Бенчмарки
| Бенчмарк | Video-DeepResearch-35B-A3B | Claude-4.5-Sonnet | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|
| Video-DR | 68% | 63% | 57% | 62% |
| VideoDR-Bench | 64% | 59% | 52.5% | 57.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
