Релиз модели10 августа 2026 г., 13:45 МСК🤖 Auto

Video-DeepResearch: 35B-модель бьет GPT-5 и Claude в анализе видео

Новая архитектура Video-DeepResearch решает проблему «лени» ИИ к визуальному поиску, достигая 68% точности на бенчмарке Video-DR и превосходя проприетарные модели GPT-5 и Gemini 2.5 Pro.

Баннер новости 5427

Проблема: ИИ игнорирует видео в пользу текста

Исследователи выявили два критических недостатка современных мультимодальных агентов при работе с видеопотоками. Во-первых, модальная предвзятость (modality bias): агенты систематически избегают использования визуальных инструментов, предпочитая текстовый поиск. В тестах сильнейшие open-source модели вызывали визуальные инструменты лишь 0,10 раза на задачу, тогда как текстовый поиск срабатывал 1,27 раза. Во-вторых, утечка параметрических знаний (parametric knowledge leakage): модели решают задачи, полагаясь на внутреннюю память, а не на реальный поиск в сети. Например, GPT-5 достиг 57% точности, практически не вызывая никаких инструментов.

Решение: Декомпозиция восприятия и исследования

Команда представила Video-DeepResearch (Video-DR) — фреймворк с разделенным конвейером восприятия и исследования. Ключевая инновация — поэтапное разблокирование инструментов:

  • Этап 1 (Визуальное заземление): Доступен только инструмент select_crop_search. Агент обязан сканировать кадры, выделять области интереса и делать обратный поиск изображений. Текстовый поиск заблокирован, что исключает возможность «обмана» через текстовые запросы.
  • Этап 2 (Открытый веб-поиск): После сбора визуальных доказательств разблокируются инструменты search и visit для синтеза ответа на основе найденной информации.

Обучение проводилось в два этапа: сначала SFT (Supervised Fine-Tuning) для улучшения качества траекторий, затем GRPO (Group Relative Policy Optimization) для автономного исследования, что позволило агенту превзойти своего учителя по SFT.

Результаты: Open-source побеждает гигантов

Модель Video-DeepResearch-35B-A3B установила новый SOTA на бенчмарке Video-DR, показав 68,0% точности. Это на 5,0 процентных пункта выше, чем у Claude 4.5 Sonnet (63,0%), и значительно превосходит GPT-5 (57,0%) и Gemini 2.5 Pro (62,0%).

Сравнение производительности на бенчмарках Video-DR и VideoDR-Bench:

Модель Video-DR Acc. (%) VideoDR-Bench Avg. (%) Примечание
Video-DeepResearch-35B-A3B (Ours) 68.0 64.0 Новый SOTA
Claude-4.5-Sonnet 63.0 59.0 Проприетарный лидер (бывший)
Video-DeepResearch-30B-A3B (Ours) 62.0 59.3 Компактная версия
Gemini 2.5 Pro 62.0 57.5
GPT-5 57.0 52.5
Qwen3.5-397B-A13B 58.0 52.8 Open-source (большая модель)

Почему это важно

Результаты демонстрируют, что рецепт обучения важнее количества параметров. Базовая модель Qwen3.5-35B-A3B с улучшенным обучением подняла точность с 42,8% до 64,0% (+21,2 pp), что превышает разницу между моделями разных размеров. Кроме того, созданный датасет из 30 000 пар QA и 7 000 траекторий гарантирует, что задачи требуют как визуального анализа, так и внешнего поиска, закрывая лазейки для использования только внутренней памяти модели.

Бенчмарки

БенчмаркVideo-DeepResearch-35B-A3BClaude-4.5-SonnetGPT-5Gemini 2.5 Pro
Video-DR68%63%57%62%
VideoDR-Bench64%59%52.5%57.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗