Проблема: «Слепые» вызовы инструментов
Современные мультимодальные модели (VLM) часто сталкиваются с тупиком при сложных запросах, требующих детального визуального анализа или внешних знаний. Чтобы получить недостающие данные, агенты вызывают инструменты: поиск по изображениям, текстовый поиск или кадрирование. Однако существующие подходы обучения оценивают успех только по финальному ответу. Это приводит к двум критическим ошибкам:
- Модели генерируют избыточные или нерелевантные вызовы инструментов, которые не собирают нужных доказательств.
- Даже при правильном вызове модель часто не извлекает полезную информацию из полученных наблюдений (результатов работы инструмента).
Решение: NTEP и NTEP-R
Команда авторов предложила схему аннотации NTEP (Necessary Tool-Evidence Path), которая явно указывает, какие внешние доказательства необходимы для каждого запроса. На основе этого разработан механизм обучения NTEP-R (NTEP Reward). Он штрафует агента за отклонения от плана и поощряет за:
- Совпадение намерения до вызова инструмента с целью сбора необходимого доказательства.
- Совпадение информации, извлеченной из результата, с требуемым доказательством.
Дополнительно внедрен регуляризатор неповторяющихся целей, который наказывает за повторные вызовы инструментов для уже собранных данных.
Результаты: NTEP-8B против базовых моделей
Авторы протестировали свою 8-миллиардную модель (NTEP-8B) в единой среде с тремя типами инструментов. Сравнение показывает значительный прирост как в точности поиска, так и в эффективности использования ресурсов.
| Метрика / Модель | Описание | Результат / Эффект |
|---|---|---|
| Точность поиска | Ability to find correct answer | Значительное улучшение на 7 бенчмарках |
| Эффективность инструментов | Количество вызовов на решение | Снижение избыточных вызовов (меньше «шума») |
| Архитектура | Размер модели | 8B параметров (NTEP-8B) |
| Инструменты | Типы используемых API | Кадрирование, поиск по изображениям, текстовый поиск |
Почему это важно
Работа демонстрирует, что гранулярный контроль за процессом сбора доказательств (tool-evidence path) критически важен для создания надежных агентов. Переход от оценки только финального ответа к контролю каждого шага получения данных позволяет создавать более экономичные и точные системы, способные решать задачи, требующие глубокого визуального анализа.
Источник: arXiv cs.AI ↗
