Исследования4 сентября 2026 г., 11:18 МСК🤖 Auto

NTEP-8B: Как заставить VLM-агентов не тратить инструменты впустую

Исследователи представили метод NTEP-R, который обучает агенты на базе VLM использовать инструменты только для сбора критически важных доказательств, повышая точность и эффективность.

Баннер новости 6758

Проблема: «Слепые» вызовы инструментов

Современные мультимодальные модели (VLM) часто сталкиваются с тупиком при сложных запросах, требующих детального визуального анализа или внешних знаний. Чтобы получить недостающие данные, агенты вызывают инструменты: поиск по изображениям, текстовый поиск или кадрирование. Однако существующие подходы обучения оценивают успех только по финальному ответу. Это приводит к двум критическим ошибкам:

  • Модели генерируют избыточные или нерелевантные вызовы инструментов, которые не собирают нужных доказательств.
  • Даже при правильном вызове модель часто не извлекает полезную информацию из полученных наблюдений (результатов работы инструмента).

Решение: NTEP и NTEP-R

Команда авторов предложила схему аннотации NTEP (Necessary Tool-Evidence Path), которая явно указывает, какие внешние доказательства необходимы для каждого запроса. На основе этого разработан механизм обучения NTEP-R (NTEP Reward). Он штрафует агента за отклонения от плана и поощряет за:

  1. Совпадение намерения до вызова инструмента с целью сбора необходимого доказательства.
  2. Совпадение информации, извлеченной из результата, с требуемым доказательством.

Дополнительно внедрен регуляризатор неповторяющихся целей, который наказывает за повторные вызовы инструментов для уже собранных данных.

Результаты: NTEP-8B против базовых моделей

Авторы протестировали свою 8-миллиардную модель (NTEP-8B) в единой среде с тремя типами инструментов. Сравнение показывает значительный прирост как в точности поиска, так и в эффективности использования ресурсов.

Метрика / Модель Описание Результат / Эффект
Точность поиска Ability to find correct answer Значительное улучшение на 7 бенчмарках
Эффективность инструментов Количество вызовов на решение Снижение избыточных вызовов (меньше «шума»)
Архитектура Размер модели 8B параметров (NTEP-8B)
Инструменты Типы используемых API Кадрирование, поиск по изображениям, текстовый поиск

Почему это важно

Работа демонстрирует, что гранулярный контроль за процессом сбора доказательств (tool-evidence path) критически важен для создания надежных агентов. Переход от оценки только финального ответа к контролю каждого шага получения данных позволяет создавать более экономичные и точные системы, способные решать задачи, требующие глубокого визуального анализа.

Источник: arXiv cs.AI ↗