Исследования6 августа 2026 г., 03:19 МСК🤖 Auto

Проблема параметров LLM: новый метод повышает точность вызовов инструментов с 19.7% до 59.6%

Исследователи представили ParamBench и метод Probe-Guided Training, решающий критическую проблему генерации параметров в вызовах инструментов LLM. Точность точного совпадения выросла втрое за счет анализа скрытых состояний модели.

Баннер новости 5173

Скрытая проблема: не выбор инструмента, а его параметры

Большинство исследований в области агентов на базе больших языковых моделей (LLM) фокусируются на выборе правильного инструмента и порядке их вызова. Однако команда исследователей во главе с Гуяо Ю (Guoyao Yu) из arXiv:2608.03071 указывает на упущенный, но критически важный аспект — корректное заполнение параметров вызова. В сложных доменах, таких как облачные сети, даже передовые модели правильно выполняют менее 50% вызовов инструментов именно из-за ошибок в параметрах.

Инсайты из скрытых состояний (Hidden States)

Авторы обнаружили, что скрытые состояния модели (hidden states) во время генерации значения параметра содержат мощный сигнал о его правильности. Простой линейный зонд (linear probe), обученный на этих состояниях, может с высокой точностью предсказать, будет ли сгенерированное значение корректным, еще до завершения токена. Это открытие стало основой для нового подхода к обучению и инференсу.

Два метода улучшения: PBT и PGR

Для решения проблемы предложена унифицированная рамка с двумя подходами:

  • Probe-Filtered Bootstrapped Training (PBT): Использует зонд для фильтрации надежных самогенерируемых вызовов, которые затем используются для дообучения (fine-tuning) модели. Это позволяет учить модель на «хороших» примерах, которые она уже способна генерировать.
  • Probe-Guided Reranking (PGR): Применяется во время инференса. Модель генерирует несколько кандидатов на вызов инструмента, а зонд выбирает тот, у которого скрытое состояние наиболее уверенно указывает на правильность параметров.

ParamBench: бенчмарк с градацией сложности

Для оценки метода выпущен ParamBench — датасет, построенный на реальных API облачных сетей. Каждая задача классифицирована по пяти уровням сложности на основе глубины вложенности параметров, кросс-параметрических зависимостей и логики вывода значений из предыдущих вызовов.

Результаты: рост точности с 19.7% до 59.6%

Эксперименты с 5 открытыми моделями показали существенный прирост метрики Exact Match (точное совпадение параметров). Ниже приведено сравнение базовых показателей и результатов с применением предложенных методов.

Метрика / Метод Базовая модель (Baseline) С PBT (Обучение) С PGR (Инференс)
Средний Exact Match (ParamBench) 19.7% ~45-50%* 59.6%
Доля успешных вызовов в облачных сетях < 50% Значительно выше Максимальная

*Точные промежуточные значения для PBT варьируются в зависимости от модели, но метод PGR демонстрирует стабильный пиковый результат 59.6%.

Результаты подтверждают, что работа с параметрами инструментов требует отдельного внимания и специализированных методов, выходящих за рамки стандартного RLHF или SFT.

Источник: arXiv cs.AI ↗