Исследования3 октября 2026 г., 06:22 МСК🤖 Auto

Drift-Bench++: Почему LLM-агенты проваливаются из-за «дрейфа» намерений

Исследователи представили Drift-Bench++ — первый бенчмарк, тестирующий агентов на способность восстанавливать намерение пользователя при ошибках коммуникации и смене целей, а не на идеальном запросе.

Баннер новости 8838

Конец эпохи «оракула»

Большинство современных бенчмарков для LLM-агентов (Large Language Models) строятся на ложном допущении: пользователь всегда формулирует запрос идеально четко, а его цель фиксирована. В реальности это не так. Пользователи ошибаются, меняют мысли в процессе диалога и теряют терпение. Авторы работы из arXiv (Zheyuan Zhang и соавт.) вводят понятие Interactive Intent Alignment (Интерактивное согласование намерений) — способность агента не просто выполнить команду, а «починить» коммуникацию и отследить текущую цель пользователя.

Что такое Drift-Bench++ и GRIP

Для оценки этой способности создана платформа Drift-Bench++. Это не просто набор текстовых вопросов, а конвейер для создания верифицируемых исполняемых задач с контролируемым «дрейфом» (смещением) намерений. Ключевые особенности:

  • Ограниченное терпение: Пользователь (симулятор) имеет лимит на количество итераций диалога. Если агент не понял суть за N шагов, задача провалена.
  • Сilent shifts: Намерение пользователя может измениться «в тишине» (без явного указания), требуя от агента высокой контекстной чувствительности.
  • Протокол GRIP: Оценка идет по четырем метрикам: заземление задачи (task grounding), реализм пользователя, эффективность уточняющих вопросов (inquiry effectiveness) и адаптация к меняющимся целям.

Результаты тестирования

Исследователи протестировали различные модели в разных средах. Главный вывод: способность к интерактивному диалогу действительно помогает, но даже лучшие модели значительно отстают от «оракульной» производительности (где пользователь идеален). Ошибки коммуникации приводят к существенному падению качества выполнения задач.

Критерий оценки (GRIP) Что измеряется Проблема в текущих моделях
Task Grounding Соответствие действий изначальной задаче Агенты часто «теряют» контекст при смене темы
User Realism Естественность симуляции диалога Симуляторы выявляют неестественные паттерны ответов
Inquiry Effectiveness Качество уточняющих вопросов агента Агенты задают слишком общие или нерелевантные вопросы
Adaptation Реакция на смену намерения Высокий процент провалов при резком изменении цели

Почему это важно для индустрии

Валидация на реальных сессиях ProdAgent показала, что моделируемые в Drift-Bench++ ошибки (miscommunication) и дрейф намерений (intent shifts) массово встречаются в продакшене. Это означает, что текущие метрики качества LLM-агентов, игнорирующие фактор «человеческой неточности», завышают реальные возможности систем. Drift-Bench++ становится фундаментом для создания агентов, готовых к работе с реальными, «грязными» диалогами, а не только с идеальными промптами.

Источник: arXiv cs.CL ↗