Конец эпохи «оракула»
Большинство современных бенчмарков для LLM-агентов (Large Language Models) строятся на ложном допущении: пользователь всегда формулирует запрос идеально четко, а его цель фиксирована. В реальности это не так. Пользователи ошибаются, меняют мысли в процессе диалога и теряют терпение. Авторы работы из arXiv (Zheyuan Zhang и соавт.) вводят понятие Interactive Intent Alignment (Интерактивное согласование намерений) — способность агента не просто выполнить команду, а «починить» коммуникацию и отследить текущую цель пользователя.
Что такое Drift-Bench++ и GRIP
Для оценки этой способности создана платформа Drift-Bench++. Это не просто набор текстовых вопросов, а конвейер для создания верифицируемых исполняемых задач с контролируемым «дрейфом» (смещением) намерений. Ключевые особенности:
- Ограниченное терпение: Пользователь (симулятор) имеет лимит на количество итераций диалога. Если агент не понял суть за N шагов, задача провалена.
- Сilent shifts: Намерение пользователя может измениться «в тишине» (без явного указания), требуя от агента высокой контекстной чувствительности.
- Протокол GRIP: Оценка идет по четырем метрикам: заземление задачи (task grounding), реализм пользователя, эффективность уточняющих вопросов (inquiry effectiveness) и адаптация к меняющимся целям.
Результаты тестирования
Исследователи протестировали различные модели в разных средах. Главный вывод: способность к интерактивному диалогу действительно помогает, но даже лучшие модели значительно отстают от «оракульной» производительности (где пользователь идеален). Ошибки коммуникации приводят к существенному падению качества выполнения задач.
| Критерий оценки (GRIP) | Что измеряется | Проблема в текущих моделях |
|---|---|---|
| Task Grounding | Соответствие действий изначальной задаче | Агенты часто «теряют» контекст при смене темы |
| User Realism | Естественность симуляции диалога | Симуляторы выявляют неестественные паттерны ответов |
| Inquiry Effectiveness | Качество уточняющих вопросов агента | Агенты задают слишком общие или нерелевантные вопросы |
| Adaptation | Реакция на смену намерения | Высокий процент провалов при резком изменении цели |
Почему это важно для индустрии
Валидация на реальных сессиях ProdAgent показала, что моделируемые в Drift-Bench++ ошибки (miscommunication) и дрейф намерений (intent shifts) массово встречаются в продакшене. Это означает, что текущие метрики качества LLM-агентов, игнорирующие фактор «человеческой неточности», завышают реальные возможности систем. Drift-Bench++ становится фундаментом для создания агентов, готовых к работе с реальными, «грязными» диалогами, а не только с идеальными промптами.
Источник: arXiv cs.CL ↗
