Проблема «столкновения навыков» (Skill Collision)
В корпоративных AI-агентах, таких как чат-боты для групповой работы, пользовательские запросы маршрутизируются к специализированным «навыкам» (skills) на основе совпадения с их текстовыми описаниями. Когда описания двух навыков пересекаются, маршрутизирующая LLM ошибается, направляя запрос не туда. Это явление авторы называют skill collision. По мере масштабирования систем до десятков навыков ручная тонкая настройка описаний становится узким местом, требующим значительных инженерных ресурсов.
Результаты внедрения в продакшене
Команда разработала автоматизированный пайплайн оптимизации описаний и развернула его в рабочей среде корпоративного чат-бота. Система обрабатывала 9 навыков и 372 регрессионных кейса. Ключевые метрики эффективности:
- Точность (F1): Автоматически сгенерированные описания достигли среднего показателя 79.2%, что практически идентично результату ручной настройки (79.4%). Разница составляет всего -0.20%, что находится внутри порога шума многократных запусков (0.78%).
- Экономия времени: Время, необходимое инженеру на настройку одного навыка, сократилось с 120 минут до 3.8 минут. Это ускорение в 32 раза.
Главный инсайт: сила одного переписывания
Самое важное открытие исследования заключается в том, что сложность пайплайна не оправдана. Систематический анализ (ablation study) показал, что основной прирост точности дает одиночное переписывание описания навыка с помощью LLM, использующего примеры ложноположительных (false-positive) и ложноотрицательных (false-negative) срабатываний. Другие компоненты, такие как бюджет итераций, состав обратной связи, двойное редактирование пар навыков или размер обучающей выборки, влияли на итоговый F1 менее чем на 0.5%.
Диагностика архитектурных проблем
Авторы подчеркивают, что оптимизация текстовых описаний решает только проблемы нечеткости формулировок, но не может исправить ситуации, когда два навыка по своей сути имеют пересекающиеся области применения. Для выявления таких случаев предложен диагностический признак: большой разрыв между F1 на обучающей и валидационной выборках. Если этот разрыв велик, проблема лежит не в тексте, а в архитектуре системы, и требует архитектурных, а не текстовых изменений.
Валидация на ToolBench
Для подтверждения выводов результаты были воспроизведены на датасете ToolBench, содержащем 16 000 инструментов. Это подтвердило, что подход с одним переписыванием является универсальным решением для оптимизации маршрутизации в LLM-агентах, а не специфичным для одного продукта.
Источник: arXiv cs.CL ↗
