Проблема масштабирования выбора навыков
В современных мультимодальных агентах, таких как Tinycloud, критическим узким местом является не только выполнение задачи, но и правильный выбор инструмента из растущей библиотеки. На малых масштабах LLM-планировщик выбирает навыки прямо в контексте (in-context), анализируя системный промпт. Однако по мере роста библиотеки возникает риск «перегрузки» внимания модели. Исследование Kevin Dela Rosa (принято на AgentSearch '26 в рамках SIGIR 2026) фокусируется на том, как именно представление навыков влияет на их обнаружение и маршрутизацию.
Архитектура навыков Tinycloud
Система использует два типа навыков, которые представлены в промпте по-разному:
- Tool-skills (Инструментальные навыки): Обертки для внешних API или системных инструментов. Предоставляются в режиме автозагрузки (autoloaded) с полными инструкциями и скриптами.
- Workflow-skills (Рабочие процессы): Оркестраторы, объединяющие вызовы tool-skills и рендеринг шаблонов для создания итогового результата. Предоставляются в виде однострочного списка для вызова по требованию (on-demand).
Результаты абляционного исследования
Авторы провели тестирование на шести задачах, сравнивая три режима экспозиции навыков в системном промпте. Ключевой вывод: больше информации в промпте не всегда означает лучшую работу. Частичное раскрытие создало эффект «лексической конкуренции», когда модель путала похожие термины.
| Режим экспозиции | Результат выбора (Gold Skill) | Характер ошибок |
|---|---|---|
| All-on (Полная автозагрузка) | 100% точность | Ошибок нет. Модель всегда выбирает верный навык. |
| All-off (Отключено) | Низкая эффективность | Замедление выполнения и критические сбои обнаружения (hard discovery failures). |
| Default (Продакшн-режим) | Ошибка маршрутизации | Лексический сигнал одного из autoloaded tool-skill «перетянул» внимание модели, вызвав неверный выбор workflow-skill. |
Почему это важно для индустрии
Главный инсайт исследования заключается в том, что экспозиция навыков в промпте не является монотонно полезной. В продакшн-режиме (Default) произошла ошибка, потому что лексическое сходство между инструментом и рабочим процессом создало шум. Это подтверждает гипотезу, что при масштабировании до сотен и тысяч навыков, простой in-context выбор становится ненадежным без механизмов явного поиска (embedding-based retrieval), так как модель теряет способность дифференцировать схожие по терминологии, но разные по функции сущности.
Источник: arXiv cs.AI ↗
