Исследования24 августа 2026 г., 08:17 МСК🤖 Auto

Ловушка контекста: как конкуренция токенов ломает выбор навыков в AI-агентах

Исследование Tinycloud показывает, что частичное раскрытие навыков в системном промпте снижает точность маршрутизации задач из-за лексической конкуренции, а не просто избытка информации.

Баннер новости 6359

Проблема масштабирования выбора навыков

В современных мультимодальных агентах, таких как Tinycloud, критическим узким местом является не только выполнение задачи, но и правильный выбор инструмента из растущей библиотеки. На малых масштабах LLM-планировщик выбирает навыки прямо в контексте (in-context), анализируя системный промпт. Однако по мере роста библиотеки возникает риск «перегрузки» внимания модели. Исследование Kevin Dela Rosa (принято на AgentSearch '26 в рамках SIGIR 2026) фокусируется на том, как именно представление навыков влияет на их обнаружение и маршрутизацию.

Архитектура навыков Tinycloud

Система использует два типа навыков, которые представлены в промпте по-разному:

  • Tool-skills (Инструментальные навыки): Обертки для внешних API или системных инструментов. Предоставляются в режиме автозагрузки (autoloaded) с полными инструкциями и скриптами.
  • Workflow-skills (Рабочие процессы): Оркестраторы, объединяющие вызовы tool-skills и рендеринг шаблонов для создания итогового результата. Предоставляются в виде однострочного списка для вызова по требованию (on-demand).

Результаты абляционного исследования

Авторы провели тестирование на шести задачах, сравнивая три режима экспозиции навыков в системном промпте. Ключевой вывод: больше информации в промпте не всегда означает лучшую работу. Частичное раскрытие создало эффект «лексической конкуренции», когда модель путала похожие термины.

Режим экспозиции Результат выбора (Gold Skill) Характер ошибок
All-on (Полная автозагрузка) 100% точность Ошибок нет. Модель всегда выбирает верный навык.
All-off (Отключено) Низкая эффективность Замедление выполнения и критические сбои обнаружения (hard discovery failures).
Default (Продакшн-режим) Ошибка маршрутизации Лексический сигнал одного из autoloaded tool-skill «перетянул» внимание модели, вызвав неверный выбор workflow-skill.

Почему это важно для индустрии

Главный инсайт исследования заключается в том, что экспозиция навыков в промпте не является монотонно полезной. В продакшн-режиме (Default) произошла ошибка, потому что лексическое сходство между инструментом и рабочим процессом создало шум. Это подтверждает гипотезу, что при масштабировании до сотен и тысяч навыков, простой in-context выбор становится ненадежным без механизмов явного поиска (embedding-based retrieval), так как модель теряет способность дифференцировать схожие по терминологии, но разные по функции сущности.

Источник: arXiv cs.AI ↗