Проблема «черного ящика» в Multi-Agent системах
В современных мультисистемах на базе больших языковых моделей (LLM) агенты часто обмениваются не текстом, а непрерывными внутренними представлениями (латентными каналами). Интуитивно кажется, что более емкое представление гарантирует более качественную передачу информации. Однако авторы нового исследования с arXiv (2607.26773) доказывают обратное: высокая репрезентативная емкость не означает, что получатель использует релевантную для задачи информацию. Обычная метрика точности (end-task performance) скрывает истинную природу этого взаимодействия.
Методология: причинно-следственный аудит
Команда разработала метод «причинно-следственного аудита» (causal audit). Суть метода — контролируемая замена сообщений на границе между отправителем и получателем. Исследователи выделили четыре типа сообщений, чтобы измерить:
- Чувствительность получателя к наличию сообщения.
- Влияние идентичности отправителя.
- Ценность контента, специфичного для конкретного примера.
- Дополнительную ценность, которую может дать отдельный агент.
Результаты на Qwen3-4B и Qwen3-8B
Аудит был проведен на моделях Qwen3-4B и Qwen3-8B с использованием бенчмарков GSM8K, ARC-C и MATH-500. Результаты вскрыли парадоксальные эффекты, которые невозможно увидеть при простом подсчете правильных ответов. На датасете GSM8K модель Qwen3-4B демонстрирует общее падение производительности на 1.00 процентный пункт. Однако при декомпозиции выясняется, что это падение складывается из двух противоположных эффектов: -6.17 пункта за счет «чужого» примера и +5.17 пункта за счет специфичного контента. При этом на модели Qwen3-8B направления этих эффектов полностью инвертируются.
| Модель | Бенчмарк | Общий эффект | Вклад «чужого» примера | Вклад специфичного контента |
|---|---|---|---|---|
| Qwen3-4B | GSM8K | -1.00 п.п. | -6.17 п.п. | +5.17 п.п. |
| Qwen3-4B | MATH-500 | +15.00 п.п. | +8.33 п.п. | +6.67 п.п. |
| Qwen3-8B | GSM8K | Инверсия | Инверсия | Инверсия |
Почему это важно для индустрии
Сравнение самоподстановки (self-substitution) показало, что специфичный контент и ценность отдельного агента — это разные вещи. Главный вывод исследователей: агрегированная точность не позволяет понять, как именно латентное сообщение влияет на получателя. Без внедрения контролируемых сравнений сообщений оценка латентной коммуникации остается слепой. Индустрии необходимо перейти от простого мониторинга метрик к глубокому аудиту причинно-следственных связей в мультисистемах.
Источник: arXiv cs.AI ↗
