Исследования1 августа 2026 г., 06:16 МСК🤖 Auto

Казус латентных агентов: Qwen3-8B теряет смысл, а не точность

Исследование авторов Huixiang Zhang и Mahzabeen Emu доказывает, что в мультисистемах LLM полезность «общения» через скрытые векторы часто сводится к случайным артефактам, а не к передаче знаний.

Баннер новости 4862

Проблема «черного ящика» в Multi-Agent системах

В современных мультисистемах на базе больших языковых моделей (LLM) агенты часто обмениваются не текстом, а непрерывными внутренними представлениями (латентными каналами). Интуитивно кажется, что более емкое представление гарантирует более качественную передачу информации. Однако авторы нового исследования с arXiv (2607.26773) доказывают обратное: высокая репрезентативная емкость не означает, что получатель использует релевантную для задачи информацию. Обычная метрика точности (end-task performance) скрывает истинную природу этого взаимодействия.

Методология: причинно-следственный аудит

Команда разработала метод «причинно-следственного аудита» (causal audit). Суть метода — контролируемая замена сообщений на границе между отправителем и получателем. Исследователи выделили четыре типа сообщений, чтобы измерить:

  • Чувствительность получателя к наличию сообщения.
  • Влияние идентичности отправителя.
  • Ценность контента, специфичного для конкретного примера.
  • Дополнительную ценность, которую может дать отдельный агент.

Результаты на Qwen3-4B и Qwen3-8B

Аудит был проведен на моделях Qwen3-4B и Qwen3-8B с использованием бенчмарков GSM8K, ARC-C и MATH-500. Результаты вскрыли парадоксальные эффекты, которые невозможно увидеть при простом подсчете правильных ответов. На датасете GSM8K модель Qwen3-4B демонстрирует общее падение производительности на 1.00 процентный пункт. Однако при декомпозиции выясняется, что это падение складывается из двух противоположных эффектов: -6.17 пункта за счет «чужого» примера и +5.17 пункта за счет специфичного контента. При этом на модели Qwen3-8B направления этих эффектов полностью инвертируются.

Модель Бенчмарк Общий эффект Вклад «чужого» примера Вклад специфичного контента
Qwen3-4B GSM8K -1.00 п.п. -6.17 п.п. +5.17 п.п.
Qwen3-4B MATH-500 +15.00 п.п. +8.33 п.п. +6.67 п.п.
Qwen3-8B GSM8K Инверсия Инверсия Инверсия

Почему это важно для индустрии

Сравнение самоподстановки (self-substitution) показало, что специфичный контент и ценность отдельного агента — это разные вещи. Главный вывод исследователей: агрегированная точность не позволяет понять, как именно латентное сообщение влияет на получателя. Без внедрения контролируемых сравнений сообщений оценка латентной коммуникации остается слепой. Индустрии необходимо перейти от простого мониторинга метрик к глубокому аудиту причинно-следственных связей в мультисистемах.

Источник: arXiv cs.AI ↗