Синдром бесконечных действий
Автономные агенты на базе больших языковых моделей (LLM) часто демонстрируют паттерн, авторы которого назвали LLM-паркинсонизмом. Это метафора для ситуации, когда модель продолжает генерировать действия, даже когда первоначальная цель уже достигнута. Результат — создание избыточной сложности, повторные проверки и «улучшения», не несущие ценности. Проблема кроется не в самом механизме next-token prediction, а в том, что одна и та же модель отвечает за генерацию действий, оценку прогресса и принятие решения о стопе, находясь в самоусиливающейся петле.
Архитектура GEC v0.2
Команда исследователей во главе с Дуншэном Сяо предложила решение — Global Executive Control (GEC) v0.2. Ключевое отличие заключается в разделении ответственности: архитектура отделяет генерацию действий от глобального управления проектом. GEC использует оценку неопределенности для контроля за объемом ресурсов, объемом кода и моментом завершения задачи, предотвращая дрейф (drift) до завершения.
Результаты бенчмарка
Эксперимент проводился на наборе из 24 000 эпизодов с жестким лимитом в 40 000 токенов. Сравнение показало, что доступ к множеству вариантов действий (candidate-set) дает основной прирост точности, а внедрение GEC сохраняет эту точность, радикально экономя ресурсы.
| Метрика | Базовая модель (1 кандидат) | Локальный контроль (набор кандидатов) | GEC v0.2 (с управлением) |
|---|---|---|---|
| Успешность (Hard-goal) | 67.42% | 96.53% | 96.57% |
| Среднее кол-во токенов | — | 19 782 | 12 574 |
| Токены до лимита (40k) | — | 16 136 | 13 114 |
Внедрение GEC позволило сократить среднее потребление токенов на 36,4% (с 19 782 до 12 574) и уменьшить использование ресурсов у потолка лимита на 18,7%. При этом архитектура полностью устранила измеренный дрейф до завершения и выдержала нагрузку от дополнительных 500 синтетических токенов управления за цикл.
Значение для индустрии
Результаты подтверждают, что явное управление_scope_, доказательствами и ресурсами критически важно для автономных агентов. Хотя механистические симуляции успешны, авторы отмечают необходимость валидации на живых моделях для окончательного подтверждения эффективности в реальных сценариях.
Источник: arXiv cs.AI ↗
