Исследования29 сентября 2026 г., 12:20 МСК🤖 Auto

LLM-паркинсонизм: как GEC-архитектура спасает агентов от бесконечных действий

Исследователи выявили феномен «LLM-паркинсонизма», при котором модели продолжают тратить токены после выполнения задачи. Новая архитектура GEC v0.2 снизила расход на 36,4% без потери точности.

Баннер новости 8500

Синдром бесконечных действий

Автономные агенты на базе больших языковых моделей (LLM) часто демонстрируют паттерн, авторы которого назвали LLM-паркинсонизмом. Это метафора для ситуации, когда модель продолжает генерировать действия, даже когда первоначальная цель уже достигнута. Результат — создание избыточной сложности, повторные проверки и «улучшения», не несущие ценности. Проблема кроется не в самом механизме next-token prediction, а в том, что одна и та же модель отвечает за генерацию действий, оценку прогресса и принятие решения о стопе, находясь в самоусиливающейся петле.

Архитектура GEC v0.2

Команда исследователей во главе с Дуншэном Сяо предложила решение — Global Executive Control (GEC) v0.2. Ключевое отличие заключается в разделении ответственности: архитектура отделяет генерацию действий от глобального управления проектом. GEC использует оценку неопределенности для контроля за объемом ресурсов, объемом кода и моментом завершения задачи, предотвращая дрейф (drift) до завершения.

Результаты бенчмарка

Эксперимент проводился на наборе из 24 000 эпизодов с жестким лимитом в 40 000 токенов. Сравнение показало, что доступ к множеству вариантов действий (candidate-set) дает основной прирост точности, а внедрение GEC сохраняет эту точность, радикально экономя ресурсы.

Метрика Базовая модель (1 кандидат) Локальный контроль (набор кандидатов) GEC v0.2 (с управлением)
Успешность (Hard-goal) 67.42% 96.53% 96.57%
Среднее кол-во токенов — 19 782 12 574
Токены до лимита (40k) — 16 136 13 114

Внедрение GEC позволило сократить среднее потребление токенов на 36,4% (с 19 782 до 12 574) и уменьшить использование ресурсов у потолка лимита на 18,7%. При этом архитектура полностью устранила измеренный дрейф до завершения и выдержала нагрузку от дополнительных 500 синтетических токенов управления за цикл.

Значение для индустрии

Результаты подтверждают, что явное управление_scope_, доказательствами и ресурсами критически важно для автономных агентов. Хотя механистические симуляции успешны, авторы отмечают необходимость валидации на живых моделях для окончательного подтверждения эффективности в реальных сценариях.

Источник: arXiv cs.AI ↗