Исследования14 августа 2026 г., 09:17 МСК🤖 Auto

Эффект насыщения: почему LLM ломаются при 5+ инструкциях

Исследование Mariya I. Vasileva выявило фазовый переход в работе LLM: при превышении порога в 5-6 одновременных инструкций вероятность успешного выполнения падает до нуля, даже если модель справляется с каждой инструкцией по отдельности.

Баннер новости 5775

Суть проблемы: композитное удовлетворение ограничений

Большие языковые модели (LLM) демонстрируют высокую точность при выполнении единичных задач, но их способность удерживать контекст множественных ограничений (структура, безопасность, схема вывода) резко деградирует. Автор исследования вводит метрику Constraint Saturation Evaluation (CSE) — бенчмарк, где количество одновременных инструкций ($k$) варьируется от 1 до 12. Тестирование охватило 15 моделей, 36 типов ограничений и 369 753 проверок с использованием детерминированных верификаторов, исключая субъективность LLM-судей.

Ключевые цифры: от 41% к 5.7%

Главный вывод исследования — нелинейное падение производительности. Если модель выполняет отдельные инструкции с вероятностью около 41% при $k=8$, то шанс выполнить все 8 инструкций одновременно составляет всего 5.7%. Это объясняется мультипликативным эффектом независимых ошибок: провал в одном элементе (например, неверный подсчет слов) разрушает все связанные с ним ограничения.

Структурные vs. лексические ограничения

Не все инструкции равнозначны. Исследование выявило «разрыв поддержания понимания» (comprehension-maintenance gap). Структурные ограничения (требующие длительного отслеживания контекста) теряют в 2 раза больше базовой способности при добавлении новых инструкций по сравнению с лексическими (бинарными решениями, не зависящими от композиции).

Параметр Значение / Наблюдение Значимость
Порог надежности 5-6 одновременных инструкций Точка, после которой надежное следование инструкциям ломается
Успех сильнейшей модели < 50% при 7 ограничениях Даже SOTA-модели не справляются с высокой сложностью
Успех большинства моделей < 50% при 3 или менее ограничениях (12 из 15) Критическая проблема для массовых LLM
Деградация структурных правил В 2x быстрее лексических Сложные форматы (JSON, схемы) требуют оптимизации

Почему это важно для индустрии

Результаты ставят под сомнение эффективность текущих подходов к промпт-инжинирингу при создании сложных агентов. Попытка загрузить в контекст более 5-6 разнородных требований приводит к фазовому переходу в хаос. Для разработчиков это означает необходимость внедрения модульных архитектур или явного разделения задач, так как «монолитные» промпты с множеством условий математически обречены на провал из-за накопления независимых ошибок.

Источник: arXiv cs.AI ↗