Исследования14 августа 2026 г., 13:18 МСК🤖 Auto

Мертвый текст или договор? Как вернуть контроль над LLM в диалогах

Исследование Haoyuan Zhu выявило феномен «поведенческого рецидива» в черных ящиках LLM: модели игнорируют отмену ограничений. Предложенный метод компиляции спецификаций снижает этот эффект, делая диалог предсказуемым.

Баннер новости 5791

Проблема: инерция отмены ограничений

В многооборотных диалогах пользователи часто меняют требования, но современные LLM склонны игнорировать отмену ранее заданных ограничений. Автор называет это «поведенческим рецидивом» (behavioral relapse) или инерцией отмены. Модель может продолжать выполнять удаленное требование, даже если явно указано, что оно больше не действует. Существующие инструменты не измеряют влияние каждого отдельного ограничения и не могут восстановить контроль без дополнительных затрат.

Решение: Ledger, Probe и Ladder

Автор предлагает систему, работающую исключительно через API модели, состоящую из трех компонентов:

  • Contract Ledger (Бухгалтерия контрактов): Каждое ограничение связывается с исполняемым чекером. Отмены записываются как «надгробия» (tombstones), а итоговое состояние спецификации компилируется заранее.
  • Sequential Ablation Probe: Инструмент для измерения соблюдения каждого ограничения и его поведенческого эффекта.
  • Repair Ladder (Лестница восстановления): Метод исправления состояния диалога с учетом лимитов по токенам и попыткам.

Ключевые метрики и результаты

Эксперименты проводились на наборе данных HumanEval с верифицированными чекерами. Результаты показывают, что проблема усугубляется с ростом нагрузки ограничений, особенно для моделей среднего размера (8B параметров). Однако предварительная компиляция спецификаций значительно снижает частоту рецидивов.

Метрика / Параметр Значение / Эффект Примечание
Рост рецидива (8B модель) Скачок с ScaleDelayedMTwo до ScaleDelayedMEight При увеличении количества ограничений
Эффект компиляции (RestoreDiff) Статистически значимое снижение 95% доверительный интервал, p-значение указано в исследовании
Дополнительный эффект Ladder Отсутствует 95% CI исключает прирост ≥ LadderExcludedGain
Прогнозирование рецидива AUROC AurocPrimary Прогноз до отправки ответа модели
Восстановление через Tombstone ~33% эффекта компиляции Одно предложение об отмене работает лучше плацебо

Практическая значимость

Исследование доказывает, что отказ от ограничений — это не просто «мертвый текст», а измеримое свойство состояния диалога. При накладных расходах на доставку CostDeliveryFactor и общих вычислительных затратах CostTotalHedged на каждый результат, разработчики могут внедрить механизмы контроля, которые делают поведение LLM предсказуемым и управляемым, а не случайным.

Источник: arXiv cs.AI ↗