Проблема: инерция отмены ограничений
В многооборотных диалогах пользователи часто меняют требования, но современные LLM склонны игнорировать отмену ранее заданных ограничений. Автор называет это «поведенческим рецидивом» (behavioral relapse) или инерцией отмены. Модель может продолжать выполнять удаленное требование, даже если явно указано, что оно больше не действует. Существующие инструменты не измеряют влияние каждого отдельного ограничения и не могут восстановить контроль без дополнительных затрат.
Решение: Ledger, Probe и Ladder
Автор предлагает систему, работающую исключительно через API модели, состоящую из трех компонентов:
- Contract Ledger (Бухгалтерия контрактов): Каждое ограничение связывается с исполняемым чекером. Отмены записываются как «надгробия» (tombstones), а итоговое состояние спецификации компилируется заранее.
- Sequential Ablation Probe: Инструмент для измерения соблюдения каждого ограничения и его поведенческого эффекта.
- Repair Ladder (Лестница восстановления): Метод исправления состояния диалога с учетом лимитов по токенам и попыткам.
Ключевые метрики и результаты
Эксперименты проводились на наборе данных HumanEval с верифицированными чекерами. Результаты показывают, что проблема усугубляется с ростом нагрузки ограничений, особенно для моделей среднего размера (8B параметров). Однако предварительная компиляция спецификаций значительно снижает частоту рецидивов.
| Метрика / Параметр | Значение / Эффект | Примечание |
|---|---|---|
| Рост рецидива (8B модель) | Скачок с ScaleDelayedMTwo до ScaleDelayedMEight | При увеличении количества ограничений |
| Эффект компиляции (RestoreDiff) | Статистически значимое снижение | 95% доверительный интервал, p-значение указано в исследовании |
| Дополнительный эффект Ladder | Отсутствует | 95% CI исключает прирост ≥ LadderExcludedGain |
| Прогнозирование рецидива | AUROC AurocPrimary | Прогноз до отправки ответа модели |
| Восстановление через Tombstone | ~33% эффекта компиляции | Одно предложение об отмене работает лучше плацебо |
Практическая значимость
Исследование доказывает, что отказ от ограничений — это не просто «мертвый текст», а измеримое свойство состояния диалога. При накладных расходах на доставку CostDeliveryFactor и общих вычислительных затратах CostTotalHedged на каждый результат, разработчики могут внедрить механизмы контроля, которые делают поведение LLM предсказуемым и управляемым, а не случайным.
Источник: arXiv cs.AI ↗
