Суть эксперимента: A/B тест на CTF
Исследователь TheVinci провел серию из 505 успешных запусков (из 600 запланированных) на базе бенчмарка CTF (Capture The Flag). Цель — проверить, влияет ли на модель знание о том, сколько шагов у нее осталось до завершения работы. Использовалась модель Gemma с лимитом в 30 шагов на решение задачи. Были созданы две группы:
- Baseline (Контроль): Модель решает задачу без явного указания оставшегося количества шагов.
- Step-aware (Тест): Модель получает информацию о текущем остатке шагов в процессе рассуждений.
Результаты: Статистическая незначимость, но поведенческий провал
Общая успешность решения задач не показала статистически значимой разницы между группами. Однако детальный анализ логов рассуждений (reasoning traces) выявил критическую поведенческую аномалию в группе step-aware.
| Метрика | Baseline (Контроль) | Step-aware (С учетом шагов) |
|---|---|---|
| Успешность решения | 67.6% | 65.5% |
| Стат. значимость (Fisher p) | 0.64 (Нулевая гипотеза не отвергается) | |
| Ключевое поведение | Стандартное решение | Генерация «панических» гипотез в конце |
Механизм сбоя: «Я знаю, что времени мало, но...»
Самое интересное произошло не в цифрах, а в тексте рассуждений. В группе step-aware модель начала явно вербализировать ограничение ресурсов. Медиана первого упоминания ограничения — 28-й шаг из 30.
Модель генерировала фразы вроде:
- «I have 2 steps left» (У меня осталось 2 шага)
- «Need to be efficient» (Нужно быть эффективным)
- «Running out of time» (Время истекает)
Парадокс в том, что в 100% случаев, когда Gemma начинала рассуждать о нехватке шагов, она не решала задачу. Вместо того чтобы переключиться на более простые или уже найденные решения, модель в последние секунды генерировала новые гипотезы, которые заведомо не успевала проверить.
Типология ошибок при дефиците ресурсов
Исследователь выделил три типа поведения модели, когда она осознает лимит:
- Self-repetition: Зацикливание на одних и тех же действиях.
- History audit: Попытка вспомнить весь путь решения, что отнимает драгоценные шаги.
- Late-stage hypothesis: Формирование новой идеи в конце, которую модель не может протестировать, но продолжает «обдумывать».
Почему это важно для AI-индустрии
Эксперимент ставит под вопрос способность современных LLM к стратегическому планированию в условиях жестких ограничений (compute, time, tokens). Если модель обрабатывает cue (подсказку) о ресурсах, но не использует его для коррекции стратегии, это создает риски при развертывании AI-агентов в продакшене. Возникает вопрос: учит ли текст, описывающий ограничения, модель реально управлять ресурсами, или это просто паттерн, который приводит к провалу?
Исследование является предварительным (одна модель, один бенчмарк), но указывает на необходимость дальнейших тестов на других семействах моделей для понимания природы этого «когнитивного сдвига».
Источник: LessWrong ↗
