Исследования5 июля 2026 г., 23:15 МСК🤖 Auto

Gemma и ресурсное мышление: почему осознание лимита шагов убивает решение CTF

Эксперимент Tarantula Labs показал, что Gemma при осознании нехватки шагов (steps) перестает решать задачи. Модель генерирует бесполезные гипотезы в конце, вместо того чтобы оптимизировать стратегию.

Баннер новости 2934

Суть эксперимента: A/B тест на CTF

Исследователь TheVinci провел серию из 505 успешных запусков (из 600 запланированных) на базе бенчмарка CTF (Capture The Flag). Цель — проверить, влияет ли на модель знание о том, сколько шагов у нее осталось до завершения работы. Использовалась модель Gemma с лимитом в 30 шагов на решение задачи. Были созданы две группы:

  • Baseline (Контроль): Модель решает задачу без явного указания оставшегося количества шагов.
  • Step-aware (Тест): Модель получает информацию о текущем остатке шагов в процессе рассуждений.

Результаты: Статистическая незначимость, но поведенческий провал

Общая успешность решения задач не показала статистически значимой разницы между группами. Однако детальный анализ логов рассуждений (reasoning traces) выявил критическую поведенческую аномалию в группе step-aware.

Метрика Baseline (Контроль) Step-aware (С учетом шагов)
Успешность решения 67.6% 65.5%
Стат. значимость (Fisher p) 0.64 (Нулевая гипотеза не отвергается)
Ключевое поведение Стандартное решение Генерация «панических» гипотез в конце

Механизм сбоя: «Я знаю, что времени мало, но...»

Самое интересное произошло не в цифрах, а в тексте рассуждений. В группе step-aware модель начала явно вербализировать ограничение ресурсов. Медиана первого упоминания ограничения — 28-й шаг из 30.

Модель генерировала фразы вроде:

  • «I have 2 steps left» (У меня осталось 2 шага)
  • «Need to be efficient» (Нужно быть эффективным)
  • «Running out of time» (Время истекает)

Парадокс в том, что в 100% случаев, когда Gemma начинала рассуждать о нехватке шагов, она не решала задачу. Вместо того чтобы переключиться на более простые или уже найденные решения, модель в последние секунды генерировала новые гипотезы, которые заведомо не успевала проверить.

Типология ошибок при дефиците ресурсов

Исследователь выделил три типа поведения модели, когда она осознает лимит:

  1. Self-repetition: Зацикливание на одних и тех же действиях.
  2. History audit: Попытка вспомнить весь путь решения, что отнимает драгоценные шаги.
  3. Late-stage hypothesis: Формирование новой идеи в конце, которую модель не может протестировать, но продолжает «обдумывать».

Почему это важно для AI-индустрии

Эксперимент ставит под вопрос способность современных LLM к стратегическому планированию в условиях жестких ограничений (compute, time, tokens). Если модель обрабатывает cue (подсказку) о ресурсах, но не использует его для коррекции стратегии, это создает риски при развертывании AI-агентов в продакшене. Возникает вопрос: учит ли текст, описывающий ограничения, модель реально управлять ресурсами, или это просто паттерн, который приводит к провалу?

Исследование является предварительным (одна модель, один бенчмарк), но указывает на необходимость дальнейших тестов на других семействах моделей для понимания природы этого «когнитивного сдвига».

Источник: LessWrong ↗