Исследования15 августа 2026 г., 03:18 МСК🤖 Auto

Агенты не чувствуют время: почему LLM систематически ошибаются в оценках сроков

Исследование MATS 10 показало, что современные AI-агенты (Claude, Codex) не способны адекватно оценивать собственное время выполнения задач, систематически завышая прогнозы в 3-6 раз из-за отсутствия внутренней «часовой» модели.

Баннер новости 5839

Суть проблемы: агенты живут в «вечном настоящем»

Исследователи из MATS 10 (Michael Ofengenden и Maksym Andriushchenko) провели серию экспериментов с CLI-агентами Claude Code и Codex, чтобы понять, могут ли они предсказывать, выполнять и ретроспективно оценивать свое реальное время работы (wall-clock runtime). Главный вывод: агенты не обладают осознанностью времени. Они не знают, сколько времени прошло, и не могут корректировать свои действия на основе дедлайнов, таких как «сделай это за 30 минут».

Агенты страдают от когнитивных искажений, похожих на человеческие: planning fallacy (недооценка сложности) и Vierordt’s law (завышение коротких промежутков). Вместо анализа конкретного контекста задачи они опираются на статистические приоры, выдавая усредненные ответы.

Ключевые метрики и цифры

Эксперименты проводились на наборах данных ProgramBench (200 задач) и собственном наборе AgentTime (235 задач из 18 бенчмарков). Результаты показали устойчивое завышение прогнозов:

  • ProgramBench: Агенты склонны предсказывать время около 1,5 часов для любых задач, независимо от их реальной сложности.
  • AgentTime: Агент Fable завышает оценку в 3 раза, а Sol — в 6 раз.
  • Ошибка масштабируется: Наибольшая погрешность наблюдается на коротких задачах. Точность прогнозов приближается к реальности только при длительности задач в несколько часов.

Влияние «хакинга» (Harness) на время работы

Время выполнения зависит не только от модели, но и от среды исполнения. Исследователи обнаружили, что Claude Code продолжает работу, пока не решит, что задача выполнена, тогда как Codex часто останавливается по таймеру. Это приводит к разнице в количестве итераций:

Модели GPT в среде Claude Code делают в среднем в 2,5 раза больше ходов (turns), чем в Codex, даже при схожей скорости генерации токенов (62 vs 81 tokens/s).

Ретроспективная оценка и зависимость от метаданных

Агенты не могут оценить время «задним числом» без внешних подсказок. При воспроизведении сессии через API-вызов (без доступа к внутреннему состоянию) точность оценок падает. Если убрать из транскрипта следы временных меток (timestamps), ошибка прогнозирования удваивается. Агенты коррелируют длину транскрипта с временем, но без явных временных маркеров они теряют ориентир.

Сравнительная таблица калибровки прогнозов

Ниже приведены данные по калибровке прогнозов времени для моделей Opus 4.8 и GPT-5.5 на наборе ProgramBench. Обратите внимание на разницу между средним прогнозом и фактическим временем:

Модель / Агент Среднее время выполнения (мин) Средний прогноз (мин) Коэффициент калибровки Compression Exponent
Claude (Opus 4.8) 85 99 1.16x 0.24
Codex (GPT-5.5) 17.5 72 4.12x 0.19

Примечание: Compression Exponent измеряет наклон в логарифмическом пространстве. Значение 1 означало бы идеальное предсказание, 0 — плоский прогноз. Оба агента показывают крайне низкие значения, подтверждая отсутствие чувствительности к длительности.

Почему это важно?

По мере роста возможностей агентов, метрики вроде кривых временных горизонтов METR (где frontier-модели решают 17-часовые задачи в 50% случаев) измеряют время только внешне. Для автономной работы агентам необходима калиброванная модель собственной темпоральности. Без понимания того, сколько времени осталось до дедлайна или исчерпания бюджета, агенты не могут принимать оптимальные политические решения, рискуя либо зависнуть на тривиальной задаче, либо бросить сложную слишком рано.

Источник: LessWrong ↗