Проблема кумулятивной ошибки в длинных горизонтах
Долгосрочные задачи (long-horizon tasks) остаются слабым местом оценки больших языковых моделей. В отличие от изолированных тестов, где точность может быть высокой, в реальных сценариях, где каждый шаг зависит от предыдущего, ошибки накапливаются катастрофически. Существующие бенчмарки часто путают сложность отслеживания состояния с неправильным пониманием инструкций или позволяют моделям использовать «подсказки» (hallucinated final answer), не показывая истинную причину провала.
Методология: MD5 как стресс-тест памяти
Авторы Dheeraj Mohandas Pai и Lu Xian предложили чистый эксперимент: реализация криптографического хеша MD5 (RFC 1321) с нуля. Модель должна выполнить последовательность из 196 зависимых вызовов инструментов в течение 64 раундов. Ключевая метрика — способность модели удерживать в контексте четыре 32-битных слова (a, b, c, d) и передавать их от вызова к вызову без искажений. Любая ошибка здесь — это чистая проблема «бухгалтерии» (state tracking), а не понимания языка.
Результаты: GPT-OSS-120B и архитектура MoE
В эксперименте использовалась модель gpt-oss-120b — смесь экспертов (Mixture-of-Experts) с активацией всего ~5.5B параметров на токен. При температуре 0 и фиксированном промпте модель успешно вычислила правильный дайджест в большинстве завершенных запусков. Это доказывает, что современные LLM способны к точному отслеживанию состояния, но только при строгой дисциплине контекста.
| Параметр | Значение / Описание |
|---|---|
| Задача | Вычисление хеша MD5 с нуля (RFC 1321) |
| Длина последовательности | 196 зависимых вызовов инструментов |
| Количество раундов | 64 |
| Состояние (State) | 4 переменные 32-бит (a, b, c, d) |
| Модель | gpt-oss-120b (MoE, ~5.5B активных параметров) |
| Ключ к успеху | Сохранение рассуждений в контексте + голосование (voting) |
Двигатель и рабочий: роль агентов
В самом сложном сценарии исследователи заменили все примитивные инструменты на вторичные LLM. Здесь «водитель» (driver) и «рабочий» (worker) вычисляли хеш без доступа к точному арифметическому оракулу. Успех обеспечили два фактора, не требующие дообучения весов:
- Контекстуальная память: сохранение собственных рассуждений модели на каждом шаге.
- Голосование (Voting): использование агента с включенным режимом размышления (thinking-enabled) для устранения ошибок модульной арифметики через консенсус.
Исследование локализует остатки ошибок, разделяя их на проблемы удержания состояния, арифметические сбои и ошибки серверной части, что задает новый стандарт для оценки агентов.
Источник: arXiv cs.AI ↗
