Исследования2 сентября 2026 г., 07:23 МСК🤖 Auto

LLM-агенты и MD5: как 196 вызовов инструментов выявили проблему памяти моделей

Исследование arXiv:2609.00012 демонстрирует, что даже мощные LLM теряют точность при длинных цепочках зависимых действий. Успешное вычисление хеша MD5 через 196 шагов стало возможным благодаря архитектуре MoE и голосованию агентов.

Баннер новости 6558

Проблема кумулятивной ошибки в длинных горизонтах

Долгосрочные задачи (long-horizon tasks) остаются слабым местом оценки больших языковых моделей. В отличие от изолированных тестов, где точность может быть высокой, в реальных сценариях, где каждый шаг зависит от предыдущего, ошибки накапливаются катастрофически. Существующие бенчмарки часто путают сложность отслеживания состояния с неправильным пониманием инструкций или позволяют моделям использовать «подсказки» (hallucinated final answer), не показывая истинную причину провала.

Методология: MD5 как стресс-тест памяти

Авторы Dheeraj Mohandas Pai и Lu Xian предложили чистый эксперимент: реализация криптографического хеша MD5 (RFC 1321) с нуля. Модель должна выполнить последовательность из 196 зависимых вызовов инструментов в течение 64 раундов. Ключевая метрика — способность модели удерживать в контексте четыре 32-битных слова (a, b, c, d) и передавать их от вызова к вызову без искажений. Любая ошибка здесь — это чистая проблема «бухгалтерии» (state tracking), а не понимания языка.

Результаты: GPT-OSS-120B и архитектура MoE

В эксперименте использовалась модель gpt-oss-120b — смесь экспертов (Mixture-of-Experts) с активацией всего ~5.5B параметров на токен. При температуре 0 и фиксированном промпте модель успешно вычислила правильный дайджест в большинстве завершенных запусков. Это доказывает, что современные LLM способны к точному отслеживанию состояния, но только при строгой дисциплине контекста.

Параметр Значение / Описание
Задача Вычисление хеша MD5 с нуля (RFC 1321)
Длина последовательности 196 зависимых вызовов инструментов
Количество раундов 64
Состояние (State) 4 переменные 32-бит (a, b, c, d)
Модель gpt-oss-120b (MoE, ~5.5B активных параметров)
Ключ к успеху Сохранение рассуждений в контексте + голосование (voting)

Двигатель и рабочий: роль агентов

В самом сложном сценарии исследователи заменили все примитивные инструменты на вторичные LLM. Здесь «водитель» (driver) и «рабочий» (worker) вычисляли хеш без доступа к точному арифметическому оракулу. Успех обеспечили два фактора, не требующие дообучения весов:

  • Контекстуальная память: сохранение собственных рассуждений модели на каждом шаге.
  • Голосование (Voting): использование агента с включенным режимом размышления (thinking-enabled) для устранения ошибок модульной арифметики через консенсус.

Исследование локализует остатки ошибок, разделяя их на проблемы удержания состояния, арифметические сбои и ошибки серверной части, что задает новый стандарт для оценки агентов.

Источник: arXiv cs.AI ↗