Главный инсайт: память нужно калибровать, а не включать
В новой статье IBM Research исследователи анализируют эффективность ALTK-Evolve — системы, которая позволяет агентам учиться на собственном опыте без обновления весов модели. Суть метода: агент извлекает поведенческие гайдлайны (стратегии, ошибки, крайние случаи) из своих прошлых траекторий и подгружает их в контекст во время инференса.
Ключевой вывод исследования: агентская память — это не функция «вкл/выкл», а дозировка, которую нужно настраивать под конкретную модель. Исследователи протестировали 8 моделей, от 30B до проприетарных флагманов, и выделили три четких паттерна поведения.
Три патрона использования памяти
Результаты тестирования на бенчмарке AppWorld (585 многошаговых задач в симулированных приложениях: календари, платежи, мессенджеры) показали, что разные модели требуют разных стратегий подачи памяти:
- Сильные модели с запасом (Strong w/ headroom): Такие модели, как DeepSeek-V3.2 (671B MoE) и Claude Opus 4.6, выигрывают от подачи полного набора гайдлайнов. У них есть емкость, чтобы усвоить даже редкие кейсы. DeepSeek-V3.2 показал прирост +9.5pp в выполнении задач (TGC).
- Слабые/средние модели (Weak / selective): Большие наборы памяти «тонут» в контексте. Для них оптимальна кураторная выборка (curated retrieval): фиксированное ядро высоконадежных правил + подгрузка релевантных правил под конкретную задачу. gpt-oss-120b (117B MoE) здесь показал лучший результат: +16.1pp к точности.
- Насыщенные модели (Saturated): Модели вроде GLM-5 (745B MoE) не показали измеримого прироста. Они уже находятся на пределе своих возможностей на данных задачах, и дополнительные инструкции не помогают.
Точечная подгрузка: точнее и дешевле
Самая интригующая часть исследования касается стоимости. Полная подача всех гайдлайнов на каждом шаге ReAct сильно раздувает контекст. Однако стратегия curated retrieval (кураторная выборка) не только повышает точность для слабых моделей, но и минимизирует затраты.
Сравнение использования токенов и прироста точности:
| Модель | Стратегия | Прирост TGC | Прирост SGC | Накладные расходы (токены) |
|---|---|---|---|---|
| gpt-oss-120b (117B MoE) | Curated retrieval | +16.1pp | +16.1pp | +5% |
| gpt-oss-120b (117B MoE) | Full set | Меньше | Меньше | +51% |
| DeepSeek-V3.2 (671B MoE) | Full set | +9.5pp | +16.1pp | +78% |
| Claude Opus 4.6 | Full set | +4.1pp | +7.1pp | Информация недостаточна |
| GLM-5 (745B MoE) | Full set | 0.0pp | 0.0pp | Информация недостаточна |
Обратите внимание на метрику SGC (Scenario Goal Completion) — строгий показатель, требующий успешного прохождения всех вариантов сценария. Для DeepSeek-V3.2 прирост по SGC (+16.1pp) значительно выше, чем по базовому TGC (+9.5pp), что доказывает: хорошая память помогает агенту избегать ошибок в крайних случаях, а не просто усреднять результат.
Почему это важно для индустрии
Исследование IBM разрушает миф о том, что «больше контекста = лучше». Для production-систем это критично. Стратегия curated retrieval для моделей среднего класса (как gpt-oss-120b) дает максимальный прирост точности (+16.1pp) при минимальном увеличении стоимости (+5% токенов). Это делает ALTK-Evolve не просто академическим упражнением, а практическим инструментом для оптимизации затрат на LLM-агентов без потери качества.
Источник: Hugging Face blog ↗
