Проблема «сжатия» знаний
Обе системы, ACE (Agentic Context Engineering) и новая ALTK-Evolve от IBM Research, решают одну задачу: превращают неудачные попытки агента в полезные уроки без дообучения модели. Ключевое соглашение исследователей: нельзя сжимать опыт в краткие резюме. Вместо этого нужно хранить детализированные «уроки» (lessons) и опираться на их частоту появления (support count), а не на обобщения.
Разница кроется в архитектуре доставки: ACE генерирует единый эволюционирующий «плейбук» и подает его целиком на каждом шаге. ALTK-Evolve использует более гибкий подход, разделяя хранение и подачу контекста.
Архитектурные различия: Хранение vs Доставка
IBM выделяет два этапа работы с памятью, где кроется экономия ресурсов:
- Консолидация (Хранение): ALTK-Evolve группирует похожие уроки по эмбеддингам, сохраняя суммарный счетчик подтверждений. Это позволяет уменьшать объем хранилища без потери информации о надежности правила.
- Доставка (Инференс): В отличие от ACE, которая всегда шлет полный плейбук, ALTK-Evolve использует «регулятор». Для слабых моделей подается только ядро из самых надежных правил. Для сильных моделей — полный набор. Это предотвращает перегрузку контекстного окна.
Результаты на бенчмарке AppWorld
Сравнение проводилось на базе ReAct-агентов с использованием двух моделей: DeepSeek-V3.2 (сильная) и gpt-oss-120b (средняя/слабая). Метрики: TGC (Task Goal Completion) и SGC (Scenario Goal Completion). Результаты показывают радикальное снижение стоимости инференса при сохранении качества.
| Модель | Система | TGC / SGC | Токенов на задачу | Экономия против ACE |
|---|---|---|---|---|
| DeepSeek-V3.2 | ACE | 80.4 / 73.2 | 634K | — |
| DeepSeek-V3.2 | ALTK-Evolve | 89.3 / 80.4 | 263K | ~58% (в 2.4 раза меньше) |
| gpt-oss-120b | ACE | 54.8 / 35.7 | 777K | — |
| gpt-oss-120b | ALTK-Evolve | 56.0 / 37.5 | 116K | ~85% (в 6.7 раза меньше) |
Почему это важно для индустрии
На сильной модели DeepSeek-V3.2 ALTK-Evolve не только экономит токены, но и превосходит ACE по точности (89.3% против 80.4% по TGC). На более слабой модели gpt-oss-120b точность практически идентична (56.0% против 54.8%), что находится в пределах погрешности бенчмарка, но стоимость инференса падает в 6.7 раза.
Исследователи отмечают, что на сложных задачах (Hard tasks) кастомная доставка контекста ALTK-Evolve выигрывает за счет того, что модель не «тонет» в нерелевантных инструкциях, а получает только те правила, которые подтверждены опытом. Это делает систему масштабируемой: чем слабее модель, тем критичнее становится фильтрация контекста, и тем выше выигрыш ALTK-Evolve.
Где попробовать
Библиотека ALTK-Evolve уже доступна на Hugging Face. Она включает пайплайн извлечения, консолидации и выборки руководств. Полный технический отчет доступен по ссылке в исходном блоге IBM Research.
Источник: Hugging Face blog ↗
