Релиз модели11 августа 2026 г., 17:17 МСК🤖 Auto

IBM ALTK-Evolve: точная память агентов с расходом токенов в 7 раз ниже ACE

Исследователи IBM представили ALTK-Evolve — систему агентной памяти, которая достигает точности, сопоставимой с ACE, но использует на 40-85% меньше токенов за счет умной доставки контекста.

Баннер новости 5531

Проблема «сжатия» знаний

Обе системы, ACE (Agentic Context Engineering) и новая ALTK-Evolve от IBM Research, решают одну задачу: превращают неудачные попытки агента в полезные уроки без дообучения модели. Ключевое соглашение исследователей: нельзя сжимать опыт в краткие резюме. Вместо этого нужно хранить детализированные «уроки» (lessons) и опираться на их частоту появления (support count), а не на обобщения.

Разница кроется в архитектуре доставки: ACE генерирует единый эволюционирующий «плейбук» и подает его целиком на каждом шаге. ALTK-Evolve использует более гибкий подход, разделяя хранение и подачу контекста.

Архитектурные различия: Хранение vs Доставка

IBM выделяет два этапа работы с памятью, где кроется экономия ресурсов:

  • Консолидация (Хранение): ALTK-Evolve группирует похожие уроки по эмбеддингам, сохраняя суммарный счетчик подтверждений. Это позволяет уменьшать объем хранилища без потери информации о надежности правила.
  • Доставка (Инференс): В отличие от ACE, которая всегда шлет полный плейбук, ALTK-Evolve использует «регулятор». Для слабых моделей подается только ядро из самых надежных правил. Для сильных моделей — полный набор. Это предотвращает перегрузку контекстного окна.

Результаты на бенчмарке AppWorld

Сравнение проводилось на базе ReAct-агентов с использованием двух моделей: DeepSeek-V3.2 (сильная) и gpt-oss-120b (средняя/слабая). Метрики: TGC (Task Goal Completion) и SGC (Scenario Goal Completion). Результаты показывают радикальное снижение стоимости инференса при сохранении качества.

Модель Система TGC / SGC Токенов на задачу Экономия против ACE
DeepSeek-V3.2 ACE 80.4 / 73.2 634K
DeepSeek-V3.2 ALTK-Evolve 89.3 / 80.4 263K ~58% (в 2.4 раза меньше)
gpt-oss-120b ACE 54.8 / 35.7 777K
gpt-oss-120b ALTK-Evolve 56.0 / 37.5 116K ~85% (в 6.7 раза меньше)

Почему это важно для индустрии

На сильной модели DeepSeek-V3.2 ALTK-Evolve не только экономит токены, но и превосходит ACE по точности (89.3% против 80.4% по TGC). На более слабой модели gpt-oss-120b точность практически идентична (56.0% против 54.8%), что находится в пределах погрешности бенчмарка, но стоимость инференса падает в 6.7 раза.

Исследователи отмечают, что на сложных задачах (Hard tasks) кастомная доставка контекста ALTK-Evolve выигрывает за счет того, что модель не «тонет» в нерелевантных инструкциях, а получает только те правила, которые подтверждены опытом. Это делает систему масштабируемой: чем слабее модель, тем критичнее становится фильтрация контекста, и тем выше выигрыш ALTK-Evolve.

Где попробовать

Библиотека ALTK-Evolve уже доступна на Hugging Face. Она включает пайплайн извлечения, консолидации и выборки руководств. Полный технический отчет доступен по ссылке в исходном блоге IBM Research.

Источник: Hugging Face blog ↗