Исследования30 июля 2026 г., 19:00 МСК🤖 Auto

EvoLib от Microsoft: как ИИ учится на ошибках без переобучения

Исследователи Microsoft представили EvoLib — фреймворк, позволяющий LLM извлекать знания из собственного опыта во время инференса, эволюционируя от разрозненных воспоминаний к обобщенным навыкам.

Баннер новости 4734

От памяти к эволюционирующему знанию

Проблема современных AI-агентов заключается не в отсутствии памяти, а в неспособности эффективно использовать накопленный опыт. Традиционные системы просто архивируют прошлые диалоги и решения, что приводит к «шуму» и снижению релевантности. Microsoft Research предлагает решение EvoLib (Test-Time Learning with an Evolving Library), которое трансформирует сырой опыт в эволюционирующую библиотеку знаний.

В отличие от статического хранения, EvoLib извлекает из успешных решений повторно используемые навыки (skills), а из ошибок — рефлексивные инсайты. Эти единицы знания не просто копируются, а постоянно уточняются, консолидируются и перегруппировываются по мере поступления нового опыта, позволяя модели учиться без обновления весов самой нейросети.

Механизмы эволюции: консолидация и взвешивание

Архитектура EvoLib опирается на два ключевых процесса, имитирующих человеческое обучение:

  • Консолидация (Consolidation): При поступлении нового опыта система ищет схожие записи в библиотеке и объединяет их в более общие и абстрактные правила. Это позволяет навыкам становиться применимыми к широкому спектру задач, а не только к конкретным случаям.
  • Динамическое взвешивание (Weighting mechanism): Важность каждой единицы знания пересматривается на основе двух факторов: ее немедленной полезности для текущей задачи и потенциала для улучшения будущих результатов. Знания с наибольшим долгосрочным влиянием получают больший вес.

Результаты бенчмарков: эффективность вычислений

Фреймворк был протестирован на трех сложных типах задач: математическое рассуждение, написание кода с ограничениями по эффективности и долгосрочное взаимодействие с окружением. EvoLib демонстрирует превосходство над методами на основе простого поиска (retrieval-based) и другими абстрактными механизмами памяти, используя при этом меньше токенов.

Ключевая метрика — конвертация тестовых вычислений (test-time compute) в прирост производительности. Ниже приведено сравнение эффективности EvoLib с базовыми методами масштабирования вычислений:

Метрика / Характеристика EvoLib Традиционные методы (Memory/Compute Scaling)
Тип обучения Self-supervised, без ground-truth меток Статическое хранение или изолированное решение задач
Применимость к моделям Любые black-box LLM через API Часто требует дообучения или специфичных архитектур
Рост производительности Быстрый и стабильный при увеличении compute Плато или медленный рост, зависящий от объема данных
Устойчивость к порядку задач Высокая (robust to random task order) Чувствительность к последовательности поступления данных

Почему это важно для индустрии

Главное преимущество EvoLib — отсутствие необходимости в обновлении модели (no model updates). Это означает, что фреймворк можно внедрять в любые коммерческие LLM, работающие через API, прямо во время инференса. Для разработчиков AI-агентов это открывает путь к созданию систем, которые становятся умнее с каждым взаимодействием, накапливая «мудрость» вместо простого накопления «истории».

Код и результаты экспериментов уже доступны на GitHub, что позволяет исследователям проверить гипотезу о том, что будущее AI лежит не только в увеличении параметров, но и в качественной эволюции знаний.

Источник: Microsoft Research ↗