Исследования1 июля 2026 г., 14:16 МСК🤖 Auto

HASTE: Иерархический ИИ-агент для ML-инжиниринга с 77.3% медалей

Исследователи представили HASTE — систему, которая накапливает навыки между соревнованиями, сокращая время на 52% и повышая эффективность использования токенов.

Баннер новости 2730

Проблема «холодного старта» в ML-инжиниринге

Автоматизированные агенты для машинного обучения (ML Engineering Agents) часто тратят вычислительные ресурсы впустую, переоткрывая уже известные решения. Каждое новое соревнование (например, на Kaggle) для них — это «холодный старт», где они не используют опыт, накопленный ранее. Исследователи Yongbin Kim, Yashar Talebirad и Osmar R. Zaiane предложили решение: HASTE (Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering) — иерархическую многоагентную систему, которая организует знания в три уровня: глобальный, доменный и специфичный для соревнования.

Архитектура и механизм работы

Система использует оркестратора, который координирует работу специалистов по доменам. Обучение переносится между уровнями через абстракции, генерируемые LLM. Ключевая инновация — «scoped loading» (выборочная загрузка навыков). Агенты загружают только те навыки, которые релевантны текущему уровню абстракции, вместо того чтобы обрабатывать весь массив знаний.

Результаты бенчмарка MLE-Bench Lite

Тестирование проводилось на базе 22 соревнований Kaggle. Система использовала модель Claude Sonnet 4.6 с лимитом 12 часов на соревнование. Результаты показали высокую эффективность как при холодном, так и при теплом старте:

Метрика Flat Loading (Плоская загрузка) Scoped Loading (HASTE) Без навыков (Baseline)
Доля медалей (Medal Rate) 62.5% 100% (при 159 навыках) 62.5%
Расход токенов
Сокращение итераций (Warm Start) 52% меньше
Доля принятых изменений 42% (при малом инвентаре) 85% (при 50+ навыках)

В общем зачете на полном наборе MLE-Bench Lite HASTE достигла 77.3% медалей. При этом использование «теплого старта» (перезагрузка навыков из предыдущих соревнований) позволило сократить количество итераций доработки на 52%. Доля изменений, которые агент саморецензирует и принимает как верные, выросла с 42% до 85% по мере накопления базы знаний (свыше 50 навыков).

Почему это важно

Результаты HASTE демонстрируют, что качество организации знаний может частично заменять силу модели и объем вычислений. Вместо того чтобы просто увеличивать бюджет на токены или использовать более мощные модели, система достигает лучших результатов за счет иерархической структуры памяти. Это открывает путь к созданию более экономичных и быстрых AI-инженеров, способных учиться на собственном опыте без необходимости полного переобучения для каждой новой задачи.

Работа принята к публикации на ICML 2026 Workshop on Deep Learning for Code (DL4C).

Источник: arXiv cs.AI ↗