Команда исследователей во главе с Юци Тангом (Yuqi Tang) из Университета Чжэцзяна представила SciToolAgent-Evo — архитектуру агента на базе больших языковых моделей (LLM), решающую критическую проблему статичности существующих решений. В отличие от традиционных агентов, ограниченных фиксированным набором инструментов, SciToolAgent-Evo работает в open-world сценариях, где требования к вычислениям и доступные инструменты постоянно меняются.
Механика самоэволюции
Ключевое отличие системы — использование онтологизированного графа инструментов и эволюционирующей памяти. Агент не просто ищет готовые решения, а формирует активные запросы на приобретение новых навыков. Для балансировки между исследованием новых возможностей (exploration) и использованием известных (exploitation) применяется алгоритм LinUCB (линейный Upper Confidence Bound). При обнаружении нового инструмента его научная онтология дополняется онлайн, обеспечивая бесшовную интеграцию в существующую базу знаний.
Новый бенчмарк OpenSciToolBench
Для оценки способности агента к обобщению авторы разработали OpenSciToolBench. Это первый открытый набор данных, содержащий 900 реалистичных задач, распределенных по четырем уровням сложности. Бенчмарк позволяет тестировать не только точность выполнения, но и скорость адаптации к новым вычислительным контекстам.
Результаты и значимость
Экстенсивные тесты показали, что SciToolAgent-Evo достигает state-of-the-art результатов в задачах динамического приобретения инструментов. Это открывает путь к созданию автономных научных ассистентов, способных работать в непредсказуемых исследовательских средах без постоянной дообучки со стороны человека.
| Характеристика | SciToolAgent-Evo | Традиционные LLM-агенты |
|---|---|---|
| Пространство инструментов | Динамическое (Open-World) | Статическое (Predefined) |
| Механизм обучения | Онлайн-онтологизация + LinUCB | Zero-shot / Few-shot prompting |
| Память | Эволюционирующая (опыт + навыки) | Контекстное окно / Краткосрочная память |
| Бенчмарк | OpenSciToolBench (900 задач, 4 уровня) | Standard benchmarks (MATH, GSM8K) |
Работа опубликована в arXiv (2607.28692) и находится на рецензировании. Авторы подчеркивают, что подход позволяет масштабировать научные открытия за счет автоматизации поиска и интеграции вычислительных методов.
Источник: arXiv cs.AI ↗
