Проблема «слепой» адаптации
Обычно LLM-агенты требуют примеров (few-shot), траекторий или обратной связи для настройки под конкретную среду. Существующие методы без привязки к задаче (task-agnostic) часто жестко фиксируют стратегию подготовки заранее. Авторы работы «Studying Without a Syllabus» (Vinay Samuel, Varun Ursekar и соавт.) предлагают более гибкий подход: система должна самостоятельно исследовать неизвестную среду в рамках ограниченного бюджета и создать переиспользуемые артефакты (индексы, скрипты, инструкции) для «замороженного» решателя (solver).
Экспериментальная проверка
Команда протестировала мета-агентов с архивом знаний и без него, сравнив их с фиксированными методами обработки корпусов. Тестирование проводилось на шести гетерогенных бенчмарках. Ключевая метрика — Avg@3 reward (средний результат лучших трех попыток). Результаты показали, что гибкий мета-агент демонстрирует лучшие показатели на пяти из шести тестовых наборов данных.
| Метод подготовки | Результат (Avg@3 Reward) | Комментарий |
|---|---|---|
| Meta-agent (с архивом) | Лидер на 5/6 бенчмарках | Наилучшая общая адаптивность |
| Fixed corpus processing | Лидер на 1/6 бенчмарках | Лучше на самых больших корпусах |
| Unaided meta-agent | Ниже среднего | Отсутствие архива снижает эффективность |
Парадокс бюджета и главный вывод
Исследование выявило важный инсайт: увеличение бюджета на «изучение» (study budget) не гарантирует улучшения итогового результата. Однако, даже при одинаковом финальном балле, агенты, прошедшие фазу предварительного изучения, требуют значительно меньшего количества сэмплов (попыток) на этапе тестирования. Это означает сдвиг вычислительной нагрузки: вместо множества дорогих итераций во время выполнения задачи, система тратит ресурсы на однократную подготовку, что делает процесс более эффективным в масштабе.
Значение для индустрии
Работа демонстрирует путь к созданию автономных AI-систем, способных к самообучению в новых доменах без человеческой разметки или примеров. Это критически важно для внедрения агентов в динамичные среды, где распределение задач заранее неизвестно, а стоимость ошибки высока.
Источник: arXiv cs.AI ↗
