Проблема LLM-агентов: стоимость и стохастичность
Современные агенты на базе больших языковых моделей (LLM), такие как LATS (Language Agent Tree Search) и ReAct, демонстрируют хорошие результаты в многошаговом планировании. Однако их главный недостаток — высокая вычислительная стоимость и стохастичность поведения. Каждый шаг планирования требует обращения к LLM, что замедляет работу и делает результаты непредсказуемыми.
Решение: GATS с нулевыми вызовами LLM
Авторы Maureese Williams и Dymitr Nowicki предложили GATS (Graph-Augmented Tree Search) — фреймворк, сочетающий систематический поиск по дереву (UCB1) со слоистой моделью мира. Ключевое отличие: GATS делает 0 вызовов LLM во время планирования задачи, в отличие от 37 вызовов у LATS. Это обеспечивает детерминированные планы с нулевой дисперсией между запусками.
Архитектура слоистой модели мира
Эффективность GATS достигается за счет трехуровневой системы предсказаний:
- L1 (Символьный уровень): Точное сопоставление действий на основе символьной логики.
- L2 (Статистический уровень): Использование статистики, обученной на логах выполнения.
- L3 (LLM-уровень): Прогнозирование для неизвестных действий (используется только для обучения модели, не во время инференса).
Результаты бенчмарков
На синтетических задачах с ветвлениями и тупиками, а также на комплексном стресс-тесте из 12 сценариев (кодинг, веб-навигация, долгосрочные задачи), GATS превзошел аналоги. В то время как LATS и ReAct теряют эффективность на сложных путях, GATS сохраняет стабильность.
| Метрика | GATS | LATS | ReAct |
|---|---|---|---|
| Успешность (синтетика) | 100% | 92% | 64% |
| Успешность (стресс-тест, 12 сценариев) | 100% | 88.9% | 23.9% |
| Вызовы LLM на задачу | 0 | 37 | Не указано (высокое) |
| Детерминированность | Да (0 дисперсии) | Нет (стохастично) | Нет (стохастично) |
Почему это важно
Результаты доказывают, что систематический поиск с предварительно обученными моделями мира может превосходить LLM-направляемое исследование. Для индустрии это означает путь к созданию дешевых, быстрых и надежных автономных агентов, не зависящих от дорогих API-запросов к LLM на каждом шаге.
Источник: arXiv cs.AI ↗
