Проблема стоимости в LLM-агентах
Внедрение навыков (skills) в Large Language Model (LLM) для расширения их возможностей стало стандартом. Однако большинство существующих подходов фокусируются исключительно на повышении производительности, игнорируя экономическую эффективность. Агенты, действующие методом проб и ошибок, часто сталкиваются с дегенеративным поведением на длинных горизонтах планирования, что приводит к огромным затратам токенов и времени.
Решение: SpeedRunner
Команда исследователей во главе с Зикси Хуангом (Zixi Huang) предложила метод Programmatic Skill Learning. Идея заключается в том, что навыки следует рассматривать как программы. Агент SpeedRunner анализирует прошлые траектории выполнения задач, извлекает из них полезные последовательности действий и рефакторирует их в детерминированные программы.
Ключевое преимущество: выполнение программы не требует повторных запросов к LLM для каждого шага. Это позволяет надежно достигать целей без риска сбоев, характерных для стохастических моделей, и значительно снижает стоимость инференса.
Механика обучения без валидации
SpeedRunner обучается во время инференса (inference-time learning). Агент не требует переобучения на истории (replay) или наличия валидационных наборов данных. Он способен анализировать собственные прошлые траектории, извлекать из них сигнал и применять полученные «программы» для будущих задач. Это делает систему адаптивной к новым доменам с минимальными вычислительными накладными расходами.
Результаты тестирования
Эксперименты проводились в трех различных окружениях (embodied environments). SpeedRunner продемонстрировал лидерство по показателям обучения и снижения затрат, сохранив при этом устойчивость к сдвигу распределений (distribution shifts) и случайности среды.
| Метрика / Характеристика | SpeedRunner (Proposed) | Базовые LLM-агенты |
|---|---|---|
| Метод планирования | Детерминированные программы | Проб и ошибок (Trial & Error) |
| Стоимость инференса | Минимальная (после рефакторинга) | Высокая (многократные запросы) |
| Устойчивость к ошибкам | Высокая (детерминизм) | Низкая (риск дегенерации) |
| Обучение | На лету (inference-time) | Требует переобучения/промптов |
Почему это важно
Работа доказывает, что переход от стохастического генерирования действий к программному их выполнению — это не просто архитектурное изменение, а ключ к экономически viable (жизнеспособным) агентам. Для бизнеса это означает возможность масштабирования AI-ассистентов в сложных сценариях без экспоненциального роста счетов за API.
Источник: arXiv cs.CL ↗
