Исследования14 августа 2026 г., 03:17 МСК🤖 Auto

SpeedRunner: как программные навыки снижают стоимость LLM-агентов

Исследователи представили SpeedRunner — агента, который оптимизирует затраты на LLM за счет преобразования действий в детерминированные программы, исключая дорогостоящие ошибки.

Баннер новости 5756

Проблема стоимости в LLM-агентах

Внедрение навыков (skills) в Large Language Model (LLM) для расширения их возможностей стало стандартом. Однако большинство существующих подходов фокусируются исключительно на повышении производительности, игнорируя экономическую эффективность. Агенты, действующие методом проб и ошибок, часто сталкиваются с дегенеративным поведением на длинных горизонтах планирования, что приводит к огромным затратам токенов и времени.

Решение: SpeedRunner

Команда исследователей во главе с Зикси Хуангом (Zixi Huang) предложила метод Programmatic Skill Learning. Идея заключается в том, что навыки следует рассматривать как программы. Агент SpeedRunner анализирует прошлые траектории выполнения задач, извлекает из них полезные последовательности действий и рефакторирует их в детерминированные программы.

Ключевое преимущество: выполнение программы не требует повторных запросов к LLM для каждого шага. Это позволяет надежно достигать целей без риска сбоев, характерных для стохастических моделей, и значительно снижает стоимость инференса.

Механика обучения без валидации

SpeedRunner обучается во время инференса (inference-time learning). Агент не требует переобучения на истории (replay) или наличия валидационных наборов данных. Он способен анализировать собственные прошлые траектории, извлекать из них сигнал и применять полученные «программы» для будущих задач. Это делает систему адаптивной к новым доменам с минимальными вычислительными накладными расходами.

Результаты тестирования

Эксперименты проводились в трех различных окружениях (embodied environments). SpeedRunner продемонстрировал лидерство по показателям обучения и снижения затрат, сохранив при этом устойчивость к сдвигу распределений (distribution shifts) и случайности среды.

Метрика / Характеристика SpeedRunner (Proposed) Базовые LLM-агенты
Метод планирования Детерминированные программы Проб и ошибок (Trial & Error)
Стоимость инференса Минимальная (после рефакторинга) Высокая (многократные запросы)
Устойчивость к ошибкам Высокая (детерминизм) Низкая (риск дегенерации)
Обучение На лету (inference-time) Требует переобучения/промптов

Почему это важно

Работа доказывает, что переход от стохастического генерирования действий к программному их выполнению — это не просто архитектурное изменение, а ключ к экономически viable (жизнеспособным) агентам. Для бизнеса это означает возможность масштабирования AI-ассистентов в сложных сценариях без экспоненциального роста счетов за API.

Источник: arXiv cs.CL ↗