Парадигма Train-Free адаптации
Команда исследователей во главе с Пэйдонгом Вангом (Peidong Wang) представила методологию SHAPER (Skill-Harness Evolution for Embodied Agents). В отличие от традиционных подходов, требующих дорогостоящего дообучения (SFT) или обучения с подкреплением (RL), SHAPER оставляет параметры фундаментальной модели (LLM) полностью замороженными. Вместо этого система эволюционирует за счет оптимизации «непараметрической» оболочки: набора навыков, контекстных подсказок и кода интерфейса действий.
Механика: Модель как Планировщик и Оптимизатор
Ключевая инновация SHAPER заключается в двойной роли одной и той же замороженной модели. Она выступает в двух ипостасях:
- Планировщик (Planner): Генерирует действия в новой среде на основе текущих навыков.
- Оптимизатор (Optimizer): Анализирует результаты выполненных задач (rollouts) и самостоятельно улучшает внешние навыки и контекстный код, чтобы повысить эффективность в следующих итерациях.
Это позволяет обходить ограничения фиксированных интерфейсов роботов, где прямой доступ к API программирования может быть закрыт.
Результаты бенчмарков
Эффективность SHAPER была протестирована на двух сложных наборах данных: VLABench и ESI-Bench. Метод сравнивался с чистым выполнением (pure execution), дообучением с учителем (SFT) и методами масштабирования времени тестирования (test-time scaling), такими как голосование и отбор без верификатора. SHAPER продемонстрировал конкурентоспособные результаты, доказав, что оптимизация окружения так же важна, как и оптимизация весов модели.
| Метрика / Аспект | SHAPER (Предлагаемый метод) | Базовые методы (Baseline) |
|---|---|---|
| Обновление весов модели | Нет (Frozen) | Да (SFT / RL) |
| Требования к данным | Минимальные (только rollouts) | Большие наборы данных для обучения |
| Адаптивность к интерфейсам | Высокая (через эволюцию кода) | Зависит от доступности API |
| Вычислительная стоимость | Низкая (Train-free) | Высокая (Требует GPU-кластеров) |
Почему это важно
SHAPER открывает путь к созданию «самосовершенствующихся» агентов в условиях, где дообучение больших моделей невозможно или нежелательно. Это критически важно для промышленной робототехники и коммерческих приложений, где стоимость обучения модели может быть непомерно высокой, а доступ к «железу» строго регламентирован. Метод показывает, что интеллект агента можно повысить за счет улучшения его «опыта» и инструментов, а не только за счет увеличения размера нейросети.
Источник: arXiv cs.CL ↗
