Исследования14 августа 2026 г., 04:17 МСК🤖 Auto

SHAPER: Эволюция агентов без дообучения моделей

Исследователи представили SHAPER — фреймворк для самосовершенствования роботизированных агентов, который оптимизирует навыки и контекст, не меняя веса базовой модели.

Баннер новости 5757

Парадигма Train-Free адаптации

Команда исследователей во главе с Пэйдонгом Вангом (Peidong Wang) представила методологию SHAPER (Skill-Harness Evolution for Embodied Agents). В отличие от традиционных подходов, требующих дорогостоящего дообучения (SFT) или обучения с подкреплением (RL), SHAPER оставляет параметры фундаментальной модели (LLM) полностью замороженными. Вместо этого система эволюционирует за счет оптимизации «непараметрической» оболочки: набора навыков, контекстных подсказок и кода интерфейса действий.

Механика: Модель как Планировщик и Оптимизатор

Ключевая инновация SHAPER заключается в двойной роли одной и той же замороженной модели. Она выступает в двух ипостасях:

  • Планировщик (Planner): Генерирует действия в новой среде на основе текущих навыков.
  • Оптимизатор (Optimizer): Анализирует результаты выполненных задач (rollouts) и самостоятельно улучшает внешние навыки и контекстный код, чтобы повысить эффективность в следующих итерациях.

Это позволяет обходить ограничения фиксированных интерфейсов роботов, где прямой доступ к API программирования может быть закрыт.

Результаты бенчмарков

Эффективность SHAPER была протестирована на двух сложных наборах данных: VLABench и ESI-Bench. Метод сравнивался с чистым выполнением (pure execution), дообучением с учителем (SFT) и методами масштабирования времени тестирования (test-time scaling), такими как голосование и отбор без верификатора. SHAPER продемонстрировал конкурентоспособные результаты, доказав, что оптимизация окружения так же важна, как и оптимизация весов модели.

Метрика / Аспект SHAPER (Предлагаемый метод) Базовые методы (Baseline)
Обновление весов модели Нет (Frozen) Да (SFT / RL)
Требования к данным Минимальные (только rollouts) Большие наборы данных для обучения
Адаптивность к интерфейсам Высокая (через эволюцию кода) Зависит от доступности API
Вычислительная стоимость Низкая (Train-free) Высокая (Требует GPU-кластеров)

Почему это важно

SHAPER открывает путь к созданию «самосовершенствующихся» агентов в условиях, где дообучение больших моделей невозможно или нежелательно. Это критически важно для промышленной робототехники и коммерческих приложений, где стоимость обучения модели может быть непомерно высокой, а доступ к «железу» строго регламентирован. Метод показывает, что интеллект агента можно повысить за счет улучшения его «опыта» и инструментов, а не только за счет увеличения размера нейросети.

Источник: arXiv cs.CL ↗