Прорыв в one-shot обучении
Команда Generalist представила модель GEN-1.5 — первую в своем классе систему, способную к широкому обобщению физических навыков на основе всего одного демонстрационного примера (one-shot learning). В отличие от предыдущих подходов, требующих масштабного сбора данных или тонкой настройки, GEN-1.5 использует концепцию «физического промптинга» (physical prompting). Модель анализирует 3–12 секунд видео с демонстрацией задачи и немедленно начинает выполнять её, не требуя градиентных обновлений или переобучения.
Архитектура и технические характеристики
GEN-1.5 является крупной мультимодальной моделью, обрабатывающей видеовход (с окном памяти в 30 секунд), а также данные с датчиков, языковые команды и проприоцептивную информацию. На выходе система генерирует траектории действий с частотой 100 Гц. Ключевая особенность заключается в том, что эти способности возникли спонтанно в результате предобучения на больших объемах данных физического взаимодействия, без введения специальных архитектурных изменений или мета-обучающих циклов.
Результаты бенчмарков: One-Shot vs Few-Shot
Эксперименты проводились на 10 разнообразных задачах. Модель показала среднюю успешность 59% (±10% откл.) при обучении с одного примера. При использовании few-shot подхода (дообучение за 10 шагов градиентного спуска на 5 минутах данных, что эквивалентно ~50 демонстрациям), точность возрастает до 83% (±9% откл.).
Ниже приведено сравнение эффективности методов обучения для ключевых задач:
| Задача | Успешность (Few-Shot: 10 шагов) | Успешность (One-Shot: In-Context) |
|---|---|---|
| Retrieve money from purse | 83.3% | 60.7% |
| Twist lid off glass jar | 94.5% | 60.0% |
| Sweep trash with brush | 99.0% | 37.3% |
| Unzip pencil pouch | 86.0% | 55.5% |
| Flip phone upside down | 81.0% | 78.0% |
Уникальные способности: от симуляции до импровизации
GEN-1.5 демонстрирует несколько критически важных для робототехники свойств:
- Zero-Shot Sim-to-Real Transfer: Демонстрация, записанная в симуляции, может служить промптом для выполнения задачи в реальном мире, несмотря на то, что данные симуляции отсутствовали в наборе для предобучения.
- Compositional Generalization: Модель способна комбинировать два разных физических промпта в единую длинную траекторию действий.
- Human-to-Robot Imitation: Робот может воспроизвести задачу, если человек демонстрирует её своими руками в поле зрения камер робота.
- Импровизация: Система умеет использовать новые инструменты (например, щетку или совок) для решения задач, которые ранее решались другими методами, и работает обеими руками (амбидекстрально).
Значение для индустрии
Результаты GEN-1.5 закрывают пробел, существовавший десятилетиями: способность роботов к обобщению навыков из ограниченного числа примеров. Хотя текущие задачи относятся к категории коротких горизонтов, а показатели успешности modest, это первый случай, когда one-shot и few-shot обучение физических навыков проявились в масштабе. Это важный шаг к созданию «общего интеллекта» для физического мира, где роботы смогут быстро адаптироваться к новым условиям без длительной перенастройки.
Источник: Generalistai ↗
