ENPIRE: Замкнутый цикл обучения роботов без человека
Исследователи NVIDIA представили ENPIRE (Environment, Policy Improvement, Rollout, Evolution) — фреймворк, позволяющий физическим роботам проходить цикл автономного экспериментирования, аналогичный тому, что используют AI-агенты в цифровом пространстве. Система минимизирует участие человека, автоматически оценивая результаты и перезагружая сценарии.
Архитектура ENPIRE состоит из четырех модулей:
- Environment (EN): Автоматический сброс и верификация состояния среды.
- Policy Improvement (PI): Запуск уточнения политик управления.
- Rollout (R): Оценка политик с использованием одного или нескольких роботов параллельно.
- Evolution (E): Агенты анализируют логи, консультируются с литературой и улучшают код инфраструктуры для устранения сбоев.
Железо и результаты: RTX 5090 и 99% успеха
Каждая рабочая станция оснащена двумя манипуляторами YAM (Yet Another Manipulator) от I2RT, камерами и рабочей станцией на базе NVIDIA RTX 5090. Система использует фронтальные AI-агенты для разработки политик управления.
На простых, но дexterous задачах система демонстрирует впечатляющие результаты:
| Задача | Результат | Примечание |
|---|---|---|
| PushT (манипуляция) | 99% успешных попыток | Сложная дexterous задача |
| Укладка штифтов | Высокая точность | Организация штифтов в коробку |
| Разрезание стяжки | Успешно | Использование режущего инструмента |
| Вставка GPU в материнскую плату | Тестирование | Имитация сборки ПК |
Ключевым фактором успеха стала автоматизация оценки результатов и сброса сцены, что исторически требовало значительных человеческих ресурсов. Однако масштабирование сталкивается с проблемами: при увеличении числа роботов снижается использование ресурсов (MRU), а GPU остаются загруженными не полностью из-за простоев при чтении логов и отладке.
Топ моделей для агентов: GPT-5.5 и Opus 4.7
В ходе тестов ENPIRE сравнивались различные языковые модели, используемые в качестве «мозга» для агентов. Выявлено, что модели GPT-5.5 (в среде Codex) и Opus 4.7 (в Claude Code) показывают наилучшие результаты, конкурируя между собой. Модель Kimi-2.6 отстает. Также подтверждена эффективность масштабирования: конфигурации с 8 агентами достигают более высоких показателей быстрее, чем одиночные агенты, благодаря более полному исследованию пространства решений.
Tencent ARGUS: Отладка кластера в 10 000 GPU
Параллельно Tencent опубликовала детали о ARGUS — системе трассировки и анализа в реальном времени для крупномасштабных задач обучения. ARGUS состоит из трех слоев: Python-слой для планирования, слой фреймворка для оркестрации и слой GPU-рантайма для выполнения ядер.
Система использовалась более шести месяцев на продакшн-кластере из 10 000+ GPU. Среди диагностируемых проблем:
- Вычислительные «узкие места» (stragglers).
- Деградация каналов связи.
- Усиление пузырей конвейера (pipeline bubble amplification).
Тencent применила ARGUS для отладки обучения модели HunyuanVideo на 4 096 GPU, аудио-модели на 512 GPU и MoE-модели Hunyuan LLM на 12 960 GPU. Наличие таких инструментов свидетельствует о зрелости инфраструктуры Tencent в области распределенного обучения.
Исторические уроки: почему прогнозы об ИИ часто ошибочны
В контексте этих технологических прорывов, профессор Юты Мэтью Токсон напоминает о хронической неспособности людей предсказывать последствия технологий. История полна примеров, когда скептики недооценивали потенциал инноваций (ядерный расщепление, интернет), а оптимисты переоценивали их социальные блага.
Основной вывод: ни слепой скептицизм, ни некритичный оптимизм не поддерживаются историей. Будущее ИИ, как и прошлое других технологий, будет сложным и неоднозначным, требуя от общества большей бдительности, чем привычной покорности или энтузиазму.
Источник: Import AI ↗
