Исследования13 июля 2026 г., 22:16 МСК🤖 Auto

MIT представила SceneSmith: AI-агенты создают 3D-сцены для обучения роботов

Исследователи MIT CSAIL и Toyota Research Institute разработали систему SceneSmith, использующую три AI-агента на базе GPT-5.2 для генерации фотореалистичных виртуальных сред. Это позволяет роботам тренироваться в тысячах уникальных сцен до выхода в

Баннер новости 3482

Решение проблемы нехватки данных для роботов

Основная проблема внедрения домашних и промышленных роботов — дефицит данных для обучения. Физическое обучение требует огромных затрат времени и ресурсов. Система SceneSmith от MIT CSAIL и Toyota Research Institute предлагает решение: создание богатых, детализированных 3D-симуляций, где роботы могут отрабатывать навыки (например, мытье посуды или навигацию) до физической активации. В отличие от старых симуляторов, SceneSmith генерирует сцены, которые визуально и физически близки к реальности.

Архитектура: три AI-агента и GPT-5.2

Система использует три специализированных агента, каждый из которых опирается на мультимодальную модель GPT-5.2. Эта модель обладает «пространственным знанием», полученным при обучении на интернет-данных. Процесс генерации сцены (кухни, отеля, гаража) проходит в три этапа:

  • Designer (Дизайнер): Генерирует базовые элементы сцены, расставляет мебель и объекты.
  • Critic (Критик): Оценивает реалистичность и практичность (например, убирает ванну из гостиной).
  • Orchestrator (Оркестратор): Координирует процесс, принимая решение о завершении сцены или возврате на доработку.

Агенты создают сцены, добавляя до 6 раз больше объектов на сцену по сравнению с предыдущими методами. Это позволяет роботам учиться манипулировать сложными объектами: открывать шкафы, перекладывать фрукты, перемещать банки.

Результаты тестирования и сравнение с аналогами

Исследователи протестировали систему, создав более 1300 уникальных сцен. Ключевые метрики эффективности:

  • Точность оценки: AI-агент критиковал планы действий робота. Человек согласился с вердиктами модели в 99% случаев, что позволяет отсеивать ошибки до физического тестирования.
  • Визуальная достоверность: В опросе более 200 пользователей SceneSmith признана более реалистичной в 90% случаев по сравнению с базовыми методами.
  • Функциональность: Система успешно генерирует «articulated items» (манипулируемые объекты, такие как двери шкафов), что ранее было редкостью.

Сравнение с существующими решениями

Характеристика SceneSmith (MIT/Toyota) Базовые методы (HSM, Holodeck)
Количество объектов на сцену До 6x больше Низкое
Наличие манипулируемых объектов Да (шкафы, ящики) Редко
Визуальная реалистичность (по отзывам) >90% положительных оценок Информация недостаточна
Скорость генерации одной сцены Несколько часов Быстрее (информация недостаточна)

Ограничения и будущее

Главный недостаток текущей версии — скорость. Генерация одной детализированной сцены занимает несколько часов из-за тщательного анализа каждого объекта. Исследователи планируют оптимизировать процесс за счет увеличения вычислительных мощностей и расширения функционала на деформируемые объекты (soft bodies). Система уже позволяет загружать готовые сцены в программное обеспечение для физической симуляции, экономя инженерам время на реальных тестах.

Источник: MIT News AI ↗