Суть эксперимента: замкнутый цикл на малых данных
В статье arXiv:2609.17757 описан подход к обучению автономного вождения через имитационное обучение (behavioral cloning). Ключевая проблема, которую решает автор, — разрыв между офлайн-обучением на демонстрациях эксперта и закрытым циклом (closed-loop) во время развертывания, где каждое действие влияет на следующие наблюдения.
Модель использует историю из 5 кадров RGB-изображений, данные LiDAR, телеметрию автомобиля и путевые точки полосы для предсказания управления (газ, тормоз, руль) с частотой 20 Гц. Это позволяет модели реагировать на изменения среды в реальном времени, а не просто копировать траекторию.
Архитектура и данные
Автор разработал компактную мультимодальную политику, которая демонстрирует высокую эффективность при минимальном количестве параметров. Обучение проводилось на данных, собранных в три этапа, с использованием систематической процедуры генерации маршрутов, которая проверяла выполнимость маневров.
| Параметр | Значение / Характеристика |
|---|---|
| Количество параметров модели | 1.36 миллиона |
| Объем обучающей выборки | 236,882 временных окна |
| Длительность вождения в данных | ~3.3 часа |
| Количество захватов (captures) | 448 |
| Частота предсказания | 20 Гц |
| Входные данные | 5 кадров RGB, LiDAR, телеметрия, путевые точки |
Результаты: устойчивость и перенос
Проверка модели проводилась в симуляторе CARLA. Обученная политика смогла автономно водить в течение нескольких часов как на маршрутах из обучающей выборки, так и на новых, ранее не виденных трассах. Важным показателем стало отсутствие столкновений (collisions) в ходе тестовых запусков.
Также наблюдалась качественная передача навыков (transfer) на город CARLA с другой геометрией дорог, что говорит о способности модели обобщать знания, а не просто запоминать карту. Модель продемонстрировала способность восстанавливаться после крупных отклонений от траектории, хотя автор оговаривается, что систематическое восстановление без контролируемой оценки не гарантируется.
Открытость и репродуктивность
Исследование сопровождается полным пакетом для воспроизведения результатов: опубликован код, обученный чекпоинт, модель в формате ONNX, выборка данных и аудит доказательств (evidence audit). Это позволяет сообществу проверить заявленные метрики и использовать легковесную модель как базу для дальнейших исследований в области автономного вождения.
Источник: arXiv cs.AI ↗
