Суть проекта: World Model на потребительском железе
Разработчик под псевдонимом stmonty опубликовал результаты обучения небольшой нейросети для игры в Pokémon Red. Ключевая особенность проекта — использование всего одной видеокарты NVIDIA RTX 3080 Ti и модели с всего 12.5 миллионами параметров. Архитектура базируется на концепции World Model (модель мира), исследованной в работе LeWorldModel, соавтором которой является известный ученый Ян ЛеКун (Yann LeCun). Подход демонстрирует, что сложные задачи планирования доступны даже на «домашнем» оборудовании без кластеров GPU.
Технические детали и обучение
Модель не просто предсказывает следующий кадр, а работает с сжатыми сводками (compressed summaries), состоящими из 192 чисел. Это позволяет ей понимать причинно-следственные связи между нажатиями кнопок и изменениями на экране, не перегружая вычислительные ресурсы. Обучение проходило в режиме без вознаграждения (reward-free) — ИИ не знал, что такое «победа», а лишь учился предсказывать состояние игры.
Для тренировки использовалось 42 382 кадра в оттенках серого, собранные за более чем 1000 коротких сессий из точки сохранения в лаборатории профессора Оука. Данные включали как скриптовые маршруты, так и случайные нажатия, чтобы модель не выучила только реакцию на диалоговые окна.
Результаты: От провалов к успеху
Первоначальные попытки провалились: ИИ не выбрал покемона. Разработчик объяснил это накоплением ошибок при предсказании, основанном на предыдущих предсказаниях. После тонкой настройки (fine-tuning) модель смогла выбрать стартового покемона. Сравнение эффективности выглядит следующим образом:
| Метод | Успешных попыток | Примечание |
|---|---|---|
| Случайные нажатия | 0 из 100+ | Полная неэффективность |
| Необученная модель | 1 из 100+ | Базовый уровень |
| Обученный AI (stmonty) | 52 из 100+ | Успешный выбор стартового покемона |
Планы и ограничения
Код проекта выложен в открытый доступ под названием lePokeRed на GitHub. Следующая цель разработчика — пройти полный диалог с профессором Оуком. Однако stmonty предупреждает, что сложность задачи растет экспоненциально с длиной плана. По его мнению, простое увеличение текущей модели не позволит ИИ пройти игру до конца, так как архитектура требует более глубокой оптимизации для долгосрочного планирования.
Источник: Tom's Hardware ↗
