Исследования30 сентября 2026 г., 15:19 МСК🤖 Auto

Игрок на RTX 3080 Ti обучил AI играть в Pokémon Red

Разработчик stmonty успешно обучил компактную нейросеть (12.5 млн параметров) на одной игровой видеокарте выбирать стартового покемона, используя архитектуру World Model от Яна Лекуна.

Баннер новости 8601

Суть проекта: World Model на потребительском железе

Разработчик под псевдонимом stmonty опубликовал результаты обучения небольшой нейросети для игры в Pokémon Red. Ключевая особенность проекта — использование всего одной видеокарты NVIDIA RTX 3080 Ti и модели с всего 12.5 миллионами параметров. Архитектура базируется на концепции World Model (модель мира), исследованной в работе LeWorldModel, соавтором которой является известный ученый Ян ЛеКун (Yann LeCun). Подход демонстрирует, что сложные задачи планирования доступны даже на «домашнем» оборудовании без кластеров GPU.

Технические детали и обучение

Модель не просто предсказывает следующий кадр, а работает с сжатыми сводками (compressed summaries), состоящими из 192 чисел. Это позволяет ей понимать причинно-следственные связи между нажатиями кнопок и изменениями на экране, не перегружая вычислительные ресурсы. Обучение проходило в режиме без вознаграждения (reward-free) — ИИ не знал, что такое «победа», а лишь учился предсказывать состояние игры.

Для тренировки использовалось 42 382 кадра в оттенках серого, собранные за более чем 1000 коротких сессий из точки сохранения в лаборатории профессора Оука. Данные включали как скриптовые маршруты, так и случайные нажатия, чтобы модель не выучила только реакцию на диалоговые окна.

Результаты: От провалов к успеху

Первоначальные попытки провалились: ИИ не выбрал покемона. Разработчик объяснил это накоплением ошибок при предсказании, основанном на предыдущих предсказаниях. После тонкой настройки (fine-tuning) модель смогла выбрать стартового покемона. Сравнение эффективности выглядит следующим образом:

Метод Успешных попыток Примечание
Случайные нажатия 0 из 100+ Полная неэффективность
Необученная модель 1 из 100+ Базовый уровень
Обученный AI (stmonty) 52 из 100+ Успешный выбор стартового покемона

Планы и ограничения

Код проекта выложен в открытый доступ под названием lePokeRed на GitHub. Следующая цель разработчика — пройти полный диалог с профессором Оуком. Однако stmonty предупреждает, что сложность задачи растет экспоненциально с длиной плана. По его мнению, простое увеличение текущей модели не позволит ИИ пройти игру до конца, так как архитектура требует более глубокой оптимизации для долгосрочного планирования.

Источник: Tom's Hardware ↗