Прорыв в игре со скрытой информацией
Исследователи из MIT, Карнеги-Меллон, Нью-Йоркского и Стэнфордского университетов представили систему Ataraxos (от греч. «бесстрашие»), способную побеждать лучших человеческих игроков в настольной игре Stratego. В отличие от шахмат, где вся информация открыта, в Стратого идентичность 40 фигур противника скрыта до момента столкновения. Количество возможных конфигураций доски превышает 10^66, что делает задачу экспоненциально сложнее, чем в покере или шахматах.
Экономия ресурсов и новые метрики
Предыдущие попытки, такие как DeepNash от DeepMind, требовали миллионов долларов на обучение и не могли гарантировать победу над элитой. Ataraxos решает эту проблему за счет двух ключевых инноваций: эффективного алгоритма самоигры (self-play reinforcement learning) и планирования на этапе принятия решений (decision-time planning) с использованием генеративной модели. Это позволяет ИИ не перебирать все варианты, а оценивать наиболее вероятные состояния доски в реальном времени.
| Метрика | Ataraxos (MIT) | DeepNash (DeepMind) |
|---|---|---|
| Количество примеров самоигры | В 100 раз меньше | Базовый уровень |
| Количество партий самоигры | В 30 раз меньше | Базовый уровень |
| Результат против топ-игрока | 15-1-4 (победы-ничьи-поражения) | Недостаточно информации для сравнения |
| Результат на чемпионате мира | 39-2 против лучших игроков | Недостаточно информации для сравнения |
Универсальность и применение
Система показала обобщаемость, достигнув сверхчеловеческого уровня не только в классическом Стратого, но и в его вариациях (Barrage Stratego), а также в кооперативных играх с неполной информацией, таких как Hanabi и Dou dizhu. По словам старшего автора исследования Габриэле Фарина, такие алгоритмы критически важны для реальных задач, где невозможно перебрать все варианты: от кибербезопасности до военных маневров и бизнес-переговоров.
Психология против алгоритма
Ataraxos демонстрирует преимущество в расчете рисков. В отличие от людей, которые могут паниковать при потере ценных фигур, ИИ сохраняет «холодную голову», не давая противнику информации через эмоциональные реакции или ошибки. Исследование опубликовано в журнале Nature 30 сентября 2026 года.
Источник: MIT News AI ↗
