Исследования3 сентября 2026 г., 04:17 МСК🤖 Auto

Resolution запускает команду Agent Foundations для теоретической безопасности ИИ

Бывшие исследователи MIRI во главе с Джереми Джилленом создают новую команду в Resolution для разработки фундаментальной теории понимания разума (Agent Foundations).

Баннер новости 6642

Новая команда и ключевые фигуры

Организация Resolution объявила о создании специализированной группы Agent Foundations. В состав команды вошли пять ведущих исследователей, ранее работавших в Институте исследований искусственного интеллекта (MIRI): Джереми Джиллен (Jeremy Gillen), Эбром Демски (Abram Demski), Сэм Эйзенштат (Sam Eisenstat), Скотт Гаррабрант (Scott Garrabrant) и Каарель Ханни (Kaarel Hänni). В ближайшее время планируется набор дополнительных опытных исследователей, а в будущем — стажеров и младших ученых.

Цель: теория для суперинтеллекта

Основная задача группы — создание новой теории для понимания разума. Авторы подчеркивают, что современные инженерные дисциплины умеют точно рассуждать о ненаблюдаемых сценариях, тогда как ИИ-индустрия лишена этой базовой способности. Agent Foundations призвана дать теоретическую базу для постановки точных вопросов о поведении ASI (Artificial Superintelligence) после обширного обучения, самоизменения и взаимодействия с другими агентами.

Текущие исследовательские направления

Команда фокусируется на вопросах, пересекающихся с философией, экономикой и математикой. Среди ключевых проектов:

  • Понимание концепций (Understanding concepts): развитие идей из работы Condensation.
  • Доверие и легитимность (Trust and Legitimacy): исследование, связанное с работами Meaning and Agency и Understanding Trust.
  • Основы теории игр: поиск более надежных математических фундаментов.

Связь с наследием MIRI

Новая команда намерена продолжить традиции, заложенные в MIRI. Исследователи ссылаются на такие концепции, как Factored Space Models, Logical Induction, UDT (Updateless Decision Theory), FDT (Functional Decision Theory), Reflective Oracles, Tiling Agents, Risks from Learned Optimization, Corrigibility, Cartesian Frames и Infra-Bayes. Базовым мотивационным документом называется работа Embedded Agency.

Стратегия и приоритеты

Джереми Джиллен отмечает, что работа над выравниванием (alignment) может стать бесполезной, если суперинтеллект будет создан слишком быстро. Поэтому он считает, что попытки замедлить гонку вооружений ИИ имеют более высокий приоритет, чем техническая безопасность. Однако команда продолжит работу над знаниями, необходимыми для выравнивания, параллельно пытаясь использовать ИИ для ускорения собственных исследований. При этом они подчеркивают, что их присоединение не является моральным одобрением всей деятельности Resolution, особенно в части автоматизации исследований, способных улучшить общие возможности ИИ.

Источник: LessWrong ↗