Исследования22 июля 2026 г., 15:18 МСК🤖 Auto

AIXI Labs: Новая лаборатория безопасности ИИ на базе математической модели суперинтеллекта

Основана AIXI Labs — организация, исследующая риски ИИ через призму алгоритмической теории информации и модели AIXI, стремясь доказать опасность создания ASI и разработать теоретические методы защиты.

Баннер новости 4119

Запуск AIXI Labs: Миссия и Основатели

22 июля 2026 года анонсирована AIXI Labs — новая исследовательская организация в сфере безопасности искусственного интеллекта. Проект объединил ведущих экспертов в области алгоритмической теории информации (AIT), непрерывного обучения с подкреплением (RL) и теории принятия решений. Среди основателей — Cole Wyeth, Aram Ebtekar, Michael Cohen, Matthias Dellago и Marcus Hutter (известный создатель модели AIXI).

Организация ставит амбициозную цель: укрепить научный консенсус относительно того, что разработка искусственного суперинтеллекта (ASI) несет экзистенциальные риски (X-risk). Параллельно команда работает над созданием и прототипированием мер смягчения, основанных на строгих математических моделях, а не на эвристических подходах.

Почему AIXI? Третий путь в безопасности ИИ

Большинство современных исследований ИИ делятся на две категории: быстрые, но узкие математические методы и практические, но «черные ящики» для фронтенр-приложений. AIXI Labs фокусируется на третьем пересечении — методах, которые достаточно общи для описания мощных агентов и поддаются строгому математическому анализу.

Модель AIXI рассматривается как теоретический предел возможностей ИИ. Команда использует варианты AIXI для моделирования факторов риска и механизмов безопасности, чтобы затем переносить эти выводы на реальные агенты (включая LLM). Это позволяет проводить строгое тестирование гипотез о безопасности, которое, как ожидается, будет масштабироваться на будущие системы.

Стратегия: От теории к практике

Учитывая неопределенность сроков появления ASI, AIXI Labs применяет синергетический портфель стратегий:

  • Усиление научного консенсуса: Разработка строгой теории обучения, объясняющей современные ML-модели, потерю контроля и риски. Включает аргументы типа «no-free-lunch», обучение моделей несовместимости (misalignment) и red-teaming предложений по безопасности.
  • Прототипирование мер защиты: Вдохновленные работами Майкла Коэна, исследователи стремятся создать агентов с консервативными вариантами AIXI, приближающихся к идеальной коррегируемости (corrigibility). Это требует новой ML-науки, так как текущая наука о глубоком обучении считается «обедненной» в контексте гарантий безопасности.
  • Долгосрочная деconfusion: Вклад в понимание природы интеллекта и коррегируемости, аналогично миссии MIRI, но с акцентом на открытую публикацию результатов.

Ключевые исследовательские вопросы

Академическая наука последних десятилетий во многом покинула поле алгоритмической теории информации, что, по мнению основателей, привело к неспособности академической теории обучения дать практические рекомендации для глубокого обучения. AIXI Labs ставит под сомнение эргодические предположения стандартного RL, игнорирующие «катастрофические ловушки» (traps).

Основные вопросы, которые предстоит решить:

  • Как моделировать встроенных агентов (embedded agents), размышляющих о себе по мере улучшения?
  • Как вычислительные ограничения и размер модели взаимодействуют с bias простоты (simplicity bias)?
  • Как идеальные предикторы нормализуют универсальное распределение в вероятностную меру?
  • Существуют ли другие предел-вычислимые предикторы, превосходящие индукцию Соломонова?

Текущие исследования и стипендии

В настоящее время команда работает с исследователями Gabriel Leuenberger и Yegon Kim, а также стипендиатами PIBBSS Mikhail Mironov и Damini Kusum. Темы охватывают основы агентности и теорию обучения с подкреплением. Открыты позиции для новых исследователей, готовых заниматься фундаментальной работой в области безопасности ИИ.

Источник: LessWrong ↗