Исследования28 сентября 2026 г., 11:19 МСК🤖 Auto

Карта AI Safety: 58 направлений, 12 проблем и кризис распределения ресурсов

Исследователи из Safe AI Germany Incubator запустили интерактивную карту aisafetyagendas.com, систематизирующую 58 исследовательских повесток в области безопасности ИИ. Проект выявляет критические пробелы в метаресерче и призывает сообщество оценить

Баннер новости 8404

Систематизация хаоса: 12 проблем и 58 повесток

Команда разработчиков (Alicia Pallarol, Shaun Paul, Ihor Kendiukhov) создала интерактивную матрицу, где строки представляют 12 ключевых проблем в области выравнивания (alignment), а столбцы — исследовательские области. В центре находятся 58 конкретных исследовательских повесток (research agendas). Каждая ячейка показывает, сколько повесток нацелено на решение конкретной проблемы, а цвет индицирует их текущую зрелость. Проект создан как часть Safe AI Germany Incubator и позиционируется не как окончательный вердикт, а как инструмент для краудсорсинга мнений сообщества.

Проблема распределения ресурсов: «Мы не видим, куда идем»

Ключевой тезис работы — поле AI Safety не способно эффективно распределять ресурсы, потому что не имеет четкой карты текущего состояния. Цитируя Leech и Lynn, авторы отмечают: «Вы не можете оптимизировать распределение ресурсов, если не знаете, как оно выглядит сейчас». Исследование IAPS Expert Survey подтверждает, что фондеры и исследователи концентрируются на самых заметных направлениях, вытесняя менее очевидные, но критически важные работы. Глубокие разногласия между взглядами DeepMind, Anthropic и OpenAI на технические подходы к AGI-безопасности остаются вне публичного обсуждения, что создает риск работы врозь.

Три категории рисков на карте

На основе оценок (собственных авторов и сообщества) система классифицирует ячейки матрицы на три типа:

  • Easy to intervene (Легко вмешаться): Зрелые повестки, но требующие доработки. Пример: модельные организмы внутреннего выравнивания (inner alignment) имеют доказательство существования, но открытая репликация не дала полных результатов — следующий шаг — независимое воспроизведение.
  • Bottlenecks (Узкие места): Проблемы, от которых зависят многие области, но зрелость низка. Например, измерение выравнивания (P1) затрагивается 16 повестками, половина из которых не протестирована.
  • Underexplored (Недостаточно изучено): Ячейки с нулевым количеством повесток, где они необходимы. Пример: «резкий левый поворот» (sharp left turn, P3) затрагивается лишь 4 из 12 исследовательских областей.

Контекст: Разногласия лидеров индустрии

Авторы отмечают отсутствие единой системы сравнения. В апреле 2025 года DeepMind позиционировала свои взгляды ближе к Anthropic (с акцентом на robust training и мониторинг), противопоставляя их фокусу OpenAI на автоматизации исследований выравнивания. Подобные расхождения не анализируются в официальных каналах, что делает подобные карты, как aisafetyagendas.com, критически важными для выявления реальных «бутылочных горлышек» выживания человечества, а не просто модных тем.

Как это работает и зачем нужно

Платформа позволяет пользователям оценивать зрелость знакомых им направлений. Оценки агрегируются, позволяя видеть картину «лучшего», «среднего» и «худшего» сценариев. Цель — сделать мнение сообщества читаемым, выявить недоиндексированные области и дать метаресерчу единую структуру для аргументации. На данный момент карта содержит 58 повесток, но авторы призывают к масштабированию и критике самой структуры классификации.

Источник: LessWrong ↗