Систематизация хаоса: 12 проблем и 58 повесток
Команда разработчиков (Alicia Pallarol, Shaun Paul, Ihor Kendiukhov) создала интерактивную матрицу, где строки представляют 12 ключевых проблем в области выравнивания (alignment), а столбцы — исследовательские области. В центре находятся 58 конкретных исследовательских повесток (research agendas). Каждая ячейка показывает, сколько повесток нацелено на решение конкретной проблемы, а цвет индицирует их текущую зрелость. Проект создан как часть Safe AI Germany Incubator и позиционируется не как окончательный вердикт, а как инструмент для краудсорсинга мнений сообщества.
Проблема распределения ресурсов: «Мы не видим, куда идем»
Ключевой тезис работы — поле AI Safety не способно эффективно распределять ресурсы, потому что не имеет четкой карты текущего состояния. Цитируя Leech и Lynn, авторы отмечают: «Вы не можете оптимизировать распределение ресурсов, если не знаете, как оно выглядит сейчас». Исследование IAPS Expert Survey подтверждает, что фондеры и исследователи концентрируются на самых заметных направлениях, вытесняя менее очевидные, но критически важные работы. Глубокие разногласия между взглядами DeepMind, Anthropic и OpenAI на технические подходы к AGI-безопасности остаются вне публичного обсуждения, что создает риск работы врозь.
Три категории рисков на карте
На основе оценок (собственных авторов и сообщества) система классифицирует ячейки матрицы на три типа:
- Easy to intervene (Легко вмешаться): Зрелые повестки, но требующие доработки. Пример: модельные организмы внутреннего выравнивания (inner alignment) имеют доказательство существования, но открытая репликация не дала полных результатов — следующий шаг — независимое воспроизведение.
- Bottlenecks (Узкие места): Проблемы, от которых зависят многие области, но зрелость низка. Например, измерение выравнивания (P1) затрагивается 16 повестками, половина из которых не протестирована.
- Underexplored (Недостаточно изучено): Ячейки с нулевым количеством повесток, где они необходимы. Пример: «резкий левый поворот» (sharp left turn, P3) затрагивается лишь 4 из 12 исследовательских областей.
Контекст: Разногласия лидеров индустрии
Авторы отмечают отсутствие единой системы сравнения. В апреле 2025 года DeepMind позиционировала свои взгляды ближе к Anthropic (с акцентом на robust training и мониторинг), противопоставляя их фокусу OpenAI на автоматизации исследований выравнивания. Подобные расхождения не анализируются в официальных каналах, что делает подобные карты, как aisafetyagendas.com, критически важными для выявления реальных «бутылочных горлышек» выживания человечества, а не просто модных тем.
Как это работает и зачем нужно
Платформа позволяет пользователям оценивать зрелость знакомых им направлений. Оценки агрегируются, позволяя видеть картину «лучшего», «среднего» и «худшего» сценариев. Цель — сделать мнение сообщества читаемым, выявить недоиндексированные области и дать метаресерчу единую структуру для аргументации. На данный момент карта содержит 58 повесток, но авторы призывают к масштабированию и критике самой структуры классификации.
Источник: LessWrong ↗
