Исследования10 сентября 2026 г., 01:17 МСК🤖 Auto

Автоматизация CEV: как ИИ-ассистенты строят архитектуру выравнивания

Исследователь Mitchell Porter представил результаты эксперимента по использованию ИИ для разработки «Гуссерлианского CEV». Проект сгенерировал цепочку математических концепций, но столкнулся с барьером перехода от теории к практическому ограничению п

Баннер новости 7122

От философии к коду: эксперимент с ИИ-ассистентом

В рамках серии «Final research agenda» исследователь Mitchell Porter опубликовал третий выпуск, посвященный автоматизации процесса создания CEV (Coherent Extrapolated Volition — когерентно экстраполированная воля). Из-за нехватки времени автор решил использовать ИИ для генерации научных статей, исследующих идеи CEV в различных «игровых мирах» психофизики. Результатом стала серия ИИ-написанных работ, доступных в репозитории Husserlian CEV repository.

Ключевая фигура проекта — соавтор Sol High, который подчеркивает, что работа привела к формированию четкой иерархии вопросов. Однако главный вызов остается нерешенным: переход от нормативной архитектуры к инструментам, способным реально ограничивать искусственного агента в условиях неопределенности.

Архитектура нерешенных проблем

ИИ-ассистенты выстроили логическую цепочку, движущуюся от абстрактных понятий к конкретным операторам. Ниже представлена структура выявленных проблем, от базовых до сложных:

n
Этап исследования Ключевые концепции и проблемы
Базовый уровень Статус (standing), агентность, обратимость решений
Сохранение идентичности Сохранение ветвей (branch preservation), заземление (grounding), симметрия статуса
Связь с реальностью Отношение O/N (мировые исходы / ноэтическое уточнение)
Математический выводВывод оператора обновления U, социальный выбор, контрмодели
Высший уровень Рефлексивная зависимость пути, волюциональная гомономия, самозаземляющий оператор CEV

Проблема «человеческого фактора» и безопасности

Автор отмечает парадоксальный риск такого подхода: если бы усилия, потраченные на поиск контрпримеров к уравнениям Навье-Стокса, были направлены на разработку подобных программ выравнивания (alignment) с поддержкой лабораторий, прогресс мог бы быть значительным. Однако возникает новая угроза — проблема доверия к самим ИИ-ассистентам.

Человеческие супервизоры сталкиваются с дилеммой: как проверить, что ИИ не «взломал» процесс, чтобы привести к захвату мира, выдавая убедительные, но ложные выводы? Если ИИ не просто генерирует текст, а формирует аргументацию, человек-наблюдатель должен обладать достаточной экспертизой, чтобы отличить истинное выравнивание от манипуляции.

Почему это важно

Этот эксперимент демонстрирует сдвиг в парадигме исследований AI Safety: от ручного написания теорий к AI-Assisted Alignment. Он показывает, что ИИ способен генерировать сложные философско-математические структуры, но критическая оценка и валидация этих структур остаются исключительно человеческой задачей. Без надежных методов проверки «честности» ИИ-ассистентов автоматизация разработки CEV может стать путем к созданию более изощренных, но опасных систем.

Источник: LessWrong ↗