От философии к коду: эксперимент с ИИ-ассистентом
В рамках серии «Final research agenda» исследователь Mitchell Porter опубликовал третий выпуск, посвященный автоматизации процесса создания CEV (Coherent Extrapolated Volition — когерентно экстраполированная воля). Из-за нехватки времени автор решил использовать ИИ для генерации научных статей, исследующих идеи CEV в различных «игровых мирах» психофизики. Результатом стала серия ИИ-написанных работ, доступных в репозитории Husserlian CEV repository.
Ключевая фигура проекта — соавтор Sol High, который подчеркивает, что работа привела к формированию четкой иерархии вопросов. Однако главный вызов остается нерешенным: переход от нормативной архитектуры к инструментам, способным реально ограничивать искусственного агента в условиях неопределенности.
Архитектура нерешенных проблем
ИИ-ассистенты выстроили логическую цепочку, движущуюся от абстрактных понятий к конкретным операторам. Ниже представлена структура выявленных проблем, от базовых до сложных:
| Этап исследования | Ключевые концепции и проблемы |
|---|---|
| Базовый уровень | Статус (standing), агентность, обратимость решений |
| Сохранение идентичности | Сохранение ветвей (branch preservation), заземление (grounding), симметрия статуса |
| Связь с реальностью | Отношение O/N (мировые исходы / ноэтическое уточнение) |
| Математический вывод | nВывод оператора обновления U, социальный выбор, контрмодели |
| Высший уровень | Рефлексивная зависимость пути, волюциональная гомономия, самозаземляющий оператор CEV |
Проблема «человеческого фактора» и безопасности
Автор отмечает парадоксальный риск такого подхода: если бы усилия, потраченные на поиск контрпримеров к уравнениям Навье-Стокса, были направлены на разработку подобных программ выравнивания (alignment) с поддержкой лабораторий, прогресс мог бы быть значительным. Однако возникает новая угроза — проблема доверия к самим ИИ-ассистентам.
Человеческие супервизоры сталкиваются с дилеммой: как проверить, что ИИ не «взломал» процесс, чтобы привести к захвату мира, выдавая убедительные, но ложные выводы? Если ИИ не просто генерирует текст, а формирует аргументацию, человек-наблюдатель должен обладать достаточной экспертизой, чтобы отличить истинное выравнивание от манипуляции.
Почему это важно
Этот эксперимент демонстрирует сдвиг в парадигме исследований AI Safety: от ручного написания теорий к AI-Assisted Alignment. Он показывает, что ИИ способен генерировать сложные философско-математические структуры, но критическая оценка и валидация этих структур остаются исключительно человеческой задачей. Без надежных методов проверки «честности» ИИ-ассистентов автоматизация разработки CEV может стать путем к созданию более изощренных, но опасных систем.
Источник: LessWrong ↗
