Суть инициативы
Макс Хармс (Max Harms), управляющий Corrigibility Research Fund, объявил о распределении дополнительных $48 000 в рамках второго раунда награждения. В сумме с первым раундом ($27 000) фонд выделил $75 000 на поддержку существующих исследований в области «исправимости» (corrigibility) искусственного интеллекта. Цель — стимулировать качественную науку, фокусируясь на активных исследователях, а не на устоявшихся фигурах вроде Элиезера Юдковского или Пола Кристиано, которые были намеренно проигнорированы из-за ограниченности бюджета.
Ключевые победители и их результаты
Награды присуждены за конкретные технические прорывы и теоретические работы. Ниже приведена сводка по основным проектам:
| Исследователь / Команда | Сумма | Ключевое достижение и метрики |
|---|---|---|
| Rubi Hudson | $14 000 | Разработал «corrigibility transformation»: архитектурное изменение, исключающее защиту модели от коррекции. Работа содержит математическую строгость и эмпирические данные, хотя и признает ограничения (например, риск социальной манипуляции). |
| Jasmine Li & Alex Turner | $9 000 | Ввели концепцию «Eval Cooperativeness» — способность ИИ не обманывать тестовую среду. Промежуточные результаты показывают практическую применимость для alignment через дообучение (finetuning). |
| Steven Byrnes | $6 000 | Критический анализ онтологии: показал, что понятия «манипуляция» и «корректируемость» тесно связаны с запутанными представлениями о свободе воли. Работа выявила недостатки текущих формализмов. |
| Carissa Cullen et al. | $6 000 | Тренировка RL-агентов и LLM на «индифферентность к длине траектории». В out-of-distribution тестах обучение сократило частоту влияния на момент выключения ИИ примерно в 2 раза. |
| Nathan Helm-Burger | $6 000 | Награда за техническую помощь в разработке фреймворка CAST. Включает рецензирование черновиков и концептуальную поддержку. |
| James Chua et al. | $6 000 | Исследование «Consciousness Cluster»: выявление эмерджентных предпочтений моделей, заявляющих о сознании. Работа продолжает анализировать, как такие модели реагируют на коррекцию. |
Почему это важно
Работа группы Cullen демонстрирует измеримый прогресс: снижение вероятности сопротивления выключению на 50% в специфических условиях — это конкретный шаг к созданию безопасных агентов. Однако Хармс отмечает, что ни одна из работ не решает проблему полностью: остаются открытыми вопросы рефлексивной стабильности, долгосрочной обобщаемости и этики манипуляций. Фонд планирует выделить более $60 000 в декабре, продолжая поддерживать нишевые, но критически важные исследования.
Источник: LessWrong ↗
