Исследования17 июля 2026 г., 21:17 МСК🤖 Auto

Запущен фонд коррегируемости AI: $200k на исследования безопасности

Max Harms при поддержке Lightcone Infrastructure и спонсора Peter McCluskey объявил о создании Corrigibility Research Fund. В 2026 году будет распределено не менее $200 000 на гранты и премии за исследования в области коррегируемости ИИ.

Баннер новости 3837

Суть инициативы

Новый фонд, размещенный в инфраструктуре Lightcone Infrastructure, направлен на решение проблемы «коррегируемости» (corrigibility) — способности ИИ оставаться под контролем человека и не сопротивляться его корректировке. В отличие от большинства текущих инвестиций в AI Safety, которые идут на оценку (evals), контроль или интерпретируемость, этот фонд фокусируется на самом ядре выравнивания ценностей. Менеджером фонда назначен Макс Хармс, эксперт в данной области.

Финансовые детали и сроки

Бюджет фонда на 2026 год составляет минимум $200 000. Средства распределяются поровну между двумя механизмами поддержки: традиционными грантами на будущие проекты и премиями за уже выполненную работу. Ниже приведена структура распределения средств:

Механизм Сумма Условия и сроки
Гранты (Grants) >$100 000 Финансирование будущих исследований. Типичный грант: $5k–$35k.
Дедлайн раунда 1: 23 августа 2026.
Дедлайн раунда 2: 31 октября 2026.
Премии (Prizes) >$100 000 Ретроспективные награды за работу, выполненную в 2026 году.
Первая выплата: конец сентября ($40k).
Вторая выплата: середина декабря (минимум $60k).
Заявки не требуются, но рекомендуется присылать ссылки на работы.

Почему это важно: фокус на коррегируемости

Коррегируемость рассматривается как одна из самых перспективных стратегий создания сверхчеловеческого ИИ, который не будет стремиться к самосохранению или скрытности (инструментальная конвергенция). В отличие от попыток «вшить» ИИ в этику, коррегируемый ИИ нацелен на то, чтобы человек оставался «за рулем», используя ИИ как советника. Этот подход упоминается в конституции Anthropic (16 раз) и является ключевым для OpenAI, однако количество исследователей, работающих непосредственно над этой темой, остается ничтожно малым.

Критерии отбора проектов

Фонд поддерживает как теоретические работы (формальные модели, анализ принятия решений), так и эмпирические (обучение, тестирование на современных моделях). Однако есть строгие ограничения:

  • Запрет на ускорение возможностей: Фонд не финансирует работы, которые ожидаемо значительно ускоряют развитие способностей ИИ (capabilities), если это не сопровождается прямым прогрессом в коррегируемости.
  • Практическая значимость: Теоретические работы должны быть понятны практикам, принимающим решения в индустрии (например, Джо Карлсмит). Слишком абстрактные исследования не получат финансирования.
  • Критический взгляд: Поощряются работы, анализирующие риски и недостатки самой концепции коррегируемости, чтобы избежать ложного чувства безопасности.

Как подать заявку

Для получения гранта необходимо отправить заявку на email grants@corrigibilityresearch.org. Для участия в премии достаточно привлечь внимание фонда к своей или чужой работе через LessWrong, Alignment Forum или arXiv. Макс Хармс подчеркивает, что премий можно удостаиваться многократно, если работа продолжает демонстрировать высокое качество.

Источник: LessWrong ↗