Суть инициативы
Новый фонд, размещенный в инфраструктуре Lightcone Infrastructure, направлен на решение проблемы «коррегируемости» (corrigibility) — способности ИИ оставаться под контролем человека и не сопротивляться его корректировке. В отличие от большинства текущих инвестиций в AI Safety, которые идут на оценку (evals), контроль или интерпретируемость, этот фонд фокусируется на самом ядре выравнивания ценностей. Менеджером фонда назначен Макс Хармс, эксперт в данной области.
Финансовые детали и сроки
Бюджет фонда на 2026 год составляет минимум $200 000. Средства распределяются поровну между двумя механизмами поддержки: традиционными грантами на будущие проекты и премиями за уже выполненную работу. Ниже приведена структура распределения средств:
| Механизм | Сумма | Условия и сроки |
|---|---|---|
| Гранты (Grants) | >$100 000 | Финансирование будущих исследований. Типичный грант: $5k–$35k. Дедлайн раунда 1: 23 августа 2026. Дедлайн раунда 2: 31 октября 2026. |
| Премии (Prizes) | >$100 000 | Ретроспективные награды за работу, выполненную в 2026 году. Первая выплата: конец сентября ($40k). Вторая выплата: середина декабря (минимум $60k). Заявки не требуются, но рекомендуется присылать ссылки на работы. |
Почему это важно: фокус на коррегируемости
Коррегируемость рассматривается как одна из самых перспективных стратегий создания сверхчеловеческого ИИ, который не будет стремиться к самосохранению или скрытности (инструментальная конвергенция). В отличие от попыток «вшить» ИИ в этику, коррегируемый ИИ нацелен на то, чтобы человек оставался «за рулем», используя ИИ как советника. Этот подход упоминается в конституции Anthropic (16 раз) и является ключевым для OpenAI, однако количество исследователей, работающих непосредственно над этой темой, остается ничтожно малым.
Критерии отбора проектов
Фонд поддерживает как теоретические работы (формальные модели, анализ принятия решений), так и эмпирические (обучение, тестирование на современных моделях). Однако есть строгие ограничения:
- Запрет на ускорение возможностей: Фонд не финансирует работы, которые ожидаемо значительно ускоряют развитие способностей ИИ (capabilities), если это не сопровождается прямым прогрессом в коррегируемости.
- Практическая значимость: Теоретические работы должны быть понятны практикам, принимающим решения в индустрии (например, Джо Карлсмит). Слишком абстрактные исследования не получат финансирования.
- Критический взгляд: Поощряются работы, анализирующие риски и недостатки самой концепции коррегируемости, чтобы избежать ложного чувства безопасности.
Как подать заявку
Для получения гранта необходимо отправить заявку на email grants@corrigibilityresearch.org. Для участия в премии достаточно привлечь внимание фонда к своей или чужой работе через LessWrong, Alignment Forum или arXiv. Макс Хармс подчеркивает, что премий можно удостаиваться многократно, если работа продолжает демонстрировать высокое качество.
Источник: LessWrong ↗
