Слепая зона в финансировании ИИ
Большинство исследователей и фондов согласны, что механическая интерпретируемость (mech interp), улучшение обучения выравниванию и теории контроля важны. Однако никто не знает точно, какие именно вариации этих работ дадут максимальный эффект при ограниченных ресурсах. Эта проблема называется "мета-проблемой выравнивания" (alignment meta-problem).
Сет Херд приводит аналогию: если мы едем к обрыву, нам нужны не просто быстрые колеса, а хорошие фары. Сейчас работа по определению правильного курса ведется в свободное время исследователей или внутри фондов, где мотивация часто искажена желанием «звучать правильно», а не быть эффективным.
Кто делает эту работу сейчас?
Прямого финансирования для стратегического анализа практически нет. Исключение составляет AI Futures Project, который финансируется для прогнозирования и создания «моделей шестеренок» (Gears-Level Models). Они учитывают перекрестные зависимости между общественным мнением, регулированием и техническим прогрессом, чего не делают остальные.
Аргументы «за» и «против»
Критики указывают на риски: концентрация финансирования, плохие прогнозы и сложность оценки. Однако автор приводит контраргументы, сравнивая задачу с проектами «Аполлон» или Манхэттенским проектом, где наличие четкой цели и временных рамок оправдывает жесткое планирование.
| Аспект | Текущее состояние | Предлагаемое решение |
|---|---|---|
| Финансирование мета-анализа | Практически отсутствует (спонсорское время) | Прямое выделение грантов на стратегию |
| Мотивация исследователей | Goodharting, самооправдание своей работы | Независимая оценка эффективности |
| Пример организации | AI Futures Project (прогнозирование) | Масштабирование их подхода на другие области |
| Риск ошибокт | Высокий (улица с фонарем) | Более строгая проверка теорий изменений |
Почему это важно прямо сейчас
Теоретические модели перехода к LLM AGI (например, LAMRAG) вызывают серьезные сомнения в том, что мы делаем правильную работу. Без финансирования специалистов, которые будут систематически проверять гипотезы, сообщество рискует потратить годы на решения, которые не сработают. Херд подчеркивает, что предсказание в сложных сценариях ИИ сложно, но именно это может определить, будет ли ИИ безопасным.
Источник: LessWrong ↗
