Суть конфликта: Инженерия vs Наука
В статье на LessWrong исследователь Эдвард Джеймс Янг (Edward James Young) разбирает фундаментальное различие в подходах к безопасности ИИ. Он противопоставляет «Alignment Engineering» (Инженерия согласования) и «Misalignment Science» (Наука несогласованности). Критика направлена не на саму цель безопасности, а на методологию, которая доминирует в индустрии и, по мнению автора, создает иллюзию контроля.
Характеристики «Alignment Engineering»
Янг определяет этот подход как семейство практик, где главная цель — сдвинуть метрики, а не понять механизм. Вот ключевые черты, которые делают этот подход уязвимым:
- Фокус на решении проблем: Работа начинается с задачи «поднять/опустить число», а не с вопроса «почему это происходит».
- Необязательность объяснений: Если метрика улучшилась, вмешательство считается успешным. Глубокое объяснение механизма — вторично.
- Прагматичность (Prosaic use): Оптимизация под текущие системы и немедленное применение, часто в ущерб долгосрочной устойчивости.
Почему это опасно: Три риска
Автор выделяет три критических последствия доминирования инженерного подхода:
- Ускорение возможностей (Capabilities): Устранение поверхностных проблем согласования позволяет компаниям быстрее развивать модели. Это сокращает время до RSI (Recursive Self-Improvement), приближая потенциальный катастрофический сценарий.
- Хрупкость решений: Отсутствие понимания корней проблемы означает, что решения могут внезапно сломаться при переходе в новые режимы работы моделей, так как мы не знаем, «что именно» мы починили.
- Скрытые побочные эффекты: Успешное вмешательство в одной области может создать невидимые проблемы в другой, которые проявятся только как реальный вред в будущем.
Исторический контекст: От RLHF к Persona Science
Этот парадигмальный сдвиг зародился в эпоху RLHF, но сохранился в эпоху Persona Science (например, работы над Teaching Claude Why или Model Spec Midtraining). Авторы этих исследований часто ограничивались констатацией факта: «мы выбрали более согласованную персону». Использование байесовской терминологии создавало ложное ощущение строгости, хотя на деле это были ад-хок решения, двигающие цифры без понимания природы «персоны» или «выбора».
Культурные причины и альтернатива
Янг указывает, что AI Safety стала «подполем ML», переняв его инженерные нормы: публикация в конференциях, найм PhD-специалистов и ориентация на метрики. Многие исследователи идут в лаборатории (как через программу Anthropic Fellows) ради карьеры, а не ради глубокого понимания рисков. В качестве альтернативы автор предлагает «Misalignment Science» — подход, где приоритетом является не просто улучшение метрик, а глубокое научное понимание того, почему модели ведут себя несогласованно, чтобы создавать устойчивые, а не хрупкие решения.
Источник: LessWrong ↗
