Крах парадигмы «дифференциального продвижения»
В статье анализируется эволюция сообщества AI alignment за последнее десятилетие. Ключевой тезис автора: концепция «дифференциального продвижения выравнивания над возможностями» (differentially advancing alignment over capabilities) перестала иметь смысл. На практике исследования безопасности стали главным драйвером развития мощностей ИИ в OpenAI, DeepMind и Anthropic. Граница между «безопасностью» и «возможностями» стерлась, так как методы, направленные на улучшение работы моделей, одновременно делали их сильнее и опаснее.
Феномен «Прагматичного выравнивания»
Автор вводит термин «прагматичное выравнивание» (pragmatic alignment) — парадигму, при которой исследователи используют консекуэнциалистские аргументы (оправдание целей результатами), но отказываются критиковать злоупотребление этими аргументами. Это привело к:
- Мотивированному рассуждению: Исследователи убеждали себя, что их работа безопасна, игнорируя контрфактуальные сценарии, где такие вмешательства не происходили.
- Страху перед властью: Сообщество боялось публично критиковать лидеров индустрии (Сэма Альтмана, Дарио Амодеи), что создало среду, где ложь и самообман поощрялись нормами «добронамеренности».
Механизм пессимизации
Нго описывает процесс пессимизации (pessimization): люди, стремящиеся к одной цели, систематически производят противоположный результат. Это происходит из-за неспособности сообщества удерживать акторов в ответе за их действия. Вместо институционального контроля предлагается требовать честных публичных дискуссий о том, что именно произошло, чтобы пользователи могли принимать решения о финансировании и трудоустройстве.
Исторический контекст и сдвиг парадигмы
Сдвиг от теоретического «прозаического идеала» к эмпирическому прагматизму начался с публикации Concrete Problems in AI Safety (2016), где Дарио Амодеи стал ведущим автором. Интеллектуальным ядром этого сдвига стали работы Пола Кристиано, начавшего публиковаться на LessWrong с 2010 года. Именно его аргументы убедили сообщество в том, что эмпирический подход к безопасности эффективнее теоретического, что в итоге ускорило гонку вооружений ИИ.
Источник: LessWrong ↗
