Исследования5 октября 2026 г., 09:17 МСК🤖 Auto

Инженерия против науки: почему текущий подход к Alignment опасен

Исследователь Эдвард Джеймс Янг критикует доминирующую парадигму «Alignment Engineering» за отсутствие понимания причин сбоев и предлагает перейти к «Misalignment Science».

Баннер новости 8925

Суть конфликта: Инженерия vs Наука

В статье на LessWrong исследователь Эдвард Джеймс Янг (Edward James Young) разбирает фундаментальное различие в подходах к безопасности ИИ. Он противопоставляет «Alignment Engineering» (Инженерия согласования) и «Misalignment Science» (Наука несогласованности). Критика направлена не на саму цель безопасности, а на методологию, которая доминирует в индустрии и, по мнению автора, создает иллюзию контроля.

Характеристики «Alignment Engineering»

Янг определяет этот подход как семейство практик, где главная цель — сдвинуть метрики, а не понять механизм. Вот ключевые черты, которые делают этот подход уязвимым:

  • Фокус на решении проблем: Работа начинается с задачи «поднять/опустить число», а не с вопроса «почему это происходит».
  • Необязательность объяснений: Если метрика улучшилась, вмешательство считается успешным. Глубокое объяснение механизма — вторично.
  • Прагматичность (Prosaic use): Оптимизация под текущие системы и немедленное применение, часто в ущерб долгосрочной устойчивости.

Почему это опасно: Три риска

Автор выделяет три критических последствия доминирования инженерного подхода:

  1. Ускорение возможностей (Capabilities): Устранение поверхностных проблем согласования позволяет компаниям быстрее развивать модели. Это сокращает время до RSI (Recursive Self-Improvement), приближая потенциальный катастрофический сценарий.
  2. Хрупкость решений: Отсутствие понимания корней проблемы означает, что решения могут внезапно сломаться при переходе в новые режимы работы моделей, так как мы не знаем, «что именно» мы починили.
  3. Скрытые побочные эффекты: Успешное вмешательство в одной области может создать невидимые проблемы в другой, которые проявятся только как реальный вред в будущем.

Исторический контекст: От RLHF к Persona Science

Этот парадигмальный сдвиг зародился в эпоху RLHF, но сохранился в эпоху Persona Science (например, работы над Teaching Claude Why или Model Spec Midtraining). Авторы этих исследований часто ограничивались констатацией факта: «мы выбрали более согласованную персону». Использование байесовской терминологии создавало ложное ощущение строгости, хотя на деле это были ад-хок решения, двигающие цифры без понимания природы «персоны» или «выбора».

Культурные причины и альтернатива

Янг указывает, что AI Safety стала «подполем ML», переняв его инженерные нормы: публикация в конференциях, найм PhD-специалистов и ориентация на метрики. Многие исследователи идут в лаборатории (как через программу Anthropic Fellows) ради карьеры, а не ради глубокого понимания рисков. В качестве альтернативы автор предлагает «Misalignment Science» — подход, где приоритетом является не просто улучшение метрик, а глубокое научное понимание того, почему модели ведут себя несогласованно, чтобы создавать устойчивые, а не хрупкие решения.

Источник: LessWrong ↗