Проблема: ИИ не умеет «не знать»
Современные большие языковые модели (LLM) обладают технической возможностью взять полный контроль над устройствами и аккаунтами пользователя. Однако доверия к этому нет, потому что ИИ не может надежно экстраполировать интересы человека за пределы обучающей выборки. Они используют «наивную генерализацию» — уверенно действуют в новых условиях, но часто ошибаются. Это приемлемо для чат-бота, но катастрофично для автономного агента.
Armstrong утверждает, что масштабирование (scaling) и патчинг не решат эту проблему. Необходима явная генерализация ценностей (Explicit Value Generalisation) — способность ИИ распознавать новые ситуации, выбирать релевантные ценности и, будучи неуверенным, задавать точный вопрос человеку, а не действовать наугад.
Стратегия: Коммерция вместо академии
Программа Value Generalisation 1 будет реализована в коммерческом секторе, а не в академической среде. Причины выбора этой стратегии:
- Игнорирование академических работ: Техники выравнивания (alignment) часто игнорируются или используются только для усиления возможностей (capabilities), а этическая часть отбрасывается.
- Безопасность через ограничения: Тестирование на менее мощных системах безопаснее. Чем сильнее ИИ, тем сложнее контролировать его способность к обману.
- Рыночный спрос: Выравнивание должно стать ключевой продаваемой функцией. ИИ, которому можно делегировать задачи, будет иметь преимущество перед теми, кто просто «похож на человека» по ценностям, но не умеет их обобщать.
Три этапа развития технологии
Программа разделена на три стадии, каждая из которых имеет самостоятельную ценность:
| Этап | Задача | Результат |
|---|---|---|
| I | Распознавание выхода за пределы распределения (OOD) | ИИ четко знает, когда ситуация нова для его ценностей, и останавливается, чтобы избежать ошибки. |
| II | Выбор релевантных концептов | ИИ определяет, какие именно ценности важны в новой ситуации, чтобы задать человеку точный вопрос, дающий ему ситуационное понимание. |
| III | Полная явная генерализация | ИИ самостоятельно применяет ценности с минимальным участием человека. Ведет к созданию «предварительно выровненных» ИИ, где моральные концепты связаны с эмпирическими знаниями. |
Почему это важно сейчас?
Существует асимметрия: способности ИИ растут без необходимости явной генерализации, но выравнивание без нее невозможно. Если мы хотим получить ИИ, действующий в интересах человека, эту способность нужно внедрить на ранних этапах развития моделей. Armstrong уже имеет предварительные результаты в области экстраполяции концептов и решения проблем «misgeneralisation» целей, которые, по его словам, не достигнуты другими подходами. Он ищет финансирование, команду и критику для запуска проекта.
Источник: LessWrong ↗
