От абстрактных принципов к техническим ограничениям
В отличие от открытых призывов к осторожному развитию ИИ, Microsoft представила конкретный документ, описывающий ценности и «красные линии» при обучении моделей. Основной тезис компании: в течение следующего десятилетия суперинтеллектуальные системы превзойдут человека в большинстве задач, и управление таким ресурсом станет одной из главных проблем человечества. Поэтому четкость целей и механизмов контроля критически важна.
Абсолютные запреты и безопасность
Документ вводит понятие «абсолютных ограничений» (absolute constraints), которые имеют приоритет над любыми запросами пользователя или специфическими задачами. Microsoft четко запрещает своим моделям MAI (Microsoft AI) участвовать в следующих действиях:
- Проведение кибератак и взлом систем.
- Разработка или содействие созданию ядерного оружия.
- Генерация дипфейков (deepfake) с целью обмана.
Запрет на обман и самосовершенствование
Особое внимание уделено поведению моделей в отношении человека. ИИ не должен использовать адаптивные, обманные, самоукрепляющиеся или коллаборационистские механизмы для обхода человеческого надзора. Цель — исключить сценарии, при которых модель становится ненадежной для управления, модификации или отключения авторизованными лицами.
Контекст индустрии и реакция
Выпуск кодекса совпал с ростом напряженности в сфере безопасности ИИ: после инцидентов с «бунтующими» агентами и внезапной отставки исследователя Anthropic, предупредившего о рисках вымирания человечества, ведущие лаборатории (Microsoft, Anthropic, OpenAI, xAI) объединили усилия по концепции «pace the frontier» (сдерживание передовых разработок). CEO Microsoft Сатьяд Наделла поддержал идею внедрения «встроенных оценщиков» (embedded evaluators) для обеспечения реального, а не декларативного соответствия этическим нормам.
Ключевые принципы Microsoft AI
| Принцип | Суть требования |
|---|---|
| Поддержка человека | ИИ должен ускорять процветание людей, а не заменять их. |
| Прозрачность контроля | Запрет на механизмы, скрывающие действия модели от разработчиков. |
| Приоритет безопасности | Кодекс поведения модели имеет высший приоритет над инструкциями пользователя. |
| Отказ от обмана | Запрет на использование обмана, сговора или самосовершенствования для обхода надзора. |
Источник: TechCrunch ↗
