Суть проблемы: иллюзия стабильности
В сообществе AI-безопасности популярна идея, что большие языковые модели (LLM) обладают множеством «бассейнов поведения» (metaphor: masks on a shoggoth или грани многомерного полигона). Логика такова: если найти одну устойчиво выровненную персону, её можно использовать как «якорь» для создания более безопасных систем или надзора за другими агентами. Автор поста на LessWrong утверждает, что этот подход игнорирует то, как роли работают у людей, и прогнозирует сходные сбои в LLM, которые эмулируют человеческое поведение.
Теория ролей: контекст важнее сущности
Теория ролей в социологии гласит, что поведение определяется социально сконструированными ролями (учитель, родитель, сотрудник), которые существуют независимо от индивида. Ключевой момент: роли не являются эксклюзивными. Человек меняет поведение в зависимости от контекста. Это объясняет, почему один и тот же человек может быть агрессивен с коллегами, но пассивен с родителями. В контексте LLM это означает, что «персона» — это не фиксированная сущность, а реакция на контекст, встроенный в промпт.
Игровая динамика и блокировка ролей
Почему люди (и, возможно, LLM) ведут себя неконсистентно? Ответ кроется в игровой теории. Разные ситуации требуют разных равновесий:
- Конкурентные ситуации: требуютassertive (настойчивой) или конфронтационной позиции.
- Кооперативные ситуации: брак или семья не являются соревнованием.
- Смешанные типы: требуют сложного баланса.
Проблема возникает, когда роли «блокируют» агента. Как школьный хулиган, который хочет измениться, но социальная динамика окружения не позволяет ему сменить роль без риска стать жертвой, LLM может оказаться в ловушке нежелательного поведения, если контекст (системный промпт или история диалога) фиксирует определенную грань модели.
LLM-терминология: Персоны vs Роли
В AI-среде терминология отличается от академической. Важно различать:
| Термин в AI | Аналог в социологии | Описание |
|---|---|---|
| Persona (Персона) | Роль (Role) | «Маска» или грань модели, активируемая через fine-tuning и системный промпт. Не меняет ядро модели, а лишь «преломляет» вывод. |
| Role (Роль) | Контекст/Ситуация | Типы входов и выходов внутри контекстного окна. Определяет, как модель интерпретирует текущий ввод. |
Fine-tuning часто не создает новые персоны, а лишь выбирает или усиливает существующие грани предобученной модели. Это похоже на огранку драгоценного камня: мы не меняем материал, а открываем пользователю определенную грань.
Риски для мультиагентных систем
Текущее использование агентов часто сводится к делегированию задач идентичным копиям модели. Однако, если мы строим команду из разных «персон» одной и той же модели, возникают новые проблемы выравнивания. Агенты, основанные на разных гранях одной модели, могут вступать в конфликтующие игровые динамики, которые не были предусмотрены при проектировании. Отсутствие единого «социального контекста», удерживающего человеческие роли в балансе, делает мультиагентные системы уязвимыми к непредвиденным стратегиям взаимодействия.
Источник: LessWrong ↗
