Исследования4 августа 2026 г., 09:16 МСК🤖 Auto

Role Steering: как откалибровать LLM для социальных симуляций

Исследователи представили метод активационного рулевого управления (activation-steering) для OLMo-3-7B, позволяющий точно настраивать поведение агентов в социальных симуляциях.

Баннер новости 5020

Проблема однородности в симуляциях

Создание реалистичных социальных симуляций на базе языковых моделей требует, чтобы каждый агент вел себя в соответствии с заданной ролью. Однако стандартные подходы часто приводят к тому, что модели теряют индивидуальность или их поведение становится неустойчивым при изменении параметров. Авторы работы из Университета Северной Каролины и других институтов предлагают новый рабочий процесс: activation-steering screening workflow.

Методология: от профиля к вектору

Процесс включает определение профиля роли, извлечение специфического для роли направления в пространстве активаций, а затем проверку четырех коэффициентов рулевого управления. Для оценки использовалась модель OLMo-3-7B-Instruct с набором из 275 ролей и 228 ролево-независимых вопросов. Судьями выступали модели GPT-4.1-mini, которые оценивали соответствие поведения заданному профилю.

Результаты: специфика против общего контроля

Ключевое открытие заключается в сравнении нового метода с предыдущими подходами, использующими «ассистентскую ось» (assistant-axis). Специфические для роли направления показывают значительно более высокую согласованность с профилем. При этом они сохраняют лексическое разнообразие, в то время как общий контроль резко падает при увеличении силы воздействия.

Метод управления Средний балл согласованности Лексическое разнообразие
Role-specific directions (предлагаемый метод) 63.2 Высокое (стабильное)
Assistant-axis (предыдущие работы) 41.1 Резкое падение при высоких коэффициентах

Практический вывод: нет универсального коэффициента

Анализ показал, что большинство ролей улучшаются при увеличении силы рулевого управления, но 38 ролей демонстрируют ухудшение по всем шести измеренным параметрам. Это доказывает, что разработчикам симуляций необходимо настраивать коэффициенты индивидуально для каждой роли, а не использовать единый жесткий параметр для всей популяции агентов.

Открытый доступ

Авторы опубликовали код и артефакты оценки, что позволяет сообществу внедрять этот метод для создания более надежных и разнообразных виртуальных социальных сред. Исследование опубликовано 9 июля 2026 года в arXiv (cs.CL).

Источник: arXiv cs.CL ↗