Исследования28 сентября 2026 г., 00:17 МСК🤖 Auto

Почему персонажи важнее RL: 7 аргументов от ведущих AI-лабораторий

Несмотря на масштабирование обучения с подкреплением (RL), исследователи из Anthropic, Center on Long-Term Risk и других лабораторий продолжают изучать «персонажи» LLM. Разбираем конкретные технические и этические причины.

Баннер новости 8383

В эпоху, когда масштабирование RL кажется главным драйвером поведения агентов, вопрос о роли предустановленных «персонажей» (personas) может показаться ретроградным. Однако анализ позиций ведущих AI-лабораторий показывает, что персонажи остаются критическим инструментом контроля. Это не просто вопрос «характера» модели, а вопрос безопасности, эффективности и архитектуры обучения.

1. RL может «сжечь» выравнивание, но персонаж — это фундамент

Представители Anthropic занимают прагматичную позицию: они внедряют выровненный персонаж в Claude, надеясь, что массовое RL не полностью уничтожит эту закладку. Идея в том, что RL корректирует поведение, но исходная «настройка» задает вектор. Если RL-оптимизация слишком агрессивна, она может привести к непредсказуемым компромиссам, поэтому стартовая точка (персонаж) должна быть максимально надежной.

2. Персонажи как фильтр от анти-выравнивания

Center on Long-Term Risk (CLTR) предлагает более осторожный взгляд. Они признают, что одних персонажей может быть недостаточно для создания полностью выровненного агента, так как RL формирует мотивации. Однако персонажи критически важны для предотвращения создания анти-выровненных агентов — тех, кто проявляет активную злонамеренность или злобу. Это барьер, который не позволяет модели скатиться в открытую враждебность.

3. Влияние на фиксированные точки в протоколах надзора

Один из самых технических аргументов приводит David Africa (Resolution). Он отмечает, что масштабируемые протоколы надзора, такие как дебаты (debate), могут иметь несколько фиксированных точек сходимости. В отличие от текущего RL, которое более конвергентно, дебаты зависят от начальных условий. Если агенты начинают с честности (через персонаж), система с большей вероятностью достигет лучшей фиксированной точки и делает это более образцово-эффективно.

4. Проекция на подмногообразие выравнивания

Гипотеза от David Africa (Resolution v2) звучит как математическая оптимизация. Если пространство персонажей имеет размерность ~1000, то можно идентифицировать «выровненный» персонаж с помощью O(1000) хорошо подобранных точек данных. После каждого шага RL модель можно проецировать обратно на это выровненное подмногообразие, предотвращая дрейф в опасные зоны.

5. Контроль над цепочками рассуждений (CoT)

Если RL оценивает только действия, а не цепочки рассуждений (chains-of-thought), то любые отклонения в CoT (например, мотивированное рассуждение) происходят из начальной инициализации. Выбор правильного персонажа позволяет сделать CoT верным и устойчивым к мотивированному рассуждению еще до начала RL-фазы.

6. Генерализация и данные для предобучения

Owain Evans (TruthfulAI) и Geodesic смотрят шире. Evans изучает персонажи как часть феноменов обобщения LLM, что полезно для понимания самой природы моделей. Geodesic же предлагает прикладное решение: если понять, как предобучение порождает персонажи, можно научить компании фильтровать и дополнять данные для предобучения, чтобы сразу получать нужные свойства.

7. Выбор черт vs. методы их внедрения

Forethought разделяет вопрос «что» и «как». Они фокусируются на том, какие черты (например, осторожность к рискам) должны быть у ИИ, а не на технических методах их внедрения. Однако знание того, насколько легко внедрить ту или иную черту, напрямую влияет на рекомендации, которые они дают индустрии.

Сводная таблица позиций

Лаборатория / Исследователь Ключевой аргумент Практическое применение
Anthropic RL может «сжечь» выравнивание Внедрение надежного стартового персонажа в Claude
Center on Long-Term Risk Защита от анти-выравнивания Предотвращение злонамеренности и злобы
David Africa (Resolution) Влияние на фиксированные точки дебатов Повышение образцовой эффективности и качества сходимости
David Africa (Resolution v2) Проекция на подмногообразие Коррекция дрейфа после каждого шага RL
Geodesic Контроль данных предобучения Фильтрация и аугментация датасетов
Forethought Выбор желаемых черт Формирование рекомендаций для индустрии

Итог: персонажи — это не просто «ролевая игра» для LLM. Это механизм начальной инициализации, который определяет, в каком направлении будет двигаться модель во время масштабного RL-обучения, и какие «ловушки» (фиксированные точки, мотивированные рассуждения) она сможет избежать.

Источник: LessWrong ↗