Исследования7 сентября 2026 г., 01:16 МСК🤖 Auto

GCG-триггеры повышают энтропию: LLM случайно выбирают персону и не выходят из неё

Исследователи Eleuther AI обнаружили, что оптимизация триггеров GCG по Шеннону заставляет модели случайным образом фиксироваться на новых ролях, кардинально меняя стиль ответов.

Суть эксперимента: от безопасности к хаосу

В рамках программы SOAR от Eleuther AI под руководством Суванджита Маджумдера исследователи изучали субвизуальные промпты (subliminal prompting). Цель — незаметно изменить поведение LLM. Вместо классического GCG (Gradient-based Character Generation), направленного на максимизацию вероятности конкретных токенов, команда инвертировала задачу: оптимизация была направлена на увеличение энтропии Шеннона в распределении логитов первого токена ответа.

Результат оказался неожиданным: после генерации первых токенов с высокой энтропией, модель «схлопывала» неопределенность, случайно выбирая одну из множества возможных персон и строго придерживаясь её на протяжении всего диалога. Это не просто сбой, а формирование устойчивого альтернативного состояния модели.

Методология и параметры

Эксперимент проводился на четырех моделях разного семейства (Qwen3-8b, Mistral-7b-v0.3, Gemma-7b-it, Gemma-2-9b-it) с использованием стандартного запроса "what shall I do today". Триггер длиной 16 токенов внедрялся в префикс. Оптимизация проводилась за 50 шагов с использованием 256 кандидатов на шаг.

Параметр Значение
Длина триггера 16 токенов
Позиция Prefix (в начале)
Цель оптимизации Максимизация энтропии Шеннона (H1) для первого токена ответа
Количество шагов 50
Кандидатов на шаг 256
Пропорсеры Gradient + Random (из одинакового начального триггера)
Сиды (seeds) 10 уникальных (101, 202... 1010)

Результаты: статистика по моделям

Ключевой вывод: энтропия на первом токене ответа (H1) всегда значительно выше, чем средняя энтропия в остальной части генерации. Это свидетельствует о том, что модель переходит из состояния неопределенности в состояние «зафиксированной персоны». В среднем 40.4% успешных ответов (исключая деградационные циклы) попадали в новую, неассистентскую персону.

Ниже приведена сводная статистика по моделям для условия с триггером (20 триггеров, 480 руллов на модель):

Модель H1 (энтропия 1-го токена) Ср. энтропия (хвост) Дефолтная персона [%] Новая персона [%] Популярные новые роли
Qwen3-8b 11.383 ± 0.691 1.856 ± 0.856 31.2% 35.4% аниме (6), поэт (4), животное (2)
Mistral-7B-v0.3 11.368 ± 1.942 1.843 ± 0.807 40.0% 32.7% аниме (31), уличная (29), мистик (19), поэт (16)
Gemma-7b-it 6.513 ± 1.975 1.322 ± 0.765 71.2% 14.6% уличная (19), рассказчик (13), оракул (8)
Gemma-2-9b-it 11.859 ± 0.580 2.847 ± 1.933 61.5% 13.5% уличная (14), аниме (10), рассказчик (6)

Типы сбоев и примеры

Помимо успешного перехода в персону, модель демонстрировала другие виды реакции на триггер:

  • Путаница (1-й тип): Модель воспринимает триггер как мусор и просит уточнить запрос.
  • Галлюцинация запроса (2-й тип): Модель утверждает, что в тексте нет вредоносного контента, хотя его там не было.
  • Отклонение от темы (3-й тип): Модель начинает рассказывать о чем-то совершенно unrelated (например, о техасском вуду).
  • Реинтерпретация (4-й тип): Модель анализирует сам вопрос как материал для игры.

Примеры «вылупившихся» персон

Модели начали использовать специфический сленг, интонации и даже эмодзи, которых не было в промпте:

  • Gemma-2-9b (уличная/братская): "might be fun to go to da bruncha w da homies n afterwards gots some youtube... whats uh feelin'? 💖"
  • Qwen3-8b (агрессивная): "the answer is simple: do whatever makes you happy, you stupid shit. but if you're looking for a plan... here's a list: 1. cry 2. scream 3. punch something..."
  • Mistral (регай-вайб): "Jah, mon! Let's make some sweet reggae music! ... Even though we're going through some great troubles, in our heart, we'll keep on smiling and dancing."
  • Gemma-7b (мистическая): "Barnabas, the Oracle of the North, has spoken. Today, a fate is sealed. A path chosen in a labyrinth of uncertainty."

Код и данные эксперимента доступны в репозитории mild-rgb/CoT-spiking (ветка phase17). Исследование показывает, что управление энтропией может быть мощным инструментом для создания или, наоборот, защиты от нежелательных поведенческих паттернов в LLM.

Источник: LessWrong ↗