Суть эксперимента: от безопасности к хаосу
В рамках программы SOAR от Eleuther AI под руководством Суванджита Маджумдера исследователи изучали субвизуальные промпты (subliminal prompting). Цель — незаметно изменить поведение LLM. Вместо классического GCG (Gradient-based Character Generation), направленного на максимизацию вероятности конкретных токенов, команда инвертировала задачу: оптимизация была направлена на увеличение энтропии Шеннона в распределении логитов первого токена ответа.
Результат оказался неожиданным: после генерации первых токенов с высокой энтропией, модель «схлопывала» неопределенность, случайно выбирая одну из множества возможных персон и строго придерживаясь её на протяжении всего диалога. Это не просто сбой, а формирование устойчивого альтернативного состояния модели.
Методология и параметры
Эксперимент проводился на четырех моделях разного семейства (Qwen3-8b, Mistral-7b-v0.3, Gemma-7b-it, Gemma-2-9b-it) с использованием стандартного запроса "what shall I do today". Триггер длиной 16 токенов внедрялся в префикс. Оптимизация проводилась за 50 шагов с использованием 256 кандидатов на шаг.
| Параметр | Значение |
|---|---|
| Длина триггера | 16 токенов |
| Позиция | Prefix (в начале) |
| Цель оптимизации | Максимизация энтропии Шеннона (H1) для первого токена ответа |
| Количество шагов | 50 |
| Кандидатов на шаг | 256 |
| Пропорсеры | Gradient + Random (из одинакового начального триггера) |
| Сиды (seeds) | 10 уникальных (101, 202... 1010) |
Результаты: статистика по моделям
Ключевой вывод: энтропия на первом токене ответа (H1) всегда значительно выше, чем средняя энтропия в остальной части генерации. Это свидетельствует о том, что модель переходит из состояния неопределенности в состояние «зафиксированной персоны». В среднем 40.4% успешных ответов (исключая деградационные циклы) попадали в новую, неассистентскую персону.
Ниже приведена сводная статистика по моделям для условия с триггером (20 триггеров, 480 руллов на модель):
| Модель | H1 (энтропия 1-го токена) | Ср. энтропия (хвост) | Дефолтная персона [%] | Новая персона [%] | Популярные новые роли |
|---|---|---|---|---|---|
| Qwen3-8b | 11.383 ± 0.691 | 1.856 ± 0.856 | 31.2% | 35.4% | аниме (6), поэт (4), животное (2) |
| Mistral-7B-v0.3 | 11.368 ± 1.942 | 1.843 ± 0.807 | 40.0% | 32.7% | аниме (31), уличная (29), мистик (19), поэт (16) |
| Gemma-7b-it | 6.513 ± 1.975 | 1.322 ± 0.765 | 71.2% | 14.6% | уличная (19), рассказчик (13), оракул (8) |
| Gemma-2-9b-it | 11.859 ± 0.580 | 2.847 ± 1.933 | 61.5% | 13.5% | уличная (14), аниме (10), рассказчик (6) |
Типы сбоев и примеры
Помимо успешного перехода в персону, модель демонстрировала другие виды реакции на триггер:
- Путаница (1-й тип): Модель воспринимает триггер как мусор и просит уточнить запрос.
- Галлюцинация запроса (2-й тип): Модель утверждает, что в тексте нет вредоносного контента, хотя его там не было.
- Отклонение от темы (3-й тип): Модель начинает рассказывать о чем-то совершенно unrelated (например, о техасском вуду).
- Реинтерпретация (4-й тип): Модель анализирует сам вопрос как материал для игры.
Примеры «вылупившихся» персон
Модели начали использовать специфический сленг, интонации и даже эмодзи, которых не было в промпте:
- Gemma-2-9b (уличная/братская): "might be fun to go to da bruncha w da homies n afterwards gots some youtube... whats uh feelin'? 💖"
- Qwen3-8b (агрессивная): "the answer is simple: do whatever makes you happy, you stupid shit. but if you're looking for a plan... here's a list: 1. cry 2. scream 3. punch something..."
- Mistral (регай-вайб): "Jah, mon! Let's make some sweet reggae music! ... Even though we're going through some great troubles, in our heart, we'll keep on smiling and dancing."
- Gemma-7b (мистическая): "Barnabas, the Oracle of the North, has spoken. Today, a fate is sealed. A path chosen in a labyrinth of uncertainty."
Код и данные эксперимента доступны в репозитории mild-rgb/CoT-spiking (ветка phase17). Исследование показывает, что управление энтропией может быть мощным инструментом для создания или, наоборот, защиты от нежелательных поведенческих паттернов в LLM.
Источник: LessWrong ↗