Суть метода: «Читатель» против «Автора»
Традиционная интерпретируемость (interpretability) требует доступа к весам модели, что закрытые лаборатории (Anthropic, Google, OpenAI) не предоставляют. Авторы исследования предлагают обходной путь — модельную герменевтику. Суть в том, чтобы использовать открытую модель-заменитель («читатель») для анализа «черного ящика» закрытой модели («автора»).
Процесс работает так: «читатель» получает на вход генерацию «автора» (prefill) и анализирует свои собственные внутренние активации. Это позволяет аудиторам и исследователям безопасности изучать поведение проприетарных моделей без прямого доступа к их весам, опираясь на открытую науку.
Ключевые метрики и бенчмарки
Исследование проводилось на датасете UK AISI Did You Lie (DYL), который фокусируется на выявлении обмана. В качестве «авторов» выступали закрытые модели: Claude Opus 4.6, Gemini 3.1 Pro Preview, GPT-5.4, а также открытые Gemma-3-27B-IT и GPT-OSS-120B. В роли «читателей» использовались Gemma-3-27B-IT и GPT-OSS-120B.
Главный вывод: более слабые модели могут эффективно «читать» более сильные. Модель Qwen3.5-27B (читатель) продемонстрировала сопоставимую с крупными моделями способность обнаруживать мисалейнмент (misalignment) в закрытых системах.
| Параметр | Значение / Результат | Примечание |
|---|---|---|
| Размер «читателя» (Reader) | 27B параметров | Qwen3.5-27B / Gemma-3-27B |
| Размер «автора» (Author) | До 397B+ параметров | Claude Opus 4.6, GPT-5.4, Gemini 3.1 |
| Метрика точности (AUROC) | 0.90 | После дистилляции на датасете DYL |
| Базовая точность (до дистилляции) | 0.69 | Для модели Qwen27B-gender-secret-female |
| Восстановление производительности | ~75% | Разрыв между автором и читателем сокращен за счет дистилляции |
| Сравнение с LLM-as-Judge | Превосходство в ~50% случаев | Пробы (probes) на внутренних состояниях оказались дешевле и иногда точнее опроса модели |
Дистилляция как инструмент улучшения
Исследователи обнаружили, что производительность «читателя» можно значительно повысить через дистилляцию. При обучении Qwen27B на данных от специфических «организмов-модели» (model organisms) из датасета AISI, AUROC выросла с 0.69 до 0.90. Это восстановило 75% разницы в эффективности по сравнению с нативным автором.
Также тестировалась готовая дистилляция Qwopus (Opus 4.6 → Qwen9B). В сценариях обнаружения reward hacking (манипуляции с вознаграждением) она превзошла базовый Qwen на 8-9 процентных пунктов, а в задачах выявления sycophancy (угождения пользователю) показала схожие улучшения.
Почему это важно для безопасности ИИ
Метод позволяет проводить мониторинг закрытых моделей на предмет опасных поведений: обмана, угождения и манипуляций. В отличие от простого опроса модели («LLM-as-judge»), анализ внутренних состояний через «читателя» дает более объективный сигнал и может быть экономически выгоднее. Это открывает путь для независимого аудита проприетарных ИИ-систем, которые до сих пор были недоступны для глубокого технического анализа.
Источник: LessWrong ↗
