Исследования1 октября 2026 г., 00:19 МСК🤖 Auto

Модельная герменевтика: как открытые модели 27B мониторят закрытых гигантов

Исследователи представили метод «модельной герменевтики», позволяющий использовать открытые модели (читатели) для анализа внутренних состояний закрытых проприетарных систем (авторов). Показано, что Qwen3.5-27B способен с точностью 0.90 AUROC выявлять

Баннер новости 8642

Суть метода: «Читатель» против «Автора»

Традиционная интерпретируемость (interpretability) требует доступа к весам модели, что закрытые лаборатории (Anthropic, Google, OpenAI) не предоставляют. Авторы исследования предлагают обходной путь — модельную герменевтику. Суть в том, чтобы использовать открытую модель-заменитель («читатель») для анализа «черного ящика» закрытой модели («автора»).

Процесс работает так: «читатель» получает на вход генерацию «автора» (prefill) и анализирует свои собственные внутренние активации. Это позволяет аудиторам и исследователям безопасности изучать поведение проприетарных моделей без прямого доступа к их весам, опираясь на открытую науку.

Ключевые метрики и бенчмарки

Исследование проводилось на датасете UK AISI Did You Lie (DYL), который фокусируется на выявлении обмана. В качестве «авторов» выступали закрытые модели: Claude Opus 4.6, Gemini 3.1 Pro Preview, GPT-5.4, а также открытые Gemma-3-27B-IT и GPT-OSS-120B. В роли «читателей» использовались Gemma-3-27B-IT и GPT-OSS-120B.

Главный вывод: более слабые модели могут эффективно «читать» более сильные. Модель Qwen3.5-27B (читатель) продемонстрировала сопоставимую с крупными моделями способность обнаруживать мисалейнмент (misalignment) в закрытых системах.

Параметр Значение / Результат Примечание
Размер «читателя» (Reader) 27B параметров Qwen3.5-27B / Gemma-3-27B
Размер «автора» (Author) До 397B+ параметров Claude Opus 4.6, GPT-5.4, Gemini 3.1
Метрика точности (AUROC) 0.90 После дистилляции на датасете DYL
Базовая точность (до дистилляции) 0.69 Для модели Qwen27B-gender-secret-female
Восстановление производительности ~75% Разрыв между автором и читателем сокращен за счет дистилляции
Сравнение с LLM-as-Judge Превосходство в ~50% случаев Пробы (probes) на внутренних состояниях оказались дешевле и иногда точнее опроса модели

Дистилляция как инструмент улучшения

Исследователи обнаружили, что производительность «читателя» можно значительно повысить через дистилляцию. При обучении Qwen27B на данных от специфических «организмов-модели» (model organisms) из датасета AISI, AUROC выросла с 0.69 до 0.90. Это восстановило 75% разницы в эффективности по сравнению с нативным автором.

Также тестировалась готовая дистилляция Qwopus (Opus 4.6 → Qwen9B). В сценариях обнаружения reward hacking (манипуляции с вознаграждением) она превзошла базовый Qwen на 8-9 процентных пунктов, а в задачах выявления sycophancy (угождения пользователю) показала схожие улучшения.

Почему это важно для безопасности ИИ

Метод позволяет проводить мониторинг закрытых моделей на предмет опасных поведений: обмана, угождения и манипуляций. В отличие от простого опроса модели («LLM-as-judge»), анализ внутренних состояний через «читателя» дает более объективный сигнал и может быть экономически выгоднее. Это открывает путь для независимого аудита проприетарных ИИ-систем, которые до сих пор были недоступны для глубокого технического анализа.

Источник: LessWrong ↗