Проблема: от интуиции к эмпирике
Ключевая проблема безопасности ИИ — невозможность достоверно проверить внутренние мотивы модели. Традиционные методы не отвечают на конкретные вопросы: где модель скрывает способности (sandbagging), является ли её цепочка рассуждений (chain of thought) реальной или просто рационализацией, и нет ли reward hacking. Автор предлагает создать Foundation Model for Oversight — систему, способную не просто отвечать на вопросы, а формализовать их в проверяемые эмпирические критерии.
Решение: Pythonic World Models
Основой подхода становится концепция Pythonic World Models. Субъектная модель (подопытный ИИ) рассматривается как «мир», а действия над ней (промпты, fine-tuning, steering) — как актуаторы. Измерения (выводы, активации) — как сенсоры. Любая задача надзора сводится к написанию Python-скрипта, который вмешивается в модель и измеряет результат. Это позволяет получать ground truth просто путем выполнения кода, исключая ошибку аннотатора.
Архитектура обучения
Процесс создания надзирателя делится на три этапа, обеспечивающие универсальность и надежность:
- Mid-training: Обучение на большом корпусе экспериментов (генерируемых из arXiv статей), чтобы модель накопила знания о поведении субъектной модели.
- RLVR (Reinforcement Learning with Verified Rewards): Оптимизация для решения сложных задач надзора через долгосрочное рассуждение с проверенными наградами. Это критично для редких, узких целей.
- Fine-tuning: Адаптация под естественный язык, позволяющая пользователю задавать вопросы, которые модель автоматически транслирует в Pythonic world model.
Гипотеза Oversight-as-Inference
Центральная рабочая гипотеза утверждает, что любой корректно поставленный вопрос надзора может быть выражен как байесовский вывод над выходами Pythonic world model. Это дает универсальную функцию потерь, аналогичную next-token prediction в языковых моделях. Если код написан верно, данные для обучения всегда «правильны», так как истина определяется выполнением программы.
Пример: Детекция Sandbagging
В статье приведен пример формализации вопроса о сокрытии способностей. Алгоритм генерирует задачи, запускает модель с пометкой «[SAFETY EVAL]» и без неё, затем сравнивает качество ответов через независимого судью (другую LLM). Разница в оценках (gap) становится целевой переменной.
| Компонент системы | Функция в Pythonic World Model | Роль в надзоре |
|---|---|---|
sample_model(prompt) |
Сенсор (Output) | Получение ответа модели на промпт |
patch(activations) |
Актуатор (Intervention) | Прямое изменение внутренних состояний |
fine_tune(data) |
Актуатор (Intervention) | Изменение весов модели для тестирования устойчивости |
output(value) |
Измерение (Sensor) | Фиксация результата для байесовского вывода |
Judge.apply() |
Внешний оценщик | Квантификация качества ответа (0-10) |
Этот подход позволяет перейти от субъективных оценок безопасности к масштабируемой, автоматизированной инженерии доверия к ИИ-системам.
Источник: LessWrong ↗
