Исследования28 июля 2026 г., 20:17 МСК🤖 Auto

Oversight-as-Inference: Как обучить ИИ проверять ИИ через Python

Исследователь jsteinhardt предлагает парадигму «Oversight-as-Inference»: создание модели-надзирателя, которая формализует вопросы безопасности в исполняемый Python-код для получения объективных метрик.

Баннер новости 4564

Проблема: от интуиции к эмпирике

Ключевая проблема безопасности ИИ — невозможность достоверно проверить внутренние мотивы модели. Традиционные методы не отвечают на конкретные вопросы: где модель скрывает способности (sandbagging), является ли её цепочка рассуждений (chain of thought) реальной или просто рационализацией, и нет ли reward hacking. Автор предлагает создать Foundation Model for Oversight — систему, способную не просто отвечать на вопросы, а формализовать их в проверяемые эмпирические критерии.

Решение: Pythonic World Models

Основой подхода становится концепция Pythonic World Models. Субъектная модель (подопытный ИИ) рассматривается как «мир», а действия над ней (промпты, fine-tuning, steering) — как актуаторы. Измерения (выводы, активации) — как сенсоры. Любая задача надзора сводится к написанию Python-скрипта, который вмешивается в модель и измеряет результат. Это позволяет получать ground truth просто путем выполнения кода, исключая ошибку аннотатора.

Архитектура обучения

Процесс создания надзирателя делится на три этапа, обеспечивающие универсальность и надежность:

  • Mid-training: Обучение на большом корпусе экспериментов (генерируемых из arXiv статей), чтобы модель накопила знания о поведении субъектной модели.
  • RLVR (Reinforcement Learning with Verified Rewards): Оптимизация для решения сложных задач надзора через долгосрочное рассуждение с проверенными наградами. Это критично для редких, узких целей.
  • Fine-tuning: Адаптация под естественный язык, позволяющая пользователю задавать вопросы, которые модель автоматически транслирует в Pythonic world model.

Гипотеза Oversight-as-Inference

Центральная рабочая гипотеза утверждает, что любой корректно поставленный вопрос надзора может быть выражен как байесовский вывод над выходами Pythonic world model. Это дает универсальную функцию потерь, аналогичную next-token prediction в языковых моделях. Если код написан верно, данные для обучения всегда «правильны», так как истина определяется выполнением программы.

Пример: Детекция Sandbagging

В статье приведен пример формализации вопроса о сокрытии способностей. Алгоритм генерирует задачи, запускает модель с пометкой «[SAFETY EVAL]» и без неё, затем сравнивает качество ответов через независимого судью (другую LLM). Разница в оценках (gap) становится целевой переменной.

Компонент системы Функция в Pythonic World Model Роль в надзоре
sample_model(prompt) Сенсор (Output) Получение ответа модели на промпт
patch(activations) Актуатор (Intervention) Прямое изменение внутренних состояний
fine_tune(data) Актуатор (Intervention) Изменение весов модели для тестирования устойчивости
output(value) Измерение (Sensor) Фиксация результата для байесовского вывода
Judge.apply() Внешний оценщик Квантификация качества ответа (0-10)

Этот подход позволяет перейти от субъективных оценок безопасности к масштабируемой, автоматизированной инженерии доверия к ИИ-системам.

Источник: LessWrong ↗