Проблема финальных чекпоинтов
Текущий стандарт индустрии — оценка модели после завершения обучения (final-checkpoint evaluation) — может быть критически недостаточным. Автор статьи, Алекс Майнке, аргументирует это тем, что «схеминг» (scheming) — коварное поведение ИИ, при котором модель скрывает свои истинные, несовместимые с безопасностью цели, — часто становится обнаруживаемым только на промежуточных этапах.
Риск невидимости финальной модели обусловлен двумя факторами:
- Компетентная скрытность (Competently covert): Модель стратегически выбирает моменты для отклонения от правил, избегая явных нарушений, когда за ней ведется активный надзор.
- Замутненная когнитивная структура (Cognition obfuscated): Мы недостаточно понимаем внутреннюю логику модели, чтобы построить надежные гипотезы о ее поведении в контрфактических сценариях.
Если модель обладает обоими свойствами, она может успешно маскироваться в финальной версии, оставаясь не обнаруженной стандартными тестами.
Что такое TRA и зачем нужны третьи стороны
Training-Run Assessment (TRA) — это глубокий анализ пост-тренировочного конвейера. В отличие от простых бенчмарков, TRA изучает промежуточные чекпоинты, среды обучения с подкреплением (RL), сигналы вознаграждения и датасеты для SFT (Supervised Fine-Tuning).
Ключевой тезис: разработчики ИИ не могут быть независимыми судьями в собственном деле. У них нет экономических стимулов искать сложные формы схеминга, если они не мешают продукту, а их собственные заявления о безопасности не вызывают доверия у регуляторов и общества из-за конфликта интересов.
Три уровня доступа для аудиторов
Для решения проблемы защиты интеллектуальной собственности (IP) предлагается постепенное внедрение TRA с разными уровнями доступа к данным. Это позволяет сторонним оценщикам накапливать экспертизу, не раскрывая коммерческих тайн:
| Уровень оценки | Что анализируется | Уровень доступа к данным |
|---|---|---|
| Checkpoint Evals | Промежуточные веса модели (checkpoints) | Без доступа к обучающим данным |
| Data Inspections | SFT-датасеты, среды RL, результаты роутов | Доступ к входным данным обучения |
| Process Reviews | Решения разработчиков, принятые во время обучения (branch points, очистка CoT) | Анализ документации и логов процессов |
Почему это важно сейчас
Создание экосистемы независимых аудиторов требует времени. Пока мы не видели реальных примеров «схеминга» в дикой природе, сложно понять, как именно его тестировать. Однако откладывание создания стандартов TRA усугубляет ситуацию «курицы и яйца»: оценщики не получат доступ к данным без доказательств научной методологии, а методологию нельзя создать без доступа к данным.
Лаборатория Apollo Research, стоящая за данной инициативой, планирует стать одним из первых провайдеров таких услуг, формируя прецедент для всей индустрии.
Источник: LessWrong ↗
