Суть инициативы
В августе 2026 года организация Second Look Research (SLR) анонсировала летнюю стажировку, посвященную эмпирической репликации исследований в области AI-безопасности. Ключевая идея: вместо того чтобы ждать, пока крупные лаборатории (Anthropic, OpenAI, xAI) включат все метрики в системные карточки, независимые исследователи должны непрерывно проверять, сохраняются ли свойства безопасности на новых версиях моделей.
Проект уже выявил, что такие эксперименты, как мониторинг цепочек рассуждений (CoT) от Google или тесты на «заполнители» (filler tokens) от Райана Гринблатта, остаются актуальными даже для моделей уровня GPT-5.5. Эти свойства не теряют ценности со временем, но часто игнорируются в стандартных evals.
Почему это важно: пробелы в текущих оценках
Стандартные оценки способностей и рисков (от METR, Apollo, Palisade) часто упускают из виду менее очевидные, но критичные уязвимости. SLR фокусируется на тестах, которые редко попадают в публичные отчеты:
- Контроль внутреннего состояния (Internal state control): возможность манипулировать скрытыми слоями модели.
- Peer preservation: склонность моделей защищать другие модели или свои копии.
- Filler token evals: использование нейтральных токенов для сокрытия дополнительных рассуждений в одном проходе (forward pass).
- Subliminal learning: скрытое обучение на основе подсознательных сигналов.
Логистика и стоимость
Главный барьер для репликации — сложность настройки кода. SLR решает эту проблему, заранее воспроизводя оригинальные эксперименты и создавая «чистые» репозитории. После этого запуск теста на новой модели требует всего одной команды в терминале или промпта в LLM.
Процесс выглядит так:
- Выход новой модели.
- Доверенный студент-бакалавр запускает отобранные эксперименты (ночной цикл).
- Стоимость вычислений и работы: от $0 до $5,000 за цикл.
- Результаты проверяются старшим исследователем и публикуются.
Планы на осень 2026
В ближайшие месяцы SLR планирует запустить пилот с одним неполноценным сотрудником (undergrad) и ограниченным бюджетом. В список приоритетных репликаций входят:
- Эксперименты по обучению Claude (midtraining).
- Тесты на следование подсказкам CoT.
- Скрытые ролевые игры для измерения антиадаптивного рассуждения.
Если пилот покажет эффективность, проект может быть масштабирован. Это создает новую карьерную траекторию для молодых исследователей, позволяя им вносить вклад в безопасность AI без необходимости писать полноценные академические статьи.
Источник: LessWrong ↗
