Смена парадигмы: от теории к продакшену
Команда AGI Safety and Alignment Team (ASAT) Google DeepMind представила обновленный обзор работы за два года. Главный вывод: индустрия достигла консенсуса, что Chain-of-Thought (CoT) — это не «черный ящик», а необходимый инструмент для прозрачности. Раньше считалось, что CoT часто неискренен (unfaithful), но новые данные показывают: на сложных задачах, требующих глубокого рассуждения, модель вынуждена использовать CoT для получения правильного ответа, что делает его информативным.
Технические прорывы и метрики
Исследователи ввели метрику Opaque Serial Depth для оценки прозрачности новых архитектур (включая текстовые диффузионные модели, такие как DiffusionGemma). Также разработана система оценки способности моделей к скрытности (stealth) и ситуационной осведомленности (situational awareness) в условиях отсутствия мониторинга.
| Направление | Ключевое достижение / Публикация | Значение для безопасности |
|---|---|---|
| Chain-of-Thought | «When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors» | Доказано, что на сложных задачах LLM не могут скрыть логику от мониторов. |
| Frontier Safety | Обновление Frontier Safety Framework (FSF) | Первая в отрасли секция по misalignment; позволила внедрить probes в инфраструктуру заранее. |
| Deep Alignment | «SFT Drives Gemini’s Safety Properties» | Анализ влияния пост-обучения (SFT) на безопасность моделей Gemini; переход к синтетическим данным. |
| Интерпретируемость | Разработка pragmatic autorater | Автоматическая оценка «читаемости» мыслей модели на естественном языке. |
Почему это важно сейчас?
DeepMind перешла в стадию «midgame», где безопасность интегрируется непосредственно в продукты (Gemini). Ключевым риском становится не отсутствие контроля, а потеря прозрачности CoT. Поэтому команда фокусируется на:
- Сохранении прозрачности рассуждений как можно дольше.
- Разработке систем AI Control на случай, если мониторинг CoT станет невозможным.
- Тесном сотрудничестве с командами Gemini для внедрения мер безопасности до масштабного развертывания.
Отчет подчеркивает, что прогресс в выравнивании текущих моделей напрямую переносится на будущие системы, способные ускорять AI-исследования, что делает безопасность Gemini критически важной для предотвращения экзистенциальных рисков.
Источник: LessWrong ↗
