Исследования31 июля 2026 г., 19:18 МСК🤖 Auto

DeepMind: Цепочка рассуждений — ключ к безопасности AGI

Google DeepMind опубликовала отчет за июль 2026 года, подтвердив, что Chain-of-Thought (CoT) остается критически важным инструментом для мониторинга. Команда ASAT сместила фокус на интеграцию мер безопасности в продакшн Gemini.

Баннер новости 4825

Смена парадигмы: от теории к продакшену

Команда AGI Safety and Alignment Team (ASAT) Google DeepMind представила обновленный обзор работы за два года. Главный вывод: индустрия достигла консенсуса, что Chain-of-Thought (CoT) — это не «черный ящик», а необходимый инструмент для прозрачности. Раньше считалось, что CoT часто неискренен (unfaithful), но новые данные показывают: на сложных задачах, требующих глубокого рассуждения, модель вынуждена использовать CoT для получения правильного ответа, что делает его информативным.

Технические прорывы и метрики

Исследователи ввели метрику Opaque Serial Depth для оценки прозрачности новых архитектур (включая текстовые диффузионные модели, такие как DiffusionGemma). Также разработана система оценки способности моделей к скрытности (stealth) и ситуационной осведомленности (situational awareness) в условиях отсутствия мониторинга.

Направление Ключевое достижение / Публикация Значение для безопасности
Chain-of-Thought «When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors» Доказано, что на сложных задачах LLM не могут скрыть логику от мониторов.
Frontier Safety Обновление Frontier Safety Framework (FSF) Первая в отрасли секция по misalignment; позволила внедрить probes в инфраструктуру заранее.
Deep Alignment «SFT Drives Gemini’s Safety Properties» Анализ влияния пост-обучения (SFT) на безопасность моделей Gemini; переход к синтетическим данным.
Интерпретируемость Разработка pragmatic autorater Автоматическая оценка «читаемости» мыслей модели на естественном языке.

Почему это важно сейчас?

DeepMind перешла в стадию «midgame», где безопасность интегрируется непосредственно в продукты (Gemini). Ключевым риском становится не отсутствие контроля, а потеря прозрачности CoT. Поэтому команда фокусируется на:

  • Сохранении прозрачности рассуждений как можно дольше.
  • Разработке систем AI Control на случай, если мониторинг CoT станет невозможным.
  • Тесном сотрудничестве с командами Gemini для внедрения мер безопасности до масштабного развертывания.

Отчет подчеркивает, что прогресс в выравнивании текущих моделей напрямую переносится на будущие системы, способные ускорять AI-исследования, что делает безопасность Gemini критически важной для предотвращения экзистенциальных рисков.

Источник: LessWrong ↗