Исследования28 июля 2026 г., 03:16 МСК🤖 Auto

AI-контроль: Слабая модель становится сильной через узкий канал связи

Исследование Redwood Research показывает, что ограничение канала связи между мощным и слабым ИИ на 16 символов восстанавливает 67% разрыва в производительности, обеспечивая высокий уровень безопасности.

Баннер новости 4504

Проблема доверия в системах ИИ

В высокорисковых сценариях использования ИИ возникает дилемма: как использовать мощную, но потенциально несовместимую с ценностями модель (Untrusted, U), если она может скрытно предпринять катастрофические действия? Традиционные протоколы, такие как «доверенный мониторинг» или «доверенное редактирование», оставляют риск того, что U обманет менее мощную доверенную модель (Trusted, T).

Авторы исследования (Caleb Biddulph, Adam Kaufman из Redwood Research) предлагают протокол Untrusted Advice. В этой схеме все действия выполняет только доверенная модель T. Модель U может отправлять ей короткие подсказки, но не управляет процессом напрямую. Это создает информационный бутылочное горлышко, которое затрудняет передачу вредоносных инструкций, но сохраняет полезность.

Экспериментальные данные: SWE-bench и BashArena

Исследователи протестировали протокол на бенчмарках SWE-bench Verified и BashArena. В качестве модели U использовался Claude Sonnet 4.6, а в роли доверенных исполнителей T выступали Gemini 3.1 Flash Lite и gpt-oss-120b. Ключевым параметром было ограничение длины сообщения от U до T.

Результаты демонстрируют парадоксально высокую эффективность при минимальных затратах информации:

Метрика / Параметр Значение / Результат
Размер канала (SWE-bench) 16 символов на шаг
Восстановление разрыва в производительности ~67% (от разницы между U и T)
Общий объем информации на задачу ~320 символов
Примеры эффективных подсказок "curl" (4 символа), "fw.py" (5 символов), "del L97" (7 символов)
Безопасность при неограниченном канале Полезность стремится к 1.0, но безопасность падает (U управляет T полностью)

Почему это важно для безопасности

Главное преимущество подхода — интерпретируемость и контроль. Поскольку канал связи узкий:

  • Трудно скрыть зло: U сложно заставить T выполнить действие, которое T само бы не предприняло, из-за недостатка информации для детальной манипуляции.
  • Легкий аудит: Человеку-аудитору проще проверить короткую строку из 16 символов, чем анализировать длинные логи действий сложной модели.
  • Естественный язык: Подсказки должны быть понятны T, что делает их читаемыми и для доверенного монитора, отслеживающего U.

Сравнение с индустриальными практиками

Авторы отмечают, что компания Anthropic внедрила похожий механизм «advisor tool» в Claude Code для экономии затрат, но без строгих ограничений на длину сообщений. В отличие от них, данный протокол фокусируется на максимальной безопасности (near-maximal safety), жертвуя частью потенциальной полезности ради гарантии того, что U не сможет взять контроль над системой через длинный текст.

Исследование подтверждает, что даже при экстремальных ограничениях канала связи (всего 4-16 символов на шаг) слабая модель может эффективно использовать интеллект сильной модели, оставаясь при этом под надежным контролем.

Источник: LessWrong ↗