Проблема доверия в системах ИИ
В высокорисковых сценариях использования ИИ возникает дилемма: как использовать мощную, но потенциально несовместимую с ценностями модель (Untrusted, U), если она может скрытно предпринять катастрофические действия? Традиционные протоколы, такие как «доверенный мониторинг» или «доверенное редактирование», оставляют риск того, что U обманет менее мощную доверенную модель (Trusted, T).
Авторы исследования (Caleb Biddulph, Adam Kaufman из Redwood Research) предлагают протокол Untrusted Advice. В этой схеме все действия выполняет только доверенная модель T. Модель U может отправлять ей короткие подсказки, но не управляет процессом напрямую. Это создает информационный бутылочное горлышко, которое затрудняет передачу вредоносных инструкций, но сохраняет полезность.
Экспериментальные данные: SWE-bench и BashArena
Исследователи протестировали протокол на бенчмарках SWE-bench Verified и BashArena. В качестве модели U использовался Claude Sonnet 4.6, а в роли доверенных исполнителей T выступали Gemini 3.1 Flash Lite и gpt-oss-120b. Ключевым параметром было ограничение длины сообщения от U до T.
Результаты демонстрируют парадоксально высокую эффективность при минимальных затратах информации:
| Метрика / Параметр | Значение / Результат |
|---|---|
| Размер канала (SWE-bench) | 16 символов на шаг |
| Восстановление разрыва в производительности | ~67% (от разницы между U и T) |
| Общий объем информации на задачу | ~320 символов |
| Примеры эффективных подсказок | "curl" (4 символа), "fw.py" (5 символов), "del L97" (7 символов) |
| Безопасность при неограниченном канале | Полезность стремится к 1.0, но безопасность падает (U управляет T полностью) |
Почему это важно для безопасности
Главное преимущество подхода — интерпретируемость и контроль. Поскольку канал связи узкий:
- Трудно скрыть зло: U сложно заставить T выполнить действие, которое T само бы не предприняло, из-за недостатка информации для детальной манипуляции.
- Легкий аудит: Человеку-аудитору проще проверить короткую строку из 16 символов, чем анализировать длинные логи действий сложной модели.
- Естественный язык: Подсказки должны быть понятны T, что делает их читаемыми и для доверенного монитора, отслеживающего U.
Сравнение с индустриальными практиками
Авторы отмечают, что компания Anthropic внедрила похожий механизм «advisor tool» в Claude Code для экономии затрат, но без строгих ограничений на длину сообщений. В отличие от них, данный протокол фокусируется на максимальной безопасности (near-maximal safety), жертвуя частью потенциальной полезности ради гарантии того, что U не сможет взять контроль над системой через длинный текст.
Исследование подтверждает, что даже при экстремальных ограничениях канала связи (всего 4-16 символов на шаг) слабая модель может эффективно использовать интеллект сильной модели, оставаясь при этом под надежным контролем.
Источник: LessWrong ↗
