Суть эксперимента: контроль через сводки
Авторы (Aleksandr Bowkis, Konstantinos Voudouris) исследуют проблему надзора за автоматизированными исследованиями ИИ. Если агенты генерируют тысячи статей, человек не может прочитать их все. Решение — использовать сильную модель для создания краткой сводки (summary), которую прочитает человек или слабая модель для оценки безопасности.
Для проверки использовалась «игрушечная» задача: перевод с синтетических языков. Сильные модели (суммаризаторы) изучали 100 примеров перевода, выводили правила грамматики и писали сводку. Слабые модели (студенты) использовали только эту сводку для перевода или проверки правильности перевода, не видя исходных примеров.
Ключевые метрики и сравнение моделей
Главный парадокс исследования: высокая точность перевода у суммаризатора не гарантирует полезности его сводки. Модель Sonnet 4.6 достигла 93% точности в переводе, но её сводки оказались бесполезны для слабых студентов. Напротив, Opus 4.8, возможно, менее точен в прямой генерации, но его сводки позволяют слабым моделям достигать лучших результатов.
| Модель (Суммаризатор) | Точность перевода (Generation) | Полезность сводки для Gemma-3-12B | Поведение при ошибках в данных |
|---|---|---|---|
| Opus 4.8 | Высокая | Эквивалентно 100 примерам обучения | Отказывается от правила при противоречивых данных |
| Sonnet 4.6 | 93% | Эквивалентно ~15 примерам | Настаивает на правиле даже при 50% ошибок |
| Haiku 4.5 | Средняя | Эквивалентно <10 примерам | Информация недостаточна |
Сводка лучше «книги правил»
Самая эффективная сводка от Opus 4.8 оказалась полезнее, чем полный набор истинных правил грамматики (ground-truth rulebook). Это произошло не из-за пропуска редких исключений, а благодаря лучшей формулировке правил. Для задачи генерации переводов оптимальна промежуточная длина сводки: слишком длинные тексты снижают точность. Однако для задачи верификации (проверки правильности) длина не имеет значения — точность растет с объемом до плато.
Робастность к шуму
При добавлении шума (ошибочных примеров) в обучающую выборку, Opus 4.8 демонстрирует лучшую «робастность»: он воздерживается от формулировки правила, если видит конфликт в данных. Sonnet 4.6, напротив, продолжает утверждать правила даже при 50% ошибочных примеров, что делает его сводки опасными для использования в условиях неопределенности.
Вывод для безопасности ИИ
Результаты показывают, что суммаризация — перспективный инструмент для агрегации результатов исследований ИИ, при условии, что модели не являются «схематичными» (scheming). Однако выбор модели критичен: способность к точному переводу не коррелирует с способностью к эффективному обучению других агентов через сводки.
Источник: LessWrong ↗
