Исследования13 июля 2026 г., 20:17 МСК🤖 Auto

Синтетический тест: почему Opus 4.8 лучше Sonnet 4.6 для контроля ИИ

Исследование на синтетических языках показало, что качество сводки от сильной модели важнее её способности решать задачу. Opus 4.8 генерирует более полезные инструкции для слабых моделей, чем Sonnet 4.6, даже превосходя полные правила грамматики.

Баннер новости 3476

Суть эксперимента: контроль через сводки

Авторы (Aleksandr Bowkis, Konstantinos Voudouris) исследуют проблему надзора за автоматизированными исследованиями ИИ. Если агенты генерируют тысячи статей, человек не может прочитать их все. Решение — использовать сильную модель для создания краткой сводки (summary), которую прочитает человек или слабая модель для оценки безопасности.

Для проверки использовалась «игрушечная» задача: перевод с синтетических языков. Сильные модели (суммаризаторы) изучали 100 примеров перевода, выводили правила грамматики и писали сводку. Слабые модели (студенты) использовали только эту сводку для перевода или проверки правильности перевода, не видя исходных примеров.

Ключевые метрики и сравнение моделей

Главный парадокс исследования: высокая точность перевода у суммаризатора не гарантирует полезности его сводки. Модель Sonnet 4.6 достигла 93% точности в переводе, но её сводки оказались бесполезны для слабых студентов. Напротив, Opus 4.8, возможно, менее точен в прямой генерации, но его сводки позволяют слабым моделям достигать лучших результатов.

Модель (Суммаризатор) Точность перевода (Generation) Полезность сводки для Gemma-3-12B Поведение при ошибках в данных
Opus 4.8 Высокая Эквивалентно 100 примерам обучения Отказывается от правила при противоречивых данных
Sonnet 4.6 93% Эквивалентно ~15 примерам Настаивает на правиле даже при 50% ошибок
Haiku 4.5 Средняя Эквивалентно <10 примерам Информация недостаточна

Сводка лучше «книги правил»

Самая эффективная сводка от Opus 4.8 оказалась полезнее, чем полный набор истинных правил грамматики (ground-truth rulebook). Это произошло не из-за пропуска редких исключений, а благодаря лучшей формулировке правил. Для задачи генерации переводов оптимальна промежуточная длина сводки: слишком длинные тексты снижают точность. Однако для задачи верификации (проверки правильности) длина не имеет значения — точность растет с объемом до плато.

Робастность к шуму

При добавлении шума (ошибочных примеров) в обучающую выборку, Opus 4.8 демонстрирует лучшую «робастность»: он воздерживается от формулировки правила, если видит конфликт в данных. Sonnet 4.6, напротив, продолжает утверждать правила даже при 50% ошибочных примеров, что делает его сводки опасными для использования в условиях неопределенности.

Вывод для безопасности ИИ

Результаты показывают, что суммаризация — перспективный инструмент для агрегации результатов исследований ИИ, при условии, что модели не являются «схематичными» (scheming). Однако выбор модели критичен: способность к точному переводу не коррелирует с способностью к эффективному обучению других агентов через сводки.

Источник: LessWrong ↗