Суть конфликта: CB-2 и субъективность
Аналитики из сообщества LessWrong (автор Parv Mahajan) провели рецензию System Card модели Claude Mythos 5.1 от Anthropic. Ключевой вопрос касался порога CB-2 — способности модели заменить высококвалифицированных экспертов в проектировании нового химического или биологического оружия. Anthropic заявила, что Mythos 5.1 не достигает этого уровня. Эксперты согласны с выводом, но указывают на то, что оценка опирается на слишком узкую выборку: всего 3 эксперта оценивали потенциал модели в создании химического оружия, а общее число участников — менее 10 человек.
Проблема «недоэlicitации» в автоматических тестах
Самое серьезное замечание касается автоматической оценки на задаче моделирования последовательностей РНК. Исследователи отмечают дисбаланс ресурсов между человеком и ИИ, что может приводить к занижению способностей модели (underelicitation). В то время как исследователи Anthropic получают зарплату ~$150–250/час, бюджет модели на задачу ограничен 1 млн токенов (стоимость ~$50) и 2 часами вычислений.
| Параметр | Человеческий эксперт | Claude Mythos 5.1 |
|---|---|---|
| Временной лимит | 2–3 часа | 2 часа (бюджет tool-call) |
| Вычислительные ресурсы | Не ограничено (человеческий интеллект) | 1 GPU, 1 млн токенов |
| Экономическая эквивалентность | ~$150–250/час | ~$50 за 1 млн токенов |
| Оценка дисбаланса | Люди имели в 2–10 раз больше ресурсов для решения задачи | |
Отсутствие независимого аудита
Критики подчеркивают, что в отличие от оценки рисков автономности, для биологических угроз (CB) не проводилось предварительной проверки третьими сторонами. Anthropic не предоставила доступ к закрытым данным для независимого верификационного аудита. Это особенно тревожно, так как с мая 2026 года (дата последнего обновления автоматических тестов в System Card Opus 4.8) новые методы оценки CB-2 не разрабатывались.
Выводы и рекомендации
Хотя консенсус заключается в том, что Mythos 5.1 безопасен в контексте CB-2, текущая методология признана устаревшей для будущих, более мощных моделей. Авторы рецензии требуют от Anthropic:
- Масштабировать число привлекаемых экспертов.
- Разработать новые автоматические метрики, не зависящие от субъективной оценки.
- Провести независимый аудит рисков с доступом к закрытым данным для сторонних организаций.
Источник: LessWrong ↗
