Исследования6 сентября 2026 г., 03:17 МСК🤖 Auto

Анализ рисков Claude Mythos 5.1: споры о CB-2 и нехватка ресурсов

Независимый обзор LessWrong подтвердил вывод Anthropic о том, что Claude Mythos 5.1 не достигает порога CB-2, но вскрыл критические методологические пробелы в оценке биологических рисков.

Баннер новости 6875

Суть конфликта: CB-2 и субъективность

Аналитики из сообщества LessWrong (автор Parv Mahajan) провели рецензию System Card модели Claude Mythos 5.1 от Anthropic. Ключевой вопрос касался порога CB-2 — способности модели заменить высококвалифицированных экспертов в проектировании нового химического или биологического оружия. Anthropic заявила, что Mythos 5.1 не достигает этого уровня. Эксперты согласны с выводом, но указывают на то, что оценка опирается на слишком узкую выборку: всего 3 эксперта оценивали потенциал модели в создании химического оружия, а общее число участников — менее 10 человек.

Проблема «недоэlicitации» в автоматических тестах

Самое серьезное замечание касается автоматической оценки на задаче моделирования последовательностей РНК. Исследователи отмечают дисбаланс ресурсов между человеком и ИИ, что может приводить к занижению способностей модели (underelicitation). В то время как исследователи Anthropic получают зарплату ~$150–250/час, бюджет модели на задачу ограничен 1 млн токенов (стоимость ~$50) и 2 часами вычислений.

Параметр Человеческий эксперт Claude Mythos 5.1
Временной лимит 2–3 часа 2 часа (бюджет tool-call)
Вычислительные ресурсы Не ограничено (человеческий интеллект) 1 GPU, 1 млн токенов
Экономическая эквивалентность ~$150–250/час ~$50 за 1 млн токенов
Оценка дисбаланса Люди имели в 2–10 раз больше ресурсов для решения задачи

Отсутствие независимого аудита

Критики подчеркивают, что в отличие от оценки рисков автономности, для биологических угроз (CB) не проводилось предварительной проверки третьими сторонами. Anthropic не предоставила доступ к закрытым данным для независимого верификационного аудита. Это особенно тревожно, так как с мая 2026 года (дата последнего обновления автоматических тестов в System Card Opus 4.8) новые методы оценки CB-2 не разрабатывались.

Выводы и рекомендации

Хотя консенсус заключается в том, что Mythos 5.1 безопасен в контексте CB-2, текущая методология признана устаревшей для будущих, более мощных моделей. Авторы рецензии требуют от Anthropic:

  • Масштабировать число привлекаемых экспертов.
  • Разработать новые автоматические метрики, не зависящие от субъективной оценки.
  • Провести независимый аудит рисков с доступом к закрытым данным для сторонних организаций.

Источник: LessWrong ↗