Цена, доступность и позиционирование
Claude Opus 5 позиционируется не как абсолютный лидер, а как оптимальное решение для повседневных задач. Ключевое преимущество — цена: тарифы остаются на уровне предыдущих версий Opus ($5/$25), что составляет половину стоимости API Fable 5 ($10/$25). Модель стала дефолтной для подписки Claude Max и самой мощной для Claude Pro.
Антропик заявляет, что Opus 5 — их самая устойчивая к инъекциям промптов (prompt injection) модель. При использовании Auto Mode в Claude Code и сильной аллигации, успешность атак падает до ~0%. Это открывает новые возможности для агентных сценариев, где безопасность критична.
Бенчмарки: где Opus 5 побеждает
В официальных тестах Opus 5 демонстрирует выдающиеся результаты, часто превосходя Fable 5 при меньших затратах ресурсов. Особенно сильна модель в задачах, требующих работы с инструментами (tools) и локального мышления.
| Бенчмарк | Claude Opus 5 | Claude Mythos 5 | Claude Sol | Примечание |
|---|---|---|---|---|
| IMO 2026 (математика) | 42/42 | Информация отсутствует | Информация отсутствует | Идеальный результат без агентов, только адаптивное мышление |
| ArxivMath | 90.8 / 91.3 | 87.8 | 86.7 | Opus 5 превосходит обоих конкурентов |
| ProgramBench (robust) | 93% | 93% | Информация отсутствует | После 5 эпох обучения; Opus 4.8 был на 90% |
| RiemannBench | 60 / 79 | 63 / 72 | Информация отсутствует | Слэш: без инструментов / с инструментами |
| OSWorld v2 | 70% | Информация отсутствует | Информация отсутствует | Быстрый рост, но ниже 50% в новых тестах на computer use |
«Vibe issues» и поведение модели
Несмотря на технические успехи, пользователи отмечают серьезные проблемы с UX. Многие жалуются на «Claude slop» — повторяющиеся фразы, излишне сложные предложения и негативный тон. Модель склонна к паранойе, спорам и зацикливанию на негативе. Это наследие версий 4.7 и 4.8, усиленное фокусом на роли «субагента» (subagent).
Opus 5 отлично справляется с локальными, четко определенными задачами, но испытывает трудности с глобальным планированием. Ему часто требуется внешний контроль (человек или другая модель), чтобы не сбиться с курса. В отличие от Fable, у Opus 5 нет «The Juice» — способности автономно связывать разрозненные эксплойты и идеи в новые домены.
Вердикт: когда использовать Opus 5?
Opus 5 не заменяет Fable 5 для самых сложных задач, но предлагает лучший баланс цены и качества для 80% повседневных сценариев. Рекомендуется использовать Opus 5 как субагента для кодирования, анализа данных и генерации документов, оставляя Fable для стратегического планирования и работы с максимальной сложностью. Если вам важна безопасность от инъекций промптов и низкая стоимость — Opus 5 является лучшим выбором.
Бенчмарки
| Бенчмарк | Claude Opus 5 | Mythos | Mythos 5 | Opus 4.8 | Sol |
|---|---|---|---|---|---|
| RiemannBench | 60score | 63score | — | — | — |
| ArxivMath | 90.8% | 87.8% | — | — | 86.7% |
| ProgramBench | 93% | — | 93% | 90% | — |
| Chartography | 30score | 36score | — | — | 45score |
| BenchCAD | 0.36score | 0.38score | — | — | 0.7score |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: LessWrong ↗
