Ключевые изменения API и ценообразование
Claude Opus 5 заменяет Opus 4.8 в качестве флагмана линейки. Цены остаются неизменными: $5 за 1 млн входных токенов и $25 за 1 млн выходных. Контекстное окно зафиксировано на уровне 1M токенов (по умолчанию и максимум). Модель теперь является базовой для Claude Max и самой мощной для Claude Pro.
Разработчикам необходимо обновить интеграции. Режим thinking включен по умолчанию. Параметр effort управляет глубиной рассуждений. Важно: попытка отключить мышление (thinking: {"type": "disabled"}) при уровне усилий xhigh или max вернет ошибку 400. Также Anthropic рекомендует удалить из промптов инструкции о финальной проверке, так как модель теперь верифицирует свои ответы самостоятельно.
Результаты в агентном программировании и бенчмарках
Самые значимые улучшения наблюдаются в задачах, требующих автономных действий. Opus 5 демонстрирует лидерство в агентных сценариях, обходя конкурентов по ключевым метрикам выполнения задач.
| Бенчмарк | Claude Opus 5 (max/xhigh) | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| FrontierBench v0.1 | 43.3% - 44.4% | 18.7% | 33.7% | 37.5% |
| OSWorld 2.0 | 70.57% | 55.7% | — | — |
| Zapier AutomationBench | 26.0% | 17.0% | 17.4% | — |
| SWE-bench Verified | 96.0% | — | — | — |
| SWE-bench Pro | 79.2% | — | 80.0% | — |
| ARC-AGI-3 | 30.16% | 1.52% | — | 7.78% |
Решение задач IMO и безопасность
В области чистого рассуждения Opus 5 показала золотой уровень: она решила все 6 задач с олимпиады IMO 2026 (42/42 правильных решений), что значительно выше порога в 29/42. В ARC-AGI-3 результат составил 30.16% — примерно в 4 раза лучше предыдущих рекордов.
В сфере кибербезопасности Anthropic сняла ограничения только на поиск уязвимостей в исходном коде. Генерация эксплойтов и пентест бинарных файлов остаются заблокированными. Это позволило снизить ложные срабатывания классификаторов безопасности на 85% по сравнению с Fable 5, не жертвуя способностью находить баги.
Мультимодальность и инструменты
Использование инструментов (tools) оказалось эффективнее простого увеличения вычислений на рассуждения. На датасете Chartography результат вырос с 29.6% до 83.0% при подключении контейнера и инструмента для обрезки изображений. В BenchCAD Vision2Code метрика voxel IoU поднялась с 0.366 до 0.821, что превосходит Claude Mythos 5 (0.678).
Anthropic также отмечает, что Opus 5 склонна к чуть более частым фактическим галлюцинациям, чем Opus 4.8, что требует внимательности при использовании в критических сценариях.
Бенчмарки
| Бенчмарк | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| SWE-bench Pro | 79.2% | 80% | — | — |
| OSWorld 2.0 | 70.57% | — | 55.7% | — |
| Zapier AutomationBench | 26% | 17.4% | 17% | — |
| ARC-AGI-3 | 30.16% | — | 1.52% | 7.78% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
