Релиз модели25 июля 2026 г., 01:16 МСК🤖 Auto

Claude Opus 5: Прорыв в агентном коде и ARC-AGI-3 без изменения цены

Anthropic выпустила Claude Opus 5 с ценой $5/млн входных токенов. Модель лидирует в ARC-AGI-3 (30.16%) и OSWorld 2.0 (70.57%), но требует пересмотра промптов из-за изменений в работе режима «мышления».

Баннер новости 4338

Ключевые изменения API и ценообразование

Claude Opus 5 заменяет Opus 4.8 в качестве флагмана линейки. Цены остаются неизменными: $5 за 1 млн входных токенов и $25 за 1 млн выходных. Контекстное окно зафиксировано на уровне 1M токенов (по умолчанию и максимум). Модель теперь является базовой для Claude Max и самой мощной для Claude Pro.

Разработчикам необходимо обновить интеграции. Режим thinking включен по умолчанию. Параметр effort управляет глубиной рассуждений. Важно: попытка отключить мышление (thinking: {"type": "disabled"}) при уровне усилий xhigh или max вернет ошибку 400. Также Anthropic рекомендует удалить из промптов инструкции о финальной проверке, так как модель теперь верифицирует свои ответы самостоятельно.

Результаты в агентном программировании и бенчмарках

Самые значимые улучшения наблюдаются в задачах, требующих автономных действий. Opus 5 демонстрирует лидерство в агентных сценариях, обходя конкурентов по ключевым метрикам выполнения задач.

Бенчмарк Claude Opus 5 (max/xhigh) Claude Opus 4.8 Claude Fable 5 GPT-5.6 Sol
FrontierBench v0.1 43.3% - 44.4% 18.7% 33.7% 37.5%
OSWorld 2.0 70.57% 55.7%
Zapier AutomationBench 26.0% 17.0% 17.4%
SWE-bench Verified 96.0%
SWE-bench Pro 79.2% 80.0%
ARC-AGI-3 30.16% 1.52% 7.78%

Решение задач IMO и безопасность

В области чистого рассуждения Opus 5 показала золотой уровень: она решила все 6 задач с олимпиады IMO 2026 (42/42 правильных решений), что значительно выше порога в 29/42. В ARC-AGI-3 результат составил 30.16% — примерно в 4 раза лучше предыдущих рекордов.

В сфере кибербезопасности Anthropic сняла ограничения только на поиск уязвимостей в исходном коде. Генерация эксплойтов и пентест бинарных файлов остаются заблокированными. Это позволило снизить ложные срабатывания классификаторов безопасности на 85% по сравнению с Fable 5, не жертвуя способностью находить баги.

Мультимодальность и инструменты

Использование инструментов (tools) оказалось эффективнее простого увеличения вычислений на рассуждения. На датасете Chartography результат вырос с 29.6% до 83.0% при подключении контейнера и инструмента для обрезки изображений. В BenchCAD Vision2Code метрика voxel IoU поднялась с 0.366 до 0.821, что превосходит Claude Mythos 5 (0.678).

Anthropic также отмечает, что Opus 5 склонна к чуть более частым фактическим галлюцинациям, чем Opus 4.8, что требует внимательности при использовании в критических сценариях.

Бенчмарки

БенчмаркClaude Opus 5Claude Fable 5Claude Opus 4.8GPT-5.6 Sol
SWE-bench Pro79.2%80%
OSWorld 2.070.57%55.7%
Zapier AutomationBench26%17.4%17%
ARC-AGI-330.16%1.52%7.78%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗