Прорыв в агентности и сравнение с Opus 4.8
30 июня 2026 года Anthropic анонсировала Claude Sonnet 5, позиционируя её как самую «агентную» модель в линейке Sonnet. Ключевое отличие новой версии — способность автономно планировать задачи, использовать браузеры и терминалы, а также самостоятельно проверять свой вывод без явных инструкций. По заявлениям компании, производительность Sonnet 5 в задачах на рассуждение, кодинг и работу с инструментами приближается к показателям более дорогой модели Opus 4.8, но при значительно меньшей стоимости.
Ранее наибольший скачок в агентных возможностях наблюдался именно у Opus-класса. Sonnet 5 нивелирует это преимущество, позволяя разработчикам использовать мощные автономные сценарии (agentic workflows) без необходимости платить премию за флагманские модели.
Ценообразование и доступность
Модель доступна всем пользователям платформы Claude, став стандартной для тарифов Free и Pro. Для разработчиков, использующих Claude API, Claude Code и платформу, действуют специальные вводные цены до 31 августа 2026 года, после которых тарифы вырастут. Сравнение стоимости приведено в таблице ниже:
| Параметр | Claude Sonnet 5 (вводная цена до 31.08.2026) | Claude Sonnet 5 (после 31.08.2026) | Claude Opus 4.8 (для сравнения) |
|---|---|---|---|
| Цена за 1 млн входных токенов | $2 | $3 | $5 |
| Цена за 1 млн выходных токенов | $10 | $15 | $25 |
Результаты бенчмарков: BrowseComp и OSWorld
В тестах на агентный поиск BrowseComp и использование компьютера OSWorld-Verified Sonnet 5 демонстрирует строгое улучшение по сравнению с предшественником Sonnet 4.6. При этом Opus 4.8 сохраняет лидерство в задачах, требующих максимальной точности, особенно на уровнях усилий (effort levels) xhigh. Однако Sonnet 5 позволяет найти оптимальный баланс между стоимостью и качеством, закрывая разрыв, который ранее существовал между классами Sonnet и Opus.
Безопасность и киберзащита
Anthropic подчеркивает, что Sonnet 5 не обучалась специально на задачах кибербезопасности. В тестах на создание эксплойтов (например, для браузера Firefox) модель показывает существенно более низкие результаты по сравнению с Opus 4.8 и Claude Mythos Preview, что снижает риски misuse. При этом в целом Sonnet 5 демонстрирует более низкий уровень нежелательного поведения (hallucination, sycophancy) по сравнению с Sonnet 4.6, хотя и уступает Opus 4.8 в некоторых метриках автоматизированного аудита поведения.
Отзывы ранних партнеров
Ранние тестирователи отмечают способность Sonnet 5 завершать сложные многошаговые задачи, где предыдущие версии Sonnet «застревали». Примеры включают:
- Разработка ПО: Автономное написание тестов, исправление багов и стэкинг изменений в «brownfield» коде (устаревших системах) без вмешательства инженера.
- Автоматизация: Завершение цепочек задач от обновления данных (Salesforce) до отправки уведомлений.
- Юриспруденция и данные: Ускорение анализа прецедентов в Lovable и мгновенная обработка данных в ClickHouse.
Модель доступна через API по идентификатору claude-sonnet-5.
Источник: Anthropic ↗
