Ключевые изменения и позиционирование
Claude Sonnet 5 официально запущен 30 июня 2026 года. Anthropic позиционирует его как свою самую «агентную» модель среднего сегмента. В отличие от предыдущих версий, акцент сделан не на одном абстрактном бенчмарке, а на надежности выполнения длинных цепочек задач: планировании, управлении браузерами и терминалами в автономном режиме. Модель стала дефолтной для пользователей Free и Pro-планов, а также доступна в Claude Code и через API для тарифов Max, Team и Enterprise.
Бенчмарки: закрываем разрыв с Opus
Самое важное для разработчиков — Sonnet 5 превосходит своего предшественника (Sonnet 4.6) во всех опубликованных тестах и существенно сокращает отставание от флагмана Opus 4.8. Особенно впечатляющий прогресс показан в задачах агентного программирования и работы с операционной системой.
| Бенчмарк | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Pro (агентное кодинг) | 58.1% | 63.2% | 69.2% |
| Terminal-Bench 2.1 | 67.0% | 80.4% | не сообщено |
| OSWorld-Verified (computer use) | 78.5% | 81.2% | не сообщено |
| Humanity’s Last Exam (с инструментами) | 46.8% | 57.4% | 57.9% |
| GDPval-AA v2 (знания) | не сообщено | 1,618 | 1,615 |
Интересный факт: на бенчмарке знаний GDPval-AA v2 Sonnet 5 (1,618 балла) даже немного опережает Opus 4.8 (1,615 балла), хотя шкалы оценок там специфичны. При этом в задачах, критичных к точности, Opus 4.8 остается лидером.
Ценообразование и токенизация
Anthropic ввела новые тарифы, чтобы сделать агентные задачи доступнее. Вводится система уровней усилий (effort levels): low, medium, high, xhigh. Чем выше уровень, тем больше токенов тратится на рассуждения, что повышает качество, но и стоимость.
- Вводные цены (до 31 августа 2026): $2 за миллион входных токенов (MTok), $10 за выходные.
- Стандартные цены (после 31 августа): $3/$15 за MTok.
- Opus 4.8: $5/$25 за MTok.
Важно учитывать новую токенизацию (ту же, что в Opus 4.7): один и тот же текст может занимать от 1.0 до 1.35 раза больше токенов. Это нужно закладывать в расчеты стоимости.
Практическое применение и безопасность
Ранние тесты показывают, что Sonnet 5 отлично справляется с многошаговым инженерным трудом: от написания тестов для воспроизведения багов до исправления сложных pull-реквестов в legacy-коде. Также модель эффективна в бизнес-автоматизации (например, интеграция Salesforce и email-рассылок) и исследовании данных.
Anthropic намеренно снизила кибербезопасные возможности Sonnet 5 по сравнению с Opus, чтобы минимизировать риски. Для задач, требующих высокой точности или санкционированной кибер-деятельности, рекомендуется использовать Opus 4.8. Для массовых, высокочастотных запросов с низкой задержкой остается Haiku 4.5.
Как начать работу
Миграция с Sonnet 4.6 требует минимальных усилий — достаточно изменить строку модели в API-запросе на claude-sonnet-5. Модель поддерживает контекстное окно в 1 миллион токенов и стандартное кэширование промптов (чтение кэша по цене 0.1x входных токенов).
Бенчмарки
| Бенчмарк | Sonnet 5 | Opus 4.8 | Sonnet 4.6 |
|---|---|---|---|
| SWE-bench Pro | 63.2% | 69.2% | 58.1% |
| Terminal-Bench 2.1 | 80.4% | — | 67% |
| OSWorld-Verified | 81.2% | — | 78.5% |
| Humanity’s Last Exam (with tools) | 57.4% | 57.9% | 46.8% |
| GDPval-AA v2 | 1618score | 1615score | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
