Релиз модели1 июля 2026 г., 04:16 МСК🤖 Auto

Anthropic выпустила Claude Sonnet 5: новый лидер по соотношению цена/качество для агентов

Anthropic представила Claude Sonnet 5, модель, закрывающую разрыв с флагманским Opus 4.8 в задачах агентного программирования. Новая модель стала дефолтной для Free и Pro-планов, предлагая агрессивные цены на старте и улучшенную безопасность.

Баннер новости 2680

Ключевые изменения и позиционирование

Claude Sonnet 5 официально запущен 30 июня 2026 года. Anthropic позиционирует его как свою самую «агентную» модель среднего сегмента. В отличие от предыдущих версий, акцент сделан не на одном абстрактном бенчмарке, а на надежности выполнения длинных цепочек задач: планировании, управлении браузерами и терминалами в автономном режиме. Модель стала дефолтной для пользователей Free и Pro-планов, а также доступна в Claude Code и через API для тарифов Max, Team и Enterprise.

Бенчмарки: закрываем разрыв с Opus

Самое важное для разработчиков — Sonnet 5 превосходит своего предшественника (Sonnet 4.6) во всех опубликованных тестах и существенно сокращает отставание от флагмана Opus 4.8. Особенно впечатляющий прогресс показан в задачах агентного программирования и работы с операционной системой.

Бенчмарк Sonnet 4.6 Sonnet 5 Opus 4.8
SWE-bench Pro (агентное кодинг) 58.1% 63.2% 69.2%
Terminal-Bench 2.1 67.0% 80.4% не сообщено
OSWorld-Verified (computer use) 78.5% 81.2% не сообщено
Humanity’s Last Exam (с инструментами) 46.8% 57.4% 57.9%
GDPval-AA v2 (знания) не сообщено 1,618 1,615

Интересный факт: на бенчмарке знаний GDPval-AA v2 Sonnet 5 (1,618 балла) даже немного опережает Opus 4.8 (1,615 балла), хотя шкалы оценок там специфичны. При этом в задачах, критичных к точности, Opus 4.8 остается лидером.

Ценообразование и токенизация

Anthropic ввела новые тарифы, чтобы сделать агентные задачи доступнее. Вводится система уровней усилий (effort levels): low, medium, high, xhigh. Чем выше уровень, тем больше токенов тратится на рассуждения, что повышает качество, но и стоимость.

  • Вводные цены (до 31 августа 2026): $2 за миллион входных токенов (MTok), $10 за выходные.
  • Стандартные цены (после 31 августа): $3/$15 за MTok.
  • Opus 4.8: $5/$25 за MTok.

Важно учитывать новую токенизацию (ту же, что в Opus 4.7): один и тот же текст может занимать от 1.0 до 1.35 раза больше токенов. Это нужно закладывать в расчеты стоимости.

Практическое применение и безопасность

Ранние тесты показывают, что Sonnet 5 отлично справляется с многошаговым инженерным трудом: от написания тестов для воспроизведения багов до исправления сложных pull-реквестов в legacy-коде. Также модель эффективна в бизнес-автоматизации (например, интеграция Salesforce и email-рассылок) и исследовании данных.

Anthropic намеренно снизила кибербезопасные возможности Sonnet 5 по сравнению с Opus, чтобы минимизировать риски. Для задач, требующих высокой точности или санкционированной кибер-деятельности, рекомендуется использовать Opus 4.8. Для массовых, высокочастотных запросов с низкой задержкой остается Haiku 4.5.

Как начать работу

Миграция с Sonnet 4.6 требует минимальных усилий — достаточно изменить строку модели в API-запросе на claude-sonnet-5. Модель поддерживает контекстное окно в 1 миллион токенов и стандартное кэширование промптов (чтение кэша по цене 0.1x входных токенов).

Бенчмарки

БенчмаркSonnet 5Opus 4.8Sonnet 4.6
SWE-bench Pro63.2%69.2%58.1%
Terminal-Bench 2.180.4%67%
OSWorld-Verified81.2%78.5%
Humanity’s Last Exam (with tools)57.4%57.9%46.8%
GDPval-AA v21618score1615score

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗