Главное изменение: эффективность вместо снижения цен
Anthropic выпустила Claude Sonnet 5.5 (модель claude-sonnet-5-5), позиционируя её как оптимизированную версию для повседневных задач, исправления багов и работы с документами. Ключевое отличие от Sonnet 5 — радикальное повышение эффективности: генерация текста стала быстрее на 30%+, а стоимость одной задачи снизилась до 30% за счет меньшего расхода токенов и вызовов инструментов. При этом базовая цена API осталась неизменной: $2 за 1 млн входных токенов и $10 за 1 млн выходных.
Модель доступна через API, а также на AWS, Google Cloud и Microsoft Azure. Это закрытая модель (closed-weights), поэтому самостоятельное развертывание невозможно. По умолчанию включен режим адаптивного мышления (Adaptive thinking) с 5 уровнями глубины рассуждений.
Рекордные результаты в бенчмарках
Claude Sonnet 5.5 демонстрирует прорывные показатели в агентных задачах. В терминальном бенчмарке Terminal-Bench 4.0 модель набрала 70.6%, что является значительным скачком по сравнению с 10.3% у Sonnet 5 и даже превосходит Opus 5.5 (66.4% на уровне Xhigh). Также модель стала первым представителем линейки Sonnet, сумевшим пройти игру Pokémon Red, используя только скриншоты.
| Бенчмарк | Claude Sonnet 5.5 | Claude Sonnet 5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% (Xhigh) | Не сообщено |
| CursorBench 4.0 | 55.5% | Не сообщено | 57.8% | Не сообщено |
| FrontierCode 1.1 (Xhigh) | 52.1% | Не сообщено | Не сообщено | 49.3% |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| OSWorld 2.1 (Computer Use) | 80.1% | Не сообщено | 81.8% | Не сообщено |
| Humanity’s Last Exam (с инструментами) | 64.5% | 54.9% | Не сообщено | Не сообщено |
Экономия для бизнеса: цифры от клиентов
Снижение стоимости достигается не за счет демпинга, а за счет оптимизации. Клиенты Anthropic уже зафиксировали существенную экономию:
- Balyasny Asset Management: расход токенов на ответ снизился с 497K (Sonnet 5) до 121K токенов.
- Base44: для сборки приложения требуется 3.6 итерации против 7.7 у Opus 5.
- Zendesk: скорость обработки тикетов увеличилась на 20%.
При типичной нагрузке в 10 000 задач в месяц экономия может составлять около $1,920 в месяц по сравнению с использованием Sonnet 5.
Технические спецификации и сравнение с конкурентами
Модель поддерживает контекстное окно в 1 млн токенов и генерирует до 128K токенов на выходе. Знания актуальны до июня 2026 года. В сравнении с GPT-6 Sol и Gemini 3.1 Pro, Sonnet 5.5 предлагает конкурентоспособные цены и расширенные возможности работы с изображениями, уступая Gemini только в поддержке видео и аудио.
| Параметр | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview |
|---|---|---|---|
| Цена (вход/выход, $/1M) | $2 / $10 | $2 / $10 | $2 / $12 |
| Контекст | 1M токенов | 1,050,000 токенов | 1,048,576 токенов |
| 128K токенов | 128K токенов | 65,536 токенов | |
| Уровни мышления | 5 уровней (Adaptive) | 6 уровней | Thinking supported |
| Мультимедиа | Текст, изображение | Текст, изображение | Текст, изображение, видео, аудио, PDF |
Важно для разработчиков: изменения в API
При миграции с Sonnet 5 обратите внимание: параметр thinking: {"type": "disabled"} больше не поддерживается. Для отключения или ограничения мышления на уровнях Low/Medium/High необходимо использовать thinking: {"type": "between_tools"}. По умолчанию на платформе Claude установлен уровень High, а в Claude Code — Medium.
Бенчмарки
| Бенчмарк | Claude Sonnet 5 | Claude Sonnet 5.5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 10.3% | 70.6% | 66.4% | — |
| CursorBench 4.0 | — | 55.5% | 57.8% | — |
| FrontierCode 1.1 | — | 52.1% | 54.4% | 49.3% |
| GDPval-AA v2.1 | 1449score | 1844score | 1846score | 1487score |
| OSWorld 2.1 | — | 80.1% | 81.8% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
