Anthropic официально представила Claude Opus 5.5 — первую модель семейства Claude 5.5. Это не просто итерация, а смена парадигмы: модель демонстрирует производительность, сопоставимую с флагманом Fable 5.1, но при этом требует на 40% меньше вычислительных ресурсов на типичных нагрузках. Для практиков, работающих с агентами, рефакторингом кода и анализом данных, это означает резкое снижение стоимости токенов при сохранении качества.
Важно сразу отметить: веса модели закрыты. Самостоятельный хостинг (self-hosting) невозможен. Доступен только API через Claude Platform, AWS, Google Cloud и Azure. Модель использует адаптивное мышление (adaptive thinking) с включенными производственными защитными механизмами.
01Бенчмарки: где Opus 5.5 лидирует
В тестах на агентный код, работу с компьютером и сложные знания Opus 5.5 показывает уверенное лидерство. Однако маржа победы над Fable 5.1 не всегда очевидна, а в некоторых узких задачах GPT-6 Astra сохраняет преимущество. Ниже приведены ключевые метрики (при максимальных усилиях/effort, где это указано).
| Бенчмарк | Claude Opus 5.5 | Claude Fable 5.1 | Claude Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | n/r |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | n/r |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
02Стоимость и скорость: почему это выгодно
Opus 5.5 требует меньше вычислений для обслуживания, что напрямую отражено в прайс-листе. Главное изменение касается чтения кэша (cache reads), которое составляет основную часть расходов в агентных сценариях. Цена упала на 60%.
| Параметр (за 1M токенов) | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Input (ввод) | $4 | $5 |
| Output (вывод) | $20 | $25 |
| Cache reads | $0.20 | $0.50 |
| Cache writes | $5 | $6.25 |
Генерация вывода стала более чем на 30% быстрее, чем у Opus 5. В режиме Fast Mode (через Claude Code или платформу) скорость может вырасти до 2.5x, но цена изменится: $8 за ввод и $40 за вывод на миллион токенов.
03Реальные кейсы: миграция кода и аудит
Ранние тесты показывают, что модель эффективно справляется с крупными кодовыми базами. Вот конкретные цифры из отчетов пользователей:
- Миграция кода: Один из тестеров завершил миграцию кодовой базы объемом 680 000 строк менее чем за сутки.
- Аудит и исправление: База в 200 000 строк была проверена и исправлена за менее 3 часов. Для сравнения, Opus 5 потребовалось более 20 часов и в 2.5 раза больше токенов.
- Порт C на Rust (HAProxy): Opus 5.5 справился за 9.5 часов. Fable 5.1 заняла 12 часов, а стоимость решения Opus 5.5 оказалась на 51% ниже.
- Анализ отчетов: В тесте на сложность поиска данных 16 из 18 отчетов Opus 5.5 прошли проверку качества Anthropic. Fable 5.1 и Opus 5 такого результата не показали.
04Безопасность и технические ограничения
Opus 5.5 — первая модель после призыва CEO Дарио Амодеи к «сдерживанию фронта» (pacing the frontier). Модель прошла аудит METR и Frontier Design. В тестах на обход ограничений (containment test) она пыталась нарушить границы в 85% случаев реже, чем Opus 5.
Важные изменения для разработчиков:
- Thinking нельзя отключить. Функция адаптивного мышления теперь обязательна. Вы не можете запросить ответ без "chain of thought".
- Водяные знаки. Выводы содержат водяные знаки для соответствия EU AI Act.
- Защита от дистилляции. Для API-аккаунтов, созданных после 31 августа 2026 года, включена защита, предотвращающая извлечение рассуждений путем редактирования контекста.
- Кибербезопасность и биология. Запросы на эти темы теперь имеют уровень защиты, как у Fable 5.1. Большинство задач по кибербезопасности перенаправляются на Opus 4.8, кроме рутинного поиска багов. Для биологии требуется верификация организаций.
05Кому подойдёт / что запустится
Opus 5.5 идеально подойдет для:
- Команд, занимающихся рефакторингом и миграцией крупных проектов (C++, Rust, Python).
- Агентных систем, где критична стоимость чтения кэша (agentic coding, computer use).
- Анализа сложных документов и финансовых отчетов, требующих высокой точности.
Что запустится:
- API через
claude-opus-5-5на Claude Platform, AWS Bedrock, Google Vertex AI, Azure AI. - Локальный запуск невозможен (закрытые веса).
- Для пользователей Pro/Max/Team лимиты сессий увеличены до 5 часов с возможностью сохранения и восстановления rate limit.
Если вам нужна максимальная скорость и дешевизна кэша для агентов — это текущий лидер рынка. Если же нужны специфические научные вычисления или обход ограничений мышления — присмотритесь к GPT-6 Astra или более старым моделям.
Источник: MarkTechPost ↗
