Новая стратегия: Уровень Fable, цена Opus
Anthropic представила Claude Opus 5.5 — первую модель в семействе 5.5. Ключевое предложение компании звучит так: производительность на уровне флагмана Fable 5.1 при стоимости, которая на 40% ниже, чем у предыдущего поколения Opus 5. Это не просто итерация, а сдвиг парадигмы ценообразования. Модель доступна с опцией Zero Data Retention (ZDR), хотя эксперты отмечают, что использование ZDR для модели уровня Fable 5.1 выглядит противоречиво с точки зрения безопасности данных.
Ценообразование и эффективность
Новая модель предлагает агрессивное ценообразование, конкурирующее с новыми тарифами OpenAI. Ниже приведено сравнение базовых тарифов:
| Параметр | Claude Opus 5.5 | Claude Opus 5 | GPT-6 Sol (OpenAI) |
|---|---|---|---|
| Input (за 1M токенов) | $4 | $5 | $2 |
| Output (за 1M токенов) | $20 | $25 | $10 |
| Кэширование (Input) | $0.20 | — | — |
| Fast Mode (Input/Output) | $8 / $40 | — | — |
Anthropic заявляет о росте скорости на 30% и снижении общих затрат на типичных нагрузках на 40%. Для сравнения, OpenAI снизила цены на GPT-6 Sol на 50% ($2/$10), делая ставку на микс моделей, тогда как Anthropic рекомендует использовать Opus 5.5 для большинства задач.
Бенчмарки: Лидерство в интеллекте
По данным независимого аналитического агентства Artificial Analysis, Claude Opus 5.5 занимает четкое лидерство в общем интеллекте с оценкой 58. Модель демонстрирует доминирование над конкурентами, включая GPT-6 Astra, в большинстве метрик, за исключением узких специализированных областей.
| Метрика / Бенчмарк | Claude Opus 5.5 (xhigh) | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| AA Intelligence Score | 58 | — | — |
| Terminal-Bench-Science 0.1 | 62% | 63% | — |
| Omniscience Index | 46 | 43 | 43 |
| WeirdML v3 | 31.2% | 42.2% | 26% |
| ProgramBench (полное решение) | 18.5% | 5.5% | 7% |
Особенно впечатляющий скачок наблюдается в ProgramBench, где Opus 5.5 показывает результат 18.5% против 7% у Fable 5.1. В метрике Omniscience Opus 5.5 выигрывает за счет меньшего количества галлюцинаций и готовности признать незнание.
Качество общения и «человечность»
Anthropic сделала акцент на улучшении коммуникации. Модель стала «более приятной» в диалоге, лучше структурирует ответы и следует заданным правилам письма. Тестировщики отмечают, что Opus 5.5 ощущается как возвращение к удобству работы с Opus 4.6, но с значительно большей вычислительной мощностью. Однако пользователи все еще сталкиваются с классификаторами безопасности, которые могут блокировать запросы, хотя частота ложных срабатываний снизилась по сравнению с предыдущими версиями.
Почему это важно?
Выпуск Opus 5.5 сигнализирует о том, что гонка вооружений переходит в фазу оптимизации эффективности. Anthropic доказывает, что можно достичь уровня передовых моделей (уровня Fable/Astra) без экстремальных затрат. Для разработчиков и бизнеса это означает возможность масштабирования AI-агентов и сложных задач (особенно в кодинге и кибербезопасности) при существенно меньшем бюджете. Как отмечает автор статьи, теперь у пользователей есть веская причина повысить свои амбиции в использовании AI.
Бенчмарки
| Бенчмарк | Claude Opus 5.5 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 62% | — | 63% |
| Omniscience | 46score | 43score | 43score |
| WeirdML v3 | 31.2% | 26% | 42.2% |
| ProgramBench | 18.5% | 7% | 5.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: LessWrong ↗
