Три модели вместо одной: архитектура и цены
OpenAI отказалась от единой модели в пользу трехуровневой линейки, позволяющей оптимизировать затраты под сложность задачи. Все модели доступны через API и ChatGPT (Plus/Pro/Enterprise), но с разными ограничениями по доступу.
- GPT-5.6 Sol: Флагман для сложных задач (кодинг, агенты, безопасность). Цена: $5 за 1M входных токенов, $30 за 1M выходных.
- GPT-5.6 Terra: Баланс производительности и стоимости. Цена: $2.5 / $15 за 1M токенов.
- GPT-5.6 Luna: Самая быстрая и дешевая модель для черновиков и классификации. Цена: $1 / $6 за 1M токенов.
Важное изменение в тарификации: теперь запись в кэш (cache writes) тарифицируется по ставке 1.25x от обычной входной цены, хотя чтение из кэша сохраняет скидку 90%. Минимальное время жизни кэша — 30 минут.
Производительность: где Sol побеждает, а где проигрывает
Модель Sol демонстрирует прорыв в задачах программирования и работы с агентами, обгоняя конкурентов по скорости и расходу токенов. Однако в сложных инженерных задачах (SWE-Bench Pro) она все еще уступает Claude.
| Бенчмарк | GPT-5.6 Sol | Claude Fable 5 | Claude Mythos 5 | Примечание |
|---|---|---|---|---|
| AA Coding Agent Index v1.1 | 80 | 77.2 | - | Лидерство Sol, расход токенов <50% |
| Terminal-Bench 2.1 (Ultra) | 91.9% | 88.0% | 88.0% | Ultra-режим: 4 агента параллельно |
| SWE-Bench Pro | 64.6% | 80.0% | 80.3% | Отставание ~15 пунктов от Claude |
| Agents’ Last Exam | 52.7% | 40.5% | - | Новый рекорд для Sol |
| AA Intelligence Index v4.1 | 58.9 | 59.9 | - | Claude Fable 5 лидирует по общему IQ |
Programmatic Tool Calling: JS в изолированном V8
Ключевое нововведение в Responses API — Programmatic Tool Calling. В отличие от стандартных JSON-вызовов, эта функция позволяет модели писать JavaScript-код, который выполняется в изолированном окружении V8 без доступа к сети. Это повышает безопасность и предсказуемость действий агентов.
OpenAI сообщает, что внедрение этой функции привело к снижению количества токенов на 38–63.5% у клиентов, использующих Named-Tool-Calling. Режим Ultra по умолчанию запускает четыре агента параллельно, что повышает точность на Terminal-Bench 2.1 с 88.8% до 91.9%.
Почему это важно
Переход к трехуровневой модели дает разработчикам гибкость: можно отправлять простые запросы в Luna для экономии бюджета, а сложные инженерные задачи — в Sol. Однако разрыв в SWE-Bench Pro между Sol (64.6%) и Claude (80%+) указывает на то, что для критически важных задач автоматизации разработки Claude пока остается более надежным выбором. OpenAI делает ставку на скорость, стоимость и безопасность через изолированное выполнение кода.
Бенчмарки
| Бенчмарк | GPT-5.6 Sol | GPT-5.6 Sol (Ultra) | Claude Fable 5 | Claude Mythos 5 | Claude Opus 4.8 | GPT-5.6 Luna | GPT-5.6 Terra |
|---|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.8% | 91.9% | — | — | — | 84.7% | 87.4% |
| SWE-Bench Pro | 64.6% | — | 80% | 80.3% | — | — | 63.4% |
| DeepSWE v1.1 | 72.7% | — | 69.7% | — | — | 67.2% | 69.6% |
| Agents’ Last Exam | 52.7% | — | 40.5% | — | — | 50.3% | 50.4% |
| BrowseComp | 90.4% | 92.2% | — | — | 85.9% | — | 87.5% |
| OSWorld 2.0 | 62.6% | — | 54.8% | — | — | 45.6% | 50.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
