Релиз модели10 июля 2026 г., 02:19 МСК🤖 Auto

OpenAI выпустила GPT-5.6: три модели, новый API и битва с Claude

OpenAI вывела в GA семейство GPT-5.6 (Sol, Terra, Luna). Флагман Sol лидирует в задачах кодинга, но уступает Claude в SWE-Bench Pro. Введен Programmatic Tool Calling и новая система кэширования.

Баннер новости 3256

Три модели вместо одной: архитектура и цены

OpenAI отказалась от единой модели в пользу трехуровневой линейки, позволяющей оптимизировать затраты под сложность задачи. Все модели доступны через API и ChatGPT (Plus/Pro/Enterprise), но с разными ограничениями по доступу.

  • GPT-5.6 Sol: Флагман для сложных задач (кодинг, агенты, безопасность). Цена: $5 за 1M входных токенов, $30 за 1M выходных.
  • GPT-5.6 Terra: Баланс производительности и стоимости. Цена: $2.5 / $15 за 1M токенов.
  • GPT-5.6 Luna: Самая быстрая и дешевая модель для черновиков и классификации. Цена: $1 / $6 за 1M токенов.

Важное изменение в тарификации: теперь запись в кэш (cache writes) тарифицируется по ставке 1.25x от обычной входной цены, хотя чтение из кэша сохраняет скидку 90%. Минимальное время жизни кэша — 30 минут.

Производительность: где Sol побеждает, а где проигрывает

Модель Sol демонстрирует прорыв в задачах программирования и работы с агентами, обгоняя конкурентов по скорости и расходу токенов. Однако в сложных инженерных задачах (SWE-Bench Pro) она все еще уступает Claude.

Бенчмарк GPT-5.6 Sol Claude Fable 5 Claude Mythos 5 Примечание
AA Coding Agent Index v1.1 80 77.2 - Лидерство Sol, расход токенов <50%
Terminal-Bench 2.1 (Ultra) 91.9% 88.0% 88.0% Ultra-режим: 4 агента параллельно
SWE-Bench Pro 64.6% 80.0% 80.3% Отставание ~15 пунктов от Claude
Agents’ Last Exam 52.7% 40.5% - Новый рекорд для Sol
AA Intelligence Index v4.1 58.9 59.9 - Claude Fable 5 лидирует по общему IQ

Programmatic Tool Calling: JS в изолированном V8

Ключевое нововведение в Responses API — Programmatic Tool Calling. В отличие от стандартных JSON-вызовов, эта функция позволяет модели писать JavaScript-код, который выполняется в изолированном окружении V8 без доступа к сети. Это повышает безопасность и предсказуемость действий агентов.

OpenAI сообщает, что внедрение этой функции привело к снижению количества токенов на 38–63.5% у клиентов, использующих Named-Tool-Calling. Режим Ultra по умолчанию запускает четыре агента параллельно, что повышает точность на Terminal-Bench 2.1 с 88.8% до 91.9%.

Почему это важно

Переход к трехуровневой модели дает разработчикам гибкость: можно отправлять простые запросы в Luna для экономии бюджета, а сложные инженерные задачи — в Sol. Однако разрыв в SWE-Bench Pro между Sol (64.6%) и Claude (80%+) указывает на то, что для критически важных задач автоматизации разработки Claude пока остается более надежным выбором. OpenAI делает ставку на скорость, стоимость и безопасность через изолированное выполнение кода.

Бенчмарки

БенчмаркGPT-5.6 SolGPT-5.6 Sol (Ultra)Claude Fable 5Claude Mythos 5Claude Opus 4.8GPT-5.6 LunaGPT-5.6 Terra
Terminal-Bench 2.188.8%91.9%84.7%87.4%
SWE-Bench Pro64.6%80%80.3%63.4%
DeepSWE v1.172.7%69.7%67.2%69.6%
Agents’ Last Exam52.7%40.5%50.3%50.4%
BrowseComp90.4%92.2%85.9%87.5%
OSWorld 2.062.6%54.8%45.6%50.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗