Новая линейка: Sol, Terra и Luna
OpenAI официально выпустила семейство моделей GPT-5.6, доступное для общего пользования. Архитектура линейки разделена на три специализированных уровня:
- GPT-5.6 Sol — флагманская модель, ориентированная на максимальную интеллектуальную производительность в сложных задачах (код, наука, кибербезопасность).
- GPT-5.6 Terra — сбалансированная модель для повседневных рабочих задач.
- GPT-5.6 Luna — самая экономичная модель, оптимизированная под высокую эффективность при низких затратах.
Рекорды в бенчмарках и экономия токенов
Ключевое преимущество GPT-5.6 — не просто рост «интеллекта», а радикальное улучшение соотношения цена/качество. Модель обучена извлекать больше полезной работы из каждого токена. На тесте Agents’ Last Exam (оценка долгосрочных профессиональных рабочих процессов в 55 сферах) GPT-5.6 Sol набрала 53.6 балла, превзойдя конкурента Claude Fable 5 на 13.1 пункта. При этом даже в режиме среднего рассуждения Sol обходит Fable 5 на 11.4 балла при стоимости, составляющей лишь 25% от затрат на конкурента.
Модели Terra и Luna демонстрируют еще более впечатляющую эффективность: они превосходят Fable 5 при стоимости, составляющей около 1/16 (6.25%) от цены конкурента. В индексе Artificial Analysis Intelligence Index Sol с максимальным рассуждением уступает Fable 5 всего 1 пунктом, но выполняет задачи на 61% быстрее и стоит примерно в два раза дешевле.
Прорыв в программировании и Multi-Agent
В сфере разработки GPT-5.6 Sol установила новый стандарт качества. В Artificial Analysis Coding Agent Index она набрала 80 баллов (на 2.8 выше Fable 5), используя менее половины выходных токенов и тратя в два раза меньше времени. Стоимость выполнения задач снизилась примерно на 33%.
Важным нововведением стал режим ultra, который по умолчанию координирует работу четырех агентов параллельно. Это позволяет решать сложные задачи быстрее, жертвуя лишь увеличенным потреблением токенов. Также внедрена функция Programmatic Tool Calling в Responses API, позволяющая модели самостоятельно фильтровать промежуточные данные и адаптировать рабочий процесс, что снижает количество запросов к модели.
Сравнительные характеристики производительности
Ниже приведены ключевые метики эффективности моделей GPT-5.6 по сравнению с предыдущими поколениями и конкурентами в специфических задачах:
| Метрика / Задача | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | Конкурент / База |
|---|---|---|---|---|
| Agents’ Last Exam (Общий балл) | 53.6 | — | — | Claude Fable 5 (40.5) |
| Coding Agent Index (Баллы) | 80 | Выше Fable 5 | Выше Opus 4.8 | Fable 5 (77.2) |
| Стоимость (относительная) | ~50% от Fable 5 | ~6.25% от Fable 5 | ~6.25% от Fable 5 | 100% (База) |
| Скорость выполнения (относительная) | 61% быстрее | ~3x быстрее | ~3x быстрее | 1x (База) |
| Финансовый анализ (Rogo Benchmark) | Точность +3.6, Токены -24% | — | — | GPT-5.5 |
Безопасность и отзывы индустрии
OpenAI подчеркивает, что GPT-5.6 оснащена самой надежной системой защиты на данный момент, сочетающей обучение на данных, проверку в реальном времени и мониторинг. Модель прошла расширенное тестирование с участием внешних партнеров и экспертов по безопасности.
Ранние пользователи отмечают значительный скачок в стабильности. Представители Qodo, Notion, Shopify и Balyasny Asset Management отмечают, что модели лучше сохраняют контекст в длинных сессиях, эффективнее проводят код-ревью (используя в 3 раза меньше токенов на PR) и демонстрируют высокую точность в юридических и финансовых расследованиях.
Бенчмарки
| Бенчмарк | GPT-5.6 Sol | Claude Fable 5 | GPT-5.5 |
|---|---|---|---|
| Agents' Last Exam | 53.6% | 40.5% | — |
| Artificial Analysis Intelligence Index | 99points | 100points | — |
| Artificial Analysis Coding Agent Index | 80points | 77.2points | — |
| Rogo's Big Finance Benchmark | 0points | — | 0points |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: OpenAI ↗
