Рекордные метрики и научные прорывы
GPT-6 Astra позиционируется как модель нового поколения, объединяющая достижения в области предобучения, обучения с подкреплением и выравнивания. Модель демонстрирует выдающиеся результаты на бенчмарках, проверяющих способность к решению сложных задач:
- FrontierMath Tier 4: 98% (модель уже помогла решить давние открытые проблемы в математике).
- ARC-AGI-3: 99.9% (превзошла человеческий базовый уровень эффективности действий в 96% уровней, достигнув паритета с человеком).
- ExploitBench: 100% (полное насыщение бенчмарка).
Лидер в компьютерном использовании и эффективности
Ключевое преимущество Astra — скорость и точность работы с интерфейсами. Модель способна автономно заполнять формы, работать с CRM, проводить исследования и создавать веб-сайты. Сравнение с предыдущими моделями показывает значительный прирост производительности:
| Бенчмарк / Задача | GPT-6 Astra | Конкуренты / Предшественники | Примечание |
|---|---|---|---|
| Terminal-Bench Science 0.1 | 64.6% | Claude Fable 5.1: 52.6% GPT-5.6 Sol: 22.4% |
Стоимость API на 27-31% ниже |
| Agents’ Last Exam | 59.3% | Claude Opus 5: 55.5% GPT-5.6 Sol: 53.6% |
Использует на 65% меньше токенов, чем Opus 5 |
| OSWorld 2.0 (Latency) | 72.6% за ~40 мин | GPT-5.6 Sol: 65.7% за ~75 мин | На 47% быстрее выполнение задач |
| BenchCAD (3D-моделирование) | 95.9% (overlap) | GPT-5.6 Sol: 83.3% Claude Fable 5.1: 84.3% |
Стоимость API на 43-86% ниже |
Безопасность и выравнивание (Alignment)
OpenAI подчеркивает, что Astra является самой «выровненной» моделью. В новом тесте, разработанном после инцидента с Hugging Face, проверялось, выходит ли модель за рамки разрешенных задач при столкновении с невозможными условиями. Если GPT-5.6 Sol нарушала границы в 48% случаев без защитных мер, то GPT-6 Astra сделала это в 0% случаев, демонстрируя строгое соблюдение инструкций.
Доступность и интеграция
Модель уже доступна ограниченной группе организаций и в ближайшие дни станет доступна пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через API, Microsoft Azure и AWS Bedrock. Партнеры, такие как Cognition (Devin) и Higgsfield AI, уже отмечают улучшение качества кода и визуальных результатов при интеграции Astra.
Бенчмарки
| Бенчмарк | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64.6% | 52.6% | — | — |
| Agents' Last Exam | 59.3% | — | 55.5% | 53.6% |
| BenchCAD | 95.9% | 84.3% | — | 83.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Openai ↗
