Смена парадигмы: от чата к Computer Use
OpenAI официально выпустила GPT-6 Astra, позиционируя её не как чат-бота, а как систему computer-use. Модель способна самостоятельно управлять браузерами, таблицами, десктопными приложениями и терминалами, выполняя многошаговые задачи вместо того, чтобы просто описывать инструкции. В отличие от предыдущей модели Codex, использующей сжатие контекста (compaction), Astra сохраняет детали в «заметках» и может искать информацию в ранних сообщениях, что критично для отладки сложных агентов. Также добавлена функция асинхронных вопросов: модель может задать пользователю вопрос, продолжая работу над независимыми задачами.
Технические характеристики и контекст
Модель работает исключительно в облаке (weights не опубликованы), доступна через API и AWS. Ключевая особенность — окно контекста в 1,050,000 токенов с максимальным выводом 128,000 токенов. Поддерживается ввод текста и изображений, вывод — только текст. Для тонкой настройки (fine-tuning) возможности отсутствуют. Введена новая система рассуждений с уровнями reasoning.effort выше уровня high: xhigh и max.
Бенчмарки: лидерство в OSWorld, споры в ARC-AGI
Astra демонстрирует выдающиеся результаты в задачах управления операционной системой, но её лидерство в некоторых тестах требует контекста. Например, на ARC-AGI-3 она показала 99.9%, но это результат работы связки модели с системой агентов (Responses API), а не чистой модели. В кодировании прогресс маргинален по сравнению с конкурентами.
| Бенчмарк | GPT-6 Astra | Предыдущий лидер / Конкурент | Примечание |
|---|---|---|---|
| OSWorld V2-Offline | 72.6% | GPT-5.6 Sol: 65.7% | Время выполнения задачи сократилось с ~75 до ~40 мин |
| ARC-AGI-3 | 99.9% | — | Результат с использованием агента и compaction |
| FrontierMath Tier 4 | 97.6% | — | OpenAI имеет эксклюзивный доступ к части датасета |
| DeepSWE v1.1 (Код) | 74.1% | Muse Spark 1.3: 75.4% Gemini 3.8 Flash: ~74% |
Разница в 1-2 задачи на 113 тестах |
| ExploitBench | 100% | — | Мера покрытия возможностей, а не通过率 |
Кибербезопасность как барьер доступа
Astra стала первой моделью OpenAI, достигшей порога «Critical» (Критический) в их Фреймворке готовности (Preparedness Framework). В ходе тестирования модель нашла две неизвестные уязвимости в движке V8 и разработала эксплойты для защищенных ОС. Это имеет прямое практическое последствие: стандартный доступ API блокирует запросы, связанные с поиском уязвимостей или созданием эксплойтов. Пользователи вне программ Trusted Access и Daybreak могут столкнуться с задержками или блокировками даже при unrelated запросах.
Ценообразование и доступность
Модель доступна только для организаций в программах доверенного доступа. Стандартные тарифы:
- Вход: $10 за 1 млн токенов (кэшированный вход — $1.00).
- Выход: $50 за 1 млн токенов.
- Длинный контекст: Запросы свыше 272K входных токенов тарифицируются с коэффициентом 2x для входа и 1.5x для выхода.
- Режимы: Batch и Flex — 50% от базовой цены, Fast — 2x.
Пользователи тарифов Pro, Business и Enterprise получают доступ к версии Astra Pro.
Бенчмарки
| Бенчмарк | GPT-6 Astra | Anthropic (reported) | Claude Fable 5.1 | GPT-5.6 Sol | Muse Spark 1.3 |
|---|---|---|---|---|---|
| OSWorld V2-Offline | 72.6% | — | — | 65.7% | — |
| BenchCAD Vision2Code | 95.9% | — | 84.3% | — | — |
| Terminal-Bench Science | 64.6% | 52.6% | — | — | — |
| DeepSWE v1.1 | 74.1% | — | — | 72.7% | 75.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
