Результаты бенчмарков: абсолютные лидеры
GPT-6 Astra не просто улучшила предыдущие версии, она совершила качественный скачок, сравнимый с переходом от Fable 5 к Fable 5.1. Модель демонстрирует доминирующие результаты в ключевых тестах на интеллектуальные способности:
| Бенчмарк | Результат Astra | Значение |
|---|---|---|
| FrontierMath Tier 4 | 98% | Высочайший уровень математического мышления |
| ARC-AGI 3 | 99.9% | Почти идеальное решение абстрактных задач |
| ExploitBench | 100% | Полное покрытие сценариев эксплуатации |
Ключевые возможности: от KiCad до Blender
Astra позиционируется как лучшая модель для «компьютерного использования» (Computer Use) и координации субагентов. В отличие от предыдущих версий, она не просто генерирует код, а активно взаимодействует с ПО:
- 3D и дизайн: Создание сцен городов в Unity, анимация трансмиссий автомобилей в FreeCAD и Blender.
- Инженерия: Проектирование печатных плат в KiCad.
- Наука: Улучшение математических результатов о разрывах между простыми числами, новые достижения в биологии, химии и физике.
- Быт: Заполнение черновиков налоговых деклараций на основе W-2.
Дискуссия об AGI и сравнение с конкурентами
Президент OpenAI Грег Брокман официально объявил о начале эры AGI. Хотя автор статьи Zvi не считает модель полноценным AGI, он отмечает, что споры об этом больше не кажутся абсурдными. При этом Astra не заменяет полностью конкурентов:
- Fable 5.1 (Anthropic): Остается предпочтительным выбором для диалогов, редактирования текстов и задач, требующих тонкой настройки стиля.
- Astra (OpenAI): Безоговорочный лидер в сложных проектах, 3D-моделировании и автоматизации.
Рекомендация экспертов: использовать обе модели параллельно («dual wielding») для самых сложных задач.
Безопасность и будущие модели
OpenAI сделала акцент на безопасности, внедрив встроенных оценщиков (Embedded Evaluators) и усилив мониторинг действий агентов. Однако развитие идет стремительно: уже анонсирована внутренняя модель уровня выше Astra, а CEO OpenAI Сэм Альтман признал, что Astra может устареть через несколько недель. На фоне этого Anthropic анонсировала односторонние обязательства по внедрению независимых аудиторов безопасности.
Источник: LessWrong ↗
