Новый стандарт для AI-агентов в бизнесе
6 октября 2026 года OpenAI представила модель GPT-6 Astra, позиционируя её как следующий шаг в эволюции AI-агентов для профессиональной работы. В отличие от предыдущих версий, Astra была разработана в тесном сотрудничестве с Ironclad — лидером в области AI-управления контрактами. Целью партнерства стало обучение моделей пониманию корпоративных правил, выполнению многоэтапных рабочих процессов и строгой верификации результатов.
Ключевая особенность Astra заключается в способности агента удерживать в контексте сложные бизнес-требования (например, правила финансового одобрения, проверки безопасности и юридические нормы) на протяжении всего процесса, а не просто выполнять изолированные действия.
Результаты сравнительного тестирования
Для оценки эффективности команда OpenAI разработала 11 сложных исследовательских задач, связанных с юридическими, коммерческими и закупочными процессами. Эти задачи включали настройку соглашений о неразглашении (NDA), создание процессов согласования закупок и обновление юридических формулировок в зависимости от юрисдикции. Среднее время выполнения одной такой задачи опытным пользователем составляет 30–40 минут.
Тестирование проводилось в симулированной среде Ironclad с использованием 8–50 критериев оценки для каждой задачи. Результаты показали существенный разрыв между новой моделью и предыдущим поколением:
| Метрика | GPT-5.6 Sol (High reasoning) | GPT-6 Astra (Max reasoning) |
|---|---|---|
| Средний балл по рубрикам | 41.6% | 55.0% |
| Среднее время на попытку (оценка) | 37.0 минут | 19.2 минуты |
| Рост эффективности | — | +32% к баллу, -48% к времени |
В ходе демонстрации одного из сценариев GPT-6 Astra выполнила около 94% требований задачи за 20 минут, тогда как GPT-5.6 Sol справилась лишь с 85% за 32 минуты. Внутренняя модель, используемая в процессе разработки Astra, достигла показателя в 63.7%, что указывает на потенциал дальнейших улучшений.
Методология обучения и безопасность данных
Обучение модели проводилось с использованием синтетических задач, созданных на основе публичных контрактов из базы данных SEC EDGAR с применением фильтров для удаления персональных данных. OpenAI подтвердила, что не использовала внутренние контракты клиентов Ironclad или данные OpenAI для обучения. Для улучшения результатов применялись методы обучения с подкреплением (reinforcement learning), позволяющие моделям совершенствоваться на основе обратной связи в безопасной среде.
Значение для индустрии
Сунита Верма (Sunita Verma), CTO Ironclad, отметила, что успех таких коллабораций зависит от способности AI учитывать исключения в бизнес-процессах, не нарушая базовых правил. Хотя агенты становятся мощнее, человеческий контроль остается критически важным. OpenAI приглашает другие компании к аналогичным исследовательским партнерствам, чтобы решать задачи, которые современные AI-агенты пока не могут выполнять надежно.
Бенчмарки
| Бенчмарк | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| Ironclad Research Tasks | 55% | 41.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: OpenAI ↗
