Новый стандарт price-performance
OpenAI представила семейство моделей GPT-5.6, которое меняет парадигму использования AI-агентов. Главная инновация — не просто рост интеллекта, а радикальное снижение стоимости вычислений при сохранении качества. Ключевые изменения касаются трех аспектов: выбора модели, эффективности контекста и параллельных вычислений.
Модели Luna и Terra теперь могут конкурировать с более старыми флагманами (GPT-5.4/5.5) по качеству, но стоят значительно дешевле. Это позволяет использовать «тяжелые» модели только для сложных задач, а рутинные операции переложить на легкие версии.
Цифры и сравнения: Luna vs Флагманы
Реальные кейсы от стартапов показывают разрыв в стоимости при сопоставимой точности. Модель Luna сохраняет 98% точности извлечения данных от GPT-5.5, но стоит в 18 раз меньше. Ниже приведены конкретные метрики производительности и стоимости на бенчмарках.
| Модель / Конфигурация | Результат (Accuracy/Score) | Стоимость | Примечание |
|---|---|---|---|
| GPT-5.5 (Extra High) | 84.36% (BrowseComp) | $33.27 | Базовое сравнение 3 месяца назад |
| GPT-5.6 Luna (Extra High) | 84.04% (BrowseComp) | $1.33 | Практически идентичная точность, цена ниже в ~25 раз |
| GPT-5.6 Sol (Low Reasoning) | Лучше GPT-5.5 (High) | Значительно ниже | На Agents’ Last Exam при постоянном harness |
| GPT-5.6 Sol (ARC-AGI-3) | 38.3% (с оптимизациями) | ~6x меньше токенов | Рост с 13.3% до 38.3% за счет retained reasoning |
Архитектурные прорывы в Responses API
OpenAI внедрила три новых примитива в Responses API, которые позволяют агентам работать эффективнее без изменения самой модели:
- Retained Reasoning (Сохранение рассуждений): Модель теперь может сохранять ход мыслей между вызовами API. Это предотвращает потерю контекста и позволяет агенту «не забывать» промежуточные выводы при длинных сессиях.
- Native Compaction (Нативная компрессия): Алгоритм сжимает длинные диалоги, удаляя шум, но сохраняя суть. Это критично для задач с долгим горизонтом планирования.
- Programmatic Tool Calling: Агент может писать JavaScript-код для фильтрации и агрегации данных вне контекстного окна модели. Это переносит детерминированную работу в код, экономя токены на самом интеллектуальном анализе.
Мультиагентная оркестрация
В GPT-5.6 нативно поддерживается многоагентная оркестрация. Главный агент (orchestrator) делегирует задачи подчиненным агентам, которые работают параллельно. Это ускоряет выполнение сложных проектов. Например, при обработке шести спецификаций одновременно GPT-5.6 Sol удерживает качество без деградации, что ранее требовало ручного управления контекстом.
Почему это важно для разработчиков
Раньше использование флагманских моделей для агентов было экономически нецелесообразным из-за высоких затрат на токены. GPT-5.6 снимает это ограничение. Стартапы уже сообщают об экономии до 64% на инференсе и сокращении времени ответа на 90% при использовании модели Luna для задач извлечения кода и данных. Это открывает путь к массовому внедрению автономных AI-агентов в бизнес-процессы, где ранее это было слишком дорого.
Бенчмарки
| Бенчмарк | GPT-5.6 Luna (Extra High) | GPT-5.6 Sol (low reasoning) | GPT-5.6 Sol (retained reasoning and comp | GPT-5.6 Sol (standard harness) | Current SOTA | GPT-5.5 (Extra High) | GPT-5.5 (high reasoning) | Luna |
|---|---|---|---|---|---|---|---|---|
| Agents' Last Exam | — | 0% | — | — | — | — | 0% | — |
| Browser Tasks | — | — | — | — | 80% | — | — | 78% |
| BrowseComp | 84.04% | — | — | — | — | 84.36% | — | — |
| ARC-AGI-3 | — | — | 38.3% | 13.3% | — | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: OpenAI ↗
