Релиз модели13 августа 2026 г., 21:30 МСК🤖 Auto

GPT-5.6: Революция цены и агентов. Как снизить затраты в 18 раз

OpenAI выпустила GPT-5.6, предложив новую архитектуру для агентов. Модели Luna и Terra обеспечивают производительность флагманов при цене в 1/18, а новые API-инструменты повышают точность в 3 раза.

Баннер новости 5734

Новый стандарт price-performance

OpenAI представила семейство моделей GPT-5.6, которое меняет парадигму использования AI-агентов. Главная инновация — не просто рост интеллекта, а радикальное снижение стоимости вычислений при сохранении качества. Ключевые изменения касаются трех аспектов: выбора модели, эффективности контекста и параллельных вычислений.

Модели Luna и Terra теперь могут конкурировать с более старыми флагманами (GPT-5.4/5.5) по качеству, но стоят значительно дешевле. Это позволяет использовать «тяжелые» модели только для сложных задач, а рутинные операции переложить на легкие версии.

Цифры и сравнения: Luna vs Флагманы

Реальные кейсы от стартапов показывают разрыв в стоимости при сопоставимой точности. Модель Luna сохраняет 98% точности извлечения данных от GPT-5.5, но стоит в 18 раз меньше. Ниже приведены конкретные метрики производительности и стоимости на бенчмарках.

Модель / Конфигурация Результат (Accuracy/Score) Стоимость Примечание
GPT-5.5 (Extra High) 84.36% (BrowseComp) $33.27 Базовое сравнение 3 месяца назад
GPT-5.6 Luna (Extra High) 84.04% (BrowseComp) $1.33 Практически идентичная точность, цена ниже в ~25 раз
GPT-5.6 Sol (Low Reasoning) Лучше GPT-5.5 (High) Значительно ниже На Agents’ Last Exam при постоянном harness
GPT-5.6 Sol (ARC-AGI-3) 38.3% (с оптимизациями) ~6x меньше токенов Рост с 13.3% до 38.3% за счет retained reasoning

Архитектурные прорывы в Responses API

OpenAI внедрила три новых примитива в Responses API, которые позволяют агентам работать эффективнее без изменения самой модели:

  • Retained Reasoning (Сохранение рассуждений): Модель теперь может сохранять ход мыслей между вызовами API. Это предотвращает потерю контекста и позволяет агенту «не забывать» промежуточные выводы при длинных сессиях.
  • Native Compaction (Нативная компрессия): Алгоритм сжимает длинные диалоги, удаляя шум, но сохраняя суть. Это критично для задач с долгим горизонтом планирования.
  • Programmatic Tool Calling: Агент может писать JavaScript-код для фильтрации и агрегации данных вне контекстного окна модели. Это переносит детерминированную работу в код, экономя токены на самом интеллектуальном анализе.

Мультиагентная оркестрация

В GPT-5.6 нативно поддерживается многоагентная оркестрация. Главный агент (orchestrator) делегирует задачи подчиненным агентам, которые работают параллельно. Это ускоряет выполнение сложных проектов. Например, при обработке шести спецификаций одновременно GPT-5.6 Sol удерживает качество без деградации, что ранее требовало ручного управления контекстом.

Почему это важно для разработчиков

Раньше использование флагманских моделей для агентов было экономически нецелесообразным из-за высоких затрат на токены. GPT-5.6 снимает это ограничение. Стартапы уже сообщают об экономии до 64% на инференсе и сокращении времени ответа на 90% при использовании модели Luna для задач извлечения кода и данных. Это открывает путь к массовому внедрению автономных AI-агентов в бизнес-процессы, где ранее это было слишком дорого.

Бенчмарки

БенчмаркGPT-5.6 Luna (Extra High)GPT-5.6 Sol (low reasoning)GPT-5.6 Sol (retained reasoning and compGPT-5.6 Sol (standard harness)Current SOTAGPT-5.5 (Extra High)GPT-5.5 (high reasoning)Luna
Agents' Last Exam0%0%
Browser Tasks80%78%
BrowseComp84.04%84.36%
ARC-AGI-338.3%13.3%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: OpenAI ↗