В мире искусственного интеллекта, где новые модели появляются с пугающей частотой, легко потерять нить. Мы привыкли к тому, что каждый релиз обещает революцию, но на практике часто приносит лишь маргинальные улучшения. Однако недавнее сравнение, проведенное известным экспертом Саймоном Уиллисоном, стало исключением, которое подтверждает правило. Получив доступ к новой модели GPT-6 Astra, он не стал сразу бросаться решать сложные математические задачи или писать код. Вместо этого он использовал модель для генерации SVG-изображений пеликанов, едущих на велосипедах, на разных уровнях «размышления» (reasoning). Результат оказался не просто забавным, а откровенно шокирующим в своей полезности и информативности.
Этот эксперимент, в котором участвовали GPT-6 Astra, GPT-5.6 Sol, Terra и Luna, превратился в уникальный инструмент для понимания того, как на самом деле работают современные мультимодальные модели. Мы видим не просто картинки, а наглядную демонстрацию разрыва в качестве, эффективности использования ресурсов и, возможно, скрытых архитектурных связей между продуктами OpenAI. В этой статье мы разберем каждый аспект этого сравнения, чтобы понять, что это значит для разработчиков, исследователей и всех, кто использует AI в работе.
01Контекст эксперимента: Пеликаны как тест-кейс
Почему пеликаны? На первый взгляд, это кажется абсурдным. Но в тестировании ИИ абсурд часто является лучшим индикатором. Генерация изображения существа с определенной анатомией (пеликан с длинным клювом и специфическим телосложением), помещенного в неестественную ситуацию (езда на велосипеде), требует от модели понимания как физических свойств объектов, так и пространственных отношений. Это сложный запрос для генеративных моделей, особенно когда речь идет о векторной графике (SVG), где каждая линия и кривая должны быть математически точными.
Саймон Уиллисон использовал GPT-6 Astra для генерации этих изображений на пяти уровнях «размышления»: low, medium, high, xhigh и max. Важно отметить, что Astra не поддерживает режим reasoning=none, что сразу выделяет её среди других моделей, где можно отключить этот процесс. Затем, используя GPT-5.6 Sol, он отрендерил эти SVG-файлы в единую сравнительную сетку. Этот метод позволяет изолировать качество самой генерации кода от качества рендеринга, хотя в данном случае рендеринг был выполнен одной моделью, что делает сравнение еще более справедливым.
Результатом стала не просто галерея смешных картинок, а строгая аналитическая панель, показывающая, как разные модели справляются с одной и той же задачей. Это позволяет увидеть не только «красоту» результата, но и его структурную целостность, что критически важно для профессионального использования.
02Качество изображения: Astra против Sol
Самое очевидное и впечатляющее наблюдение из этой сетки — это превосходство GPT-6 Astra над GPT-5.6 Sol. Если говорить кратко, то Astra выигрывает по всем параметрам. Но давайте посмотрим на детали. Лучший пеликан, созданный моделью GPT-5.6 Sol (причем пользователь отметил, что уровень xhigh оказался предпочтительнее max), все еще выглядит как набор абстрактных форм. Анатомия пеликана нарушена: крылья сливаются с телом, клюв теряет форму, а велосипед превращается в неопознанный геометрический объект.

В противовес этому, каждый пеликан, созданный Astra, начиная с самого низкого уровня (low) и заканчивая xhigh, выглядит значительно лучше. Они сохраняют узнаваемую форму птицы, корректно отображают детали клюва и оперения, а также демонстрируют понимание того, как пеликан взаимодействует с велосипедом. Модель Astra max достигает такого уровня детализации, который можно назвать «реалистичным» в контексте векторной графики. Это не просто улучшение на 10-20%; это качественный скачок, который стирает грань между «генерацией» и «дизайном».
Однако, даже у Astra есть свои ограничения. На уровнях ниже max модель все еще не может надежно разместить ноги пеликана по обе стороны рамы велосипеда. Это указывает на то, что проблема понимания сложной пространственной логики и пересечения объектов остается актуальной, даже для самых передовых моделей. Тем не менее, разница в качестве между Astra и Sol настолько велика, что Sol выглядит устаревшим решением для задач, требующих высокой точности.
03Экономическая эффективность: Цена против Токенов
В мире LLM (Large Language Models) стоимость часто является решающим фактором. На первый взгляд, GPT-6 Astra выглядит дорого. Заявленная цена составляет около $10 за миллион входных токенов и $50 за миллион выходных токенов. Для сравнения, GPT-5.6 Sol стоит $5 за вход и $30 за выход. Кажется, что Astra в два раза дороже Sol.
Но здесь кроется важный нюанс, который часто упускают из виду: использование токенов. Astra использует значительно меньше токенов на каждом уровне обработки. Это означает, что фактическая стоимость генерации одного изображения с помощью Astra ближе к стоимости Sol, чем может показаться на первый взгляд. Более эффективное использование контекста и более компактное представление результатов делают Astra экономически выгодной в долгосрочной перспективе, особенно при массовом производстве контента.
Давайте рассмотрим конкретный пример. Уровень Astra low стоит всего 9.55 цента. За эту сумму вы получаете изображение пеликана, которое лучше, чем ANY (любое) изображение, созданное моделью Sol на любом уровне настройки. Если вы потратите 10 центов на Sol, вы получите результат значительно худшего качества. Это меняет парадигму выбора модели: вместо того чтобы выбирать между «дешево и плохо» и «дорого и хорошо», вы получаете «дешево и отлично» с Astra low.

04Анализ использования токенов: Тайна архитектуры
Одним из самых интригующих открытий эксперимента стало количество входных токенов. Анализ показал, что модели Astra и Luna использовали всего 16 входных токенов, в то время как Sol и Terra потребовали 26 токенов. Эта разница в 10 токенов может показаться незначительной, но в контексте архитектуры больших языковых моделей она может говорить о многом.
Почему Astra и Luna, которые, как известно, являются разными моделями (Astra — часть линейки GPT-6, а Luna — часть линейки GPT-5.6), используют одинаковое количество токенов? Это наводит на мысль о том, что они могут быть более родственными друг другу, чем OpenAI открыто признает. Возможно, они разделяют общий базовый слой архитектуры, оптимизированный для эффективного кодирования запросов. Это может быть результатом общей работы над оптимизацией контекстного окна или использования схожих методов сжатия информации на этапе предобработки.
С другой стороны, Sol и Terra, использующие больше токенов, могут полагаться на более «разговорный» или детализированный подход к обработке запроса, что увеличивает нагрузку на систему. Это также может указывать на то, что Sol и Terra требуют более явного описания задачи, в то время как Astra и Luna способны «догадываться» о намерениях пользователя, используя меньше входных данных. Это важное наблюдение для разработчиков, которые хотят оптимизировать свои промпты и снизить затраты на API.
05Уровни «размышления» (Reasoning Levels): Как они работают?
Одной из ключевых особенностей GPT-6 Astra является поддержка различных уровней «размышления» (reasoning). В отличие от предыдущих моделей, где этот процесс был либо автоматическим, либо полностью отключенным, Astra позволяет пользователю контролировать глубину анализа модели перед генерацией результата. Уровни low, medium, high, xhigh и max определяют, сколько вычислительных ресурсов и времени модель тратит на «обдумывание» задачи.
Для генерации изображений это имеет критическое значение. Уровень low может быть достаточен для простых задач, где важна скорость, но для сложных композиций, таких как пеликан на велосипеде, может потребоваться уровень xhigh или max. Однако, как показал эксперимент, даже уровень low Astra превосходит лучшие результаты Sol. Это говорит о том, что базовая архитектура Astra настолько эффективна, что даже минимальные усилия по «размышлению» дают превосходный результат.

Интересно также, что Astra не поддерживает режим reasoning=none. Это может означать, что процесс «размышления» является неотъемлемой частью архитектуры Astra, и его невозможно отключить без потери функциональности. Это может быть как плюсом (гарантия качества), так и минусом (отсутствие контроля для продвинутых пользователей, которые хотят сэкономить ресурсы на простых задачах).
06Что это значит на практике
Для разработчиков и компаний, использующих AI для генерации контента, результаты этого сравнения имеют прямое практическое значение. Во-первых, GPT-6 Astra становится явным лидером в задачах, требующих высокой точности и детализации. Если вам нужно создать векторную графику, иконки или сложные иллюстрации, Astra low может быть лучшим выбором по соотношению цена/качество.
Во-вторых, экономическая эффективность Astra делает её привлекательной для массового использования. Несмотря на более высокую заявленную цену за токен, фактическая стоимость генерации одного качественного изображения может быть ниже, чем у Sol, благодаря меньшему количеству используемых токенов. Это особенно важно для проектов с большим объемом генерации, где каждая копейка на счету.
В-третьих, анализ использования токенов открывает новые возможности для оптимизации. Если вы используете Astra или Luna, попробуйте сократить свои промпты и посмотреть, как это повлияет на качество результата. Возможно, вы сможете достичь того же качества, используя меньше ресурсов, что снизит затраты и ускорит процесс.
Наконец, этот эксперимент подчеркивает важность тестирования новых моделей на реальных задачах. Абстрактные бенчмарки часто не отражают реальной картины. Только практическое использование, такое как генерация пеликанов на велосипедах, может показать истинную силу и слабости модели. Поэтому мы рекомендуем всем, кто работает с AI, проводить собственные сравнительные тесты, используя задачи, близкие к вашим рабочим процессам.
07Заключение: Будущее генеративного ИИ
Эксперимент Саймона Уиллисона с пеликанами — это не просто забавная шутка. Это серьезный сигнал о том, что рынок генеративного ИИ быстро меняется. GPT-6 Astra демонстрирует, что качество может быть достигнуто не только за счет увеличения вычислительных мощностей, но и за счет оптимизации архитектуры и эффективного использования ресурсов. Это открывает путь к более доступному и качественному ИИ для всех пользователей.
Мы видим, как модели становятся умнее, быстрее и дешевле. И хотя еще есть над чем работать (например, проблема с ногами пеликана), прогресс очевиден. Следите за обновлениями, тестируйте новые модели и используйте их для создания уникального контента. Будущее уже здесь, и оно выглядит как пеликан на велосипеде.
Источник: Simon Willison ↗
