Технический прорыв: 1 млн токенов вывода
Главное отличие Gemini 4 Argon от предыдущих версий Gemini и конкурентов — способность генерировать до 1 000 000 токенов в одном ответе. Для сравнения, Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra ограничены 128K токенов. Это позволяет разработчикам выполнять масштабные рефакторинги кода или генерировать длинные аналитические отчеты без необходимости разбивать задачу на множество запросов.
Google не раскрывает размер входного контекстного окна (context window), но подчеркивает, что модель способна «глубоко думать» в рамках одного траектория выполнения. Доступ к модели пока ограничен через программу Fairwind для правительственных структур США и киберзащитников, публичная дата выхода не объявлена.
Бенчмарки: где Argon побеждает, а где уступает
В сравнении с флагманами Anthropic и OpenAI, Gemini 4 Argon демонстрирует абсолютное лидерство в задачах долгосрочной инженерии ПО (DeepSWE) и комплексной аналитики (Vals Index). Однако в задачах прямого взаимодействия с терминалом и управлением ОС модели конкурентов пока остаются сильнее.
| Бенчмарк | Суть теста | Gemini 4 Argon | Лучший конкурент | Результат конкурента |
|---|---|---|---|---|
| DeepSWE v1.1 | Долгосрочная инженерия ПО | 77.9% (Лидер) | Claude Opus 5.5 | 74.2% |
| Vals Index | Экономическое влияние (финансы, право) | 68.9% (Лидер) | Claude Opus 5.5 | 67.0% |
| AutomationBench | Автоматизация бизнес-процессов | 51.3% (Лидер) | Claude Opus 5.5 | 42.5% |
| FrontierSWE v2 | Сложное программирование | 55.0% | GPT-6 Astra | 65.5% |
| Terminal-Bench 4.0 | Работа с терминалом | 57.4% | Claude Opus 5.5 | 66.4% |
| OSWorld-2.0 | Управление ОС (Computer Use) | 69.2% | GPT-6 Astra | 72.6% |
Кибербезопасность: автономный поиск уязвимостей
Argon обучен автономно находить, валидировать и патчить критические уязвимости. На бенчмарке CWE-bench v1 (ремедиация уязвимостей) модель показала результат 68%, разделив первое место с GPT-6 Astra. Важно отметить, что конкуренты тестировались внутри собственных агентных оболочек, тогда как Argon демонстрирует эти результаты «из коробки».
Практическое применение уже зафиксировано: компания Wiz в рамках инициативы Scan for Good использовала Argon для обнаружения критической уязвимости в медицинском ПО, которую пропустили другие модели. Google внедряет строгие меры безопасности, включая изолированные песочницы и защиту от косвенных инъекций промптов.
Внутренние успехи Google и ценообразование
Внутри Google Argon уже оптимизировал память в дата-центрах, освободив более 300 TiB, и ускорил декодер libgav1 в 2.7 раза за счет замены 32K строк кода SIMD. Модель также превзошла базовый квантовый алгоритм на 40% за считанные минуты.
Ценовая политика агрессивна: вводные цены составляют $2 за 1M входных и $10 за 1M выходных токенов. Для закэшированных входных токенов скидка достигает 95% ($0.10 за 1M). После вводного периода цены вырастут до $4/$20, что все равно остается дешевле предложений Anthropic и OpenAI.
Сравнение с конкурентами
Ниже приведена сводная таблица ключевых характеристик и цен.
| Параметр | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|
| Макс. вывод на ответ | 1M токенов | 128K токенов | 128K токенов |
| Вход / Выход (Intro) | $2 / $10 | $4 / $20 | $10 / $50 |
| Закэшированный ввод | $0.10 | $0.20 | $1.00 |
| DeepSWE v1.1 | 77.9% | 74.2% | 74.1% |
| FrontierSWE v2 | 55.0% | 62.3% | 65.5% |
Бенчмарки
| Бенчмарк | Gemini 4 Argon | Claude Fable 5.1 | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 67.4% | 74.2% | 74.1% |
| Vals Index | 68.9% | 65.8% | 67% | 63.1% |
| FrontierSWE v2 | 55% | 56.3% | 62.3% | 65.5% |
| Terminal-Bench 4.0 | 57.4% | 57.9% | 66.4% | 58.2% |
| CWE-bench v1 | 68% | — | 67% | 58% |
| AutomationBench | 51.3% | — | 42.5% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
