Новая эра AI-агентов: Gemini 3.6 Flash
Google представила Gemini 3.6 Flash как основную рабочую лошадку для создания масштабируемых AI-агентов. Модель позиционируется как прямой наследник 3.5 Flash, но с существенными улучшениями в эффективности и качестве. Ключевое изменение — снижение потребления выходных токенов на 17% по сравнению с предыдущей версией (данные Artificial Analysis Index), а в некоторых сценариях, таких как benchmark DeepSWE от Datacurve, экономия достигает 65%.
Это достигается за счет меньшего количества шагов рассуждения и вызовов инструментов. Для разработчиков это означает прямую экономию: цена составляет $1.50 за 1 млн входных токенов и $7.50 за 1 млн выходных токенов. Кроме того, в модель встроен инструмент «Computer Use» на стороне клиента, что упрощает интеграцию для задач управления интерфейсами.
Скорость и экономия: Gemini 3.5 Flash-Lite
Параллельно выпущена Gemini 3.5 Flash-Lite — самая быстрая модель в линейке 3.5. По данным Artificial Analysis, она генерирует 350 выходных токенов в секунду. Эта модель создана для задач с высокой пропускной способностью, таких как агентный поиск и обработка документов.
Стоимость использования крайне низка: $0.3 за 1 млн входных токенов и $2.5 за 1 млн выходных токенов. Примечательно, что по ряду метрик (SWE-Bench Pro, OSWorld-Verified) Lite-версия превосходит даже более старую Gemini 3 Flash, предлагая лучшее соотношение цены и качества для массовых задач.
Кибербезопасность: Gemini 3.5 Flash Cyber
Отдельно представлена специализированная модель Gemini 3.5 Flash Cyber, интегрированная в систему CodeMender. Она дообучена для обнаружения и исправления уязвимостей в коде. В связке с агентами CodeMender модель демонстрирует конкурентоспособные результаты на бенчмарке CyberGym, позволяя находить и патчить баги быстрее, чем традиционные системы, при этом снижая стоимость токенов по сравнению с более крупными моделями.
Сравнительные метрики производительности
Ниже приведены ключевые показатели эффективности новых моделей по сравнению с предшественниками и аналогами:
| Модель | Ключевая метрика / Бенчмарк | Результат / Преимущество |
|---|---|---|
| Gemini 3.6 Flash | DeepSWE (Datacurve) | Экономия токенов до 65% по сравнению с 3.5 Flash |
| Gemini 3.6 Flash | MLE Bench (ML Research) | 63.9% против 49.7% (у 3.5 Flash) |
| Gemini 3.6 Flash | OSWorld-Verified (Computer Use) | 83.0% против 78.4% (у 3.5 Flash) |
| Gemini 3.5 Flash-Lite | Terminal-Bench 2.1 (Coding) | 54% против 31% (у 3.1 Flash-Lite) |
| Gemini 3.5 Flash-Lite | SWE-Bench Pro | 54.2% (превосходит Gemini 3 Flash, у которой 49.6%) |
| Gemini 3.5 Flash-Lite | Скорость генерации | 350 токенов/сек (Artificial Analysis Index) |
Безопасность и будущее
Все новые модели поставляются с усиленными средствами защиты Frontier Safety, особенно в сферах химического, биологического, радиологического и ядерного (CBRN) оружия, а также кибератак. Google заявляет о значительном повышении устойчивости к джейлбрейкам при одновременном снижении ложных отказов для легитимных задач.
Помимо релиза Flash-серии, Google подтвердила, что Gemini 3.5 Pro сейчас находится в тестировании с партнерами, а команда уже начала самый амбициозный этап предобучения для Gemini 4.
Бенчмарки
| Бенчмарк | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| DeepSWE | 49% | 37% |
| MLE Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83% | 78.4% |
| GDPval-AA v2 | 1421score | 1349score |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Blog ↗
