В мире искусственного интеллекта, где скорость и стоимость вычислений становятся критическими факторами для масштабирования, Google делает очередной мощный ход. Компания официально представила три новые модели из семейства Gemini, которые позиционируются не просто как улучшения качества, а как специализированные инструменты для эпохи агентов. Это Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber. Все они принадлежат к «Flash»-линейке, которая, согласно заявлениям Google, оптимизирована для скорости, минимизации затрат и обработки больших объемов данных, а не для глубокого логического вывода, характерного для флагманских моделей.
Для разработчиков, строящих производственные AI-агенты, это означает сдвиг парадигмы. Раньше приходилось выбирать между качеством ответа и стоимостью запроса. Теперь же Google предлагает архитектуру, где эффективность использования токенов, низкая задержка и надежность работы в многошаговых сценариях становятся стандартом. В этой статье мы подробно разберем каждую из новых моделей, их технические характеристики, ценообразование и практическое применение в реальных задачах, от написания кода до поиска уязвимостей.
01Почему Flash-линейка стала ключевой для агентов?
Прежде чем углубляться в детали конкретных моделей, важно понять контекст. Эра простых чат-ботов, где пользователь задает вопрос и получает ответ, уходит в прошлое. На смену ей приходит эра автономных AI-агентов. Агенты — это системы, которые воспринимают окружение, планируют действия, выполняют их, анализируют результат и корректируют курс. Этот цикл (Perceive-Plan-Act-Reflect) требует огромного количества запросов к языковой модели.
Каждый такой запрос генерирует токены. Если модель медленная или дорогая, создание масштабируемого агента становится экономически нецелесообразным. Именно поэтому Google сфокусировался на «Flash»-моделях. Они не обязательно являются самыми «умными» в плане сложного рассуждения, но они невероятно эффективны в выполнении конкретных задач: кодировании, обработке документов, поиске информации. Снижение стоимости вывода токенов (output tokens) на 17-65% — это не просто маркетинговый ход, это фундамент для создания коммерчески жизнеспособных AI-продуктов.
02Gemini 3.6 Flash: Новый стандарт эффективности
Gemini 3.6 Flash позиционируется как новая рабочая лошадка (workhorse) линейки. Она строит на успехах предыдущей версии 3.5 Flash, но с акцентом на три столпа: качество, эффективность токенов и цена. Эта модель предназначена для задач программирования, интеллектуальной работы с данными и мультимодальных задач.
Экономия токенов и снижение затрат
Главное достижение 3.6 Flash — это радикальное сокращение количества выходных токенов. Согласно данным Artificial Analysis Index, модель использует на 17% меньше выходных токенов по сравнению с 3.5 Flash. Однако в специфических задачах, таких как разработка программного обеспечения (бенчмарк DeepSWE от Datacurve), экономия достигает впечатляющих 65%. Это означает, что за те же деньги вы получаете в полтора-два раза больше полезного контента.
Кроме того, модель требует меньше шагов рассуждения и меньшего количества вызовов инструментов (tool calls) при выполнении многошаговых рабочих процессов. Это критически важно для агентов, так как каждый вызов инструмента — это отдельный запрос, который добавляет задержку и стоимость.
Ценообразование также стало более привлекательным. Gemini 3.6 Flash предлагается по цене $1.50 за 1 миллион входных токенов и $7.50 за 1 миллион выходных токенов. Для сравнения, цена вывода в предыдущей версии 3.5 Flash составляла $9.00. Снижение цены вывода в сочетании с уменьшением «болтливости» модели (вербальности) приводит к значительному снижению общей стоимости выполнения одной агентной задачи.


Рост качества и новые возможности
Эффективность не должна достигаться за счет качества, и Google утверждает, что 3.6 Flash улучшает оба показателя. На бенчмарке DeepSWE, который оценивает способность модели решать задачи программирования, 3.6 Flash набирает 49% против 37% у 3.5 Flash. На MLE Bench (задачи машинного обучения) результат вырос с 49.7% до 63.9%. В задаче OSWorld-Verified (взаимодействие с операционной системой) модель показала 83.0% против 78.4%.
Отдельного внимания заслуживает интеграция функции «Computer Use» (использование компьютера). Теперь это встроенный клиентский инструмент через Gemini API и Gemini Enterprise. Это позволяет агентам не просто генерировать текст, но и напрямую взаимодействовать с графическим интерфейсом, кликать, печатать и анализировать экран. Ранние клиенты, такие как Hebbia и Harvey, уже отмечают улучшения в парсинге документов, анализе графиков и данных, а также в составлении отчетов.
Google также усилила меры безопасности Frontier Safety, добавив защиту от misuse в области химического, биологического, радиологического и ядерного оружия (CBRN), а также кибератак. Полные детали можно найти в карточке модели 3.6 Flash.
03Gemini 3.5 Flash-Lite: Скорость и пропускная способность
Если 3.6 Flash — это баланс качества и цены, то Gemini 3.5 Flash-Lite — это чистая скорость и пропускная способность. Эта модель создана для задач с низкой задержкой и высокой нагрузкой, таких как агентный поиск и массовая обработка документов.
Производительность и цены
По данным Artificial Analysis, Flash-Lite генерирует 350 выходных токенов в секунду. Это делает её одной из самых быстрых моделей в своем классе. Цена за входные токены составляет всего $0.30 за 1 миллион, а за выходные — $2.50 за 1 миллион. Это делает её идеальной для сценариев, где важна скорость ответа, а не глубина анализа.
Flash-Lite значительно превосходит свою предшественницу 3.1 Flash-Lite. На Terminal-Bench 2.1 она набирает 54% против 31%. На бенчмарке длинного контекста GDM-MRCR v2 результат вырос с 60.1% до 72.2%. На GDPval-AA v2 (задачи работы с знаниями) она показывает 1140 баллов против 642 у старой версии.
Гибкость настройки
Разработчики получают доступ к настраиваемым уровням «мышления» (thinking levels): минимальный, низкий и высокий. Для высокочастотных задач можно выбрать минимальный уровень, чтобы максимизировать скорость и минимизировать затраты. Для более сложных многошаговых задач подзадач можно активировать высокий уровень. Как и в 3.6 Flash, здесь также встроен инструмент Computer Use.
04Gemini 3.5 Flash Cyber: Специализированный охотник за уязвимостями
Самой специализированной новинкой стала Gemini 3.5 Flash Cyber. Эта модель построена на базе 3.5 Flash, но дообучена (fine-tuned) для поиска, валидации и исправления уязвимостей в программном обеспечении. Её главная задача — решить проблему «поиска в пространстве» (search-space problem). Нахождение глубоких ошибок в коде требует перебора огромного количества вариантов выполнения. Один вызов большой модели становится узким местом.

Решение Google — использовать дешевую модель много раз. Внутри системы CodeMender (агент безопасности кода от Google) несколько агентов на базе 3.5 Flash Cyber работают параллельно. CodeMender может вызывать модель до пяти раз, а затем объединяет результаты от всех под-агентов в один отчет. Такой подход позволяет достичь конкурентоспособных результатов по сравнению с гораздо более крупными моделями.
Результаты тестирования
Внутренние оценки показывают впечатляющие результаты. На бенчмарке CyberGym система на базе Flash Cyber демонстрирует производительность, сопоставимую с гораздо более крупными моделями. На оценке Google Big Sleep Flash Cyber значительно превзошла как основную версию 3.5 Flash, так и 3.6 Flash.
В реальном тесте на движке JavaScript V8 Flash Cyber нашла 55 уникальных подтвержденных проблем при фиксированном количестве вызовов. Для сравнения: основная версия 3.5 Flash нашла 47, а Claude Opus 4.6 — только 36. Flash Cyber выявила 10 проблем, которые пропустили другие модели. В одном из реальных тестов команда Google Cloud Vulnerability Research использовала эту модель для обнаружения уязвимостей удаленного выполнения кода (RCE) в публичных API всего за два часа.
05Реакция сообщества и доступность
Реакция разработчиков на анонс была неоднозначной. С одной стороны, builders (создатели приложений) приветствовали снижение цен и повышение эффективности. С другой стороны, отсутствие задержанной флагманской модели вызвало самую громкую критику. На платформе Hacker News некоторые пользователи утверждали, что Google преувеличивает свои возможности по обеспечению пропускной способности, ссылаясь на сложные сессии программирования, которые не всегда работали гладко.
Что касается доступности, Gemini 3.6 Flash и 3.5 Flash-Lite доступны уже сегодня. Разработчики могут получить к ним доступ через Gemini API в Google AI Studio и Android Studio. Gemini 3.6 Flash также интегрирована в Google Antigravity и постепенно внедряется в GitHub Copilot. Для корпоративного сектора обе модели доступны в Gemini Enterprise Agent Platform, а 3.6 Flash — в приложении Gemini Enterprise. Все пользователи могут использовать их через приложение Gemini, а 3.5 Flash-Lite постепенно появляется в Google Search.
06Что это значит на практике
Для разработчиков и компаний, работающих с AI, эти обновления означают несколько конкретных шагов:
- Оптимизация затрат: Если вы используете 3.5 Flash для агентов, переход на 3.6 Flash может снизить расходы на вывод токенов до 65% в задачах разработки кода. Это прямая экономия бюджета.
- Масштабирование агентов: Использование Flash-Lite для высокочастотных задач (поиск, обработка документов) позволит увеличить количество обрабатываемых запросов без пропорционального роста затрат.
- Безопасность кода: Для компаний, занимающихся кибербезопасностью, интеграция CodeMender с Flash Cyber может ускорить процесс аудита кода и обнаружения уязвимостей, особенно если у вас есть доступ к пилотной версии.
- Локальный запуск и доступ из РФ: Важно отметить, что доступ к Gemini API из России может быть ограничен или требовать использования посредников. Однако, поскольку Google активно развивает open-source экосистему и инструменты для локального запуска (через Android Studio и другие платформы), разработчики могут исследовать возможности адаптации этих моделей под локальные нужды, используя обходные пути для доступа к API или запуская квантованные версии, если они станут доступны.
В целом, Google делает ставку на то, что будущее AI — это не одна супер-модель, а сеть специализированных, быстрых и дешевых моделей, работающих в тандеме. Flash-линейка становится фундаментом для этой новой архитектуры, делая AI-агентов не просто возможными, но и экономически выгодными для массового внедрения.
Источник: MarkTechPost ↗
