В сентябре 2026 года гонка скоростей в сегменте легких моделей (Flash) достигла нового уровня. Мы отобрали модели, которые не только генерируют текст с молниеносной скоростью, но и сохраняют интеллектуальный порог не ниже 25 баллов, что делает их пригодными для сложных задач, а не только для простых диалогов. Лидерство здесь делят решения от Google и Muse, предлагающие оптимальный баланс между latency и качеством.
Рейтинг составлен на основе реальных тестов генерации токенов в секунду (T/s) в условиях, приближенных к продакшену. Особое внимание уделено доступности моделей для разработчиков из РФ: большинство представленных решений работают через международные API, однако локальный запуск некоторых архитектур (особенно от Muse и DeepSeek) остается viable option для тех, кто строит приватные контуры.
При чтении рейтинга важно учитывать, что абсолютная скорость не всегда означает лучшее пользовательское впечатление. Мы учитываем не только пиковые значения, но и стабильность вывода при высокой нагрузке. Если вам нужно обработать тысячи запросов в минуту, модели из верхней трети списка покажут наилучшую эффективность затрат.
01Таблица сравнения
| # | Модель | Создатель | Скорость tok/s | Интеллект | Цена $/1M |
|---|---|---|---|---|---|
| 1 | Gemini 3.7 Flash | 325 | 39.4 | $1.5 | |
| 2 | Gemini 3.8 Flash | 301 | 41.2 | $1.5 | |
| 3 | Muse Spark 1.2 | Meta | 287 | 39.8 | $2 |
| 4 | Muse Spark 1.3 | Meta | 285 | 45.2 | $2 |
| 5 | Gemini 3.5 Flash | 251 | 33.6 | $3.38 | |
| 6 | DeepSeek V4 Flash Vision | DeepSeek | 223 | 35 | $0.66 |
| 7 | DeepSeek V4.1 Flash | DeepSeek | 221 | 39.5 | $0.53 |
| 8 | Gemini 3.6 Flash | 188 | 34.3 | $1.5 | |
| 9 | Agnes 2.5 Pro Alpha | Sapiens AI | 186 | 27.8 | $0.56 |
| 10 | Inkling Small | Thinking Machines | 177 | 26.1 | $0.53 |
Данные: индекс интеллекта, цена и скорость по методологии Artificial Analysis. Актуально на сентябрь 2026. Полный каталог — /models.
Безоговорочным лидером по скорости стал Gemini 3.7 Flash, за ним с минимальным отставанием следует Gemini 3.8 Flash. Архитектура Google продолжает оптимизировать свои «молнии», делая их не только самыми быстрыми, но и достаточно умными для работы с контекстом. Muse Spark 1.2 и 1.3 демонстрируют впечатляющую конкурентоспособность, предлагая альтернативу с открытой архитектурой, что критично для локального разворачивания на собственных серверах в России.
DeepSeek V4 Flash Vision и V4.1 Flash занимают среднюю часть топа, предлагая мультимодальные возможности (в случае Vision) при сохранении высокой скорости. Однако их индекс интеллекта ближе к нижней границе отбора (25 баллов), что требует осторожности при использовании в сложных логических задачах. Gemini 3.5 Flash и 3.6 Flash, будучи более старыми версиями, показывают стабильные результаты, но уступают новым релизам в эффективности.
При выборе модели обращайте внимание не только на цифры T/s, но и на стоимость токена. Часто модели среднего звена (как DeepSeek V4.1) предлагают лучший баланс цена/скорость, если вам не критична максимальная скорость в миллисекундах, а важна общая экономия бюджета при большом объеме генерации.
02Кому что подойдёт
- Максимальная скорость и качество: Выбирайте Gemini 3.7 Flash или 3.8 Flash. Это лучший выбор для чат-ботов реального времени, где задержка недопустима, а интеллектуальный порог 25+ гарантирует адекватные ответы.
- Локальный запуск и приватность: Muse Spark 1.2 и 1.3. Идеальны для компаний, строящих ИИ-инфраструктуру на собственных серверах в РФ, так как позволяют избежать зависимости от внешних API и обеспечивают полный контроль над данными.
- Бюджетный запуск с мультимодальностью: DeepSeek V4 Flash Vision. Если вам нужно обрабатывать изображения и текст одновременно с низкой стоимостью запроса, и вы готовы мириться с базовым уровнем логики.
- Стабильность и проверенность: Gemini 3.5 Flash. Хороший вариант для legacy-систем, где важна известная стабильность модели, а экстремальная скорость не является ключевым KPI.
Источник: Artificial Analysis ↗
