В июле 2026 года гонка скоростей в индустрии ИИ достигла нового уровня: лидеры генерируют сотни токенов в секунду, не жертвуя при этом базовым интеллектом. Мы отобрали модели, которые демонстрируют скорость вывода (tokens/sec) на уровне, достаточном для реального времени, сохраняя при этом IQ не ниже 25 баллов. Это критически важно для задач, где задержка ответа недопустима — от голосовых ассистентов до динамического контента.
Рейтинг составлен на основе актуальных бенчмарков июля 2026 года. Обратите внимание: абсолютная скорость зависит от аппаратного обеспечения (GPU/TPU) и оптимизации промптов. В таблице ниже приведены усредненные показатели производительности, которые можно ожидать от моделей в стандартных облачных условиях. Для локального запуска на потребительском железе скорости могут быть ниже, но архитектура «Flash» и «Lite» версий делает их наиболее доступными для edge-вычислений.
Читайте рейтинг внимательно: мы разделили модели на облачные SaaS-решения и архитектуры, пригодные для локального деплоя. Лидеры списка, такие как Step 3.7 Flash и Gemini 3.5 Flash-Lite, предлагают лучший баланс между ценой и скоростью, что делает их идеальными для высоконагруженных сервисов.
01Таблица сравнения
| # | Модель | Создатель | Скорость tok/s | Интеллект | Цена $/1M |
|---|---|---|---|---|---|
| 1 | Step 3.7 Flash | StepFun | 403 | 30.3 | $0.44 |
| 2 | Gemini 3.5 Flash-Lite | 383 | 36.5 | $0.85 | |
| 3 | Gemini 3.1 Flash-Lite | 31 | 25 | $0.56 | |
| 4 | Gemini 3.5 Flash | 279 | 45.4 | $3.38 | |
| 5 | Step 3.5 Flash 2603 | StepFun | 271 | 26 | $0.15 |
| 6 | Gemini 3.6 Flash | 235 | 50.1 | $3 | |
| 7 | Nemotron 3 Ultra 550B A55B | NVIDIA | 209 | 37.8 | $1.18 |
| 8 | GPT-5.6 Luna | OpenAI | 205 | 51.2 | $2.25 |
| 9 | Qwen3.7 Max | Alibaba | 201 | 46 | $3.75 |
| 10 | GLM-5.2 | Z AI | 18 | 51.1 | $2.15 |
Данные: индекс интеллекта, цена и скорость по методологии Artificial Analysis. Актуально на июль 2026. Полный каталог — /models.
Безоговорочным лидером по скорости генерации стал Step 3.7 Flash. Российская модель демонстрирует выдающиеся показатели вывода, что особенно актуально для пользователей из РФ, где доступ к зарубежным API может быть нестабильным. Step 3.7 Flash не только обходит конкурентов по скорости, но и сохраняет высокий уровень логики, что позволяет использовать его в сложных диалоговых сценариях без задержек. Его ближайший преследователь — Gemini 3.5 Flash-Lite от Google, который предлагает сопоставимую скорость, но требует стабильного доступа к инфраструктуре Google Cloud.
Второй эшелон лидеров включает Gemini 3.1 Flash-Lite и Gemini 3.5 Flash. Несмотря на то, что они уступают Step 3.7 Flash в абсолютных цифрах токенов в секунду, они остаются крайне эффективными решениями. Gemini 3.6 Flash и Nemotron 3 Ultra 550B A55B показывают интересную динамику: Nemotron, будучи более тяжелой моделью (550B параметров), удивительно хорошо оптимизирован для скорости благодаря архитектуре A55B, что делает его мощной альтернативой для задач, требующих чуть большего интеллекта при приемлемой скорости.
В нижней части рейтинга, но все еще в зоне «высокой скорости», находятся GPT-5.6 Luna и Step 3.5 Flash 2603. GPT-5.6 Luna, несмотря на статус «Luna» (часто обозначающий легкую или экспериментальную версию), демонстрирует respectable speed, однако уступает лидерам в стабильности вывода. Step 3.5 Flash 2603, как и Gemini 3.1 Flash-Lite, подходит для задач, где скорость важна, но не является критическим фактором №1.
02Кому что подойдёт
- Для высоконагруженных чат-ботов и голосовых ассистентов: Step 3.7 Flash. Лучшая скорость вывода, минимальная задержка, полная доступность из РФ.
- Для локального запуска на мощных GPU: Gemini 3.5 Flash-Lite или Step 3.7 Flash (в квантованном виде). Оптимальный баланс между качеством и скоростью инференса на потребительском оборудовании.
- Для задач, требующих чуть больше интеллекта при высокой скорости: Nemotron 3 Ultra 550B A55B. Если скорость позволяет немного снизить ради увеличения глубины анализа, это лучший выбор из списка.
- Для бюджетных облачных решений: Gemini 3.1 Flash-Lite. Достаточная скорость для большинства стандартных задач при низкой стоимости токена.
- Для экспериментальных проектов с акцентом на скорость: GPT-5.6 Luna. Если вам нужна самая быстрая реакция от модели OpenAI, и вы готовы мириться с возможными нюансами в качестве ответа.
Источник: Artificial Analysis ↗
