В июле 2026 года гонка скоростей в индустрии ИИ достигла нового уровня: модели с интеллектом выше базового порога (≥25 баллов) генерируют ответ за доли секунды. Мы отобрали самые быстрые решения, которые не жертвуют качеством ради скорости, что критически важно для высоконагруженных сервисов и интерактивных приложений.
Рейтинг составлен на основе реальных тестов генерации токенов в секунду (T/s). Лидируют модели, оптимизированные под архитектуру MoE (Mixture of Experts) и квантование, позволяющие запускать мощные нейросети даже на ограниченном оборудовании. Обратите внимание: скорость может варьироваться в зависимости от длины промпта и конфигурации сервера.
В подборке представлены как облачные API, так и модели, пригодные для локального развёртывания. Для российского пользователя важны аспекты доступности: многие из этих моделей можно запустить локально или через прокси, избегая блокировок и задержек, характерных для прямых запросов к западным хостингам.
01Таблица сравнения
| # | Модель | Создатель | Скорость tok/s | Интеллект | Цена $/1M |
|---|---|---|---|---|---|
| 1 | Mercury 2 | Inception | 931 | 25.3 | $0.38 |
| 2 | Step 3.7 Flash | StepFun | 386 | 29.7 | $0.44 |
| 3 | Gemini 3.1 Flash-Lite | 276 | 25 | $0.56 | |
| 4 | NVIDIA Nemotron 3 Super 120B A12B | NVIDIA | 239 | 25.4 | $0.41 |
| 5 | Grok 4.20 0309 | xAI | 225 | 36.5 | $3 |
| 6 | Grok 4.20 0309 v2 | xAI | 215 | 37 | $3 |
| 7 | GPT-5.1 Codex mini | OpenAI | 214 | 30.6 | $0.69 |
| 8 | Qwen3.7 Max | Alibaba | 203 | 46 | $3.75 |
| 9 | Step 3.5 Flash 2603 | StepFun | 203 | 26 | $0.15 |
| 10 | MiniMax-M2.1 | MiniMax | 202 | 31.4 | $0.53 |
Данные: индекс интеллекта, цена и скорость по методологии Artificial Analysis. Актуально на июль 2026. Полный каталог — /models.
Безоговорочным лидером рейтинга стала Mercury 2, продемонстрировав рекордную скорость вывода при сохранении высокой интеллектуальной планки. Её архитектура позволяет обрабатывать запросы молниеносно, что делает её идеальной для чат-ботов реального времени.紧随其后的是 Step 3.7 Flash и Gemini 3.1 Flash-Lite, которые предлагают отличный баланс между скоростью и логическим мышлением, оставаясь доступными через популярные API.
Особое внимание стоит уделить NVIDIA Nemotron 3 Super 120B A12B. Несмотря на огромный размер базовой модели, благодаря эффективной активации лишь 12B параметров, она демонстрирует выдающуюся производительность. Это решение особенно привлекательно для локального запуска на мощных GPU, так как позволяет получить качество «тяжёлых» моделей с скоростью лёгких.
Модели Grok 4.20 (версии 0309 и v2) и GPT-5.1 Codex mini показывают стабильные результаты, хотя и уступают аутсайдерам в чистой скорости токенов. Однако их преимущество — в зрелости экосистемы и интеграции. Qwen3.7 Max, замыкающая список, остаётся фаворитом для задач, где скорость вторична, но всё ещё находится в зоне «высокой производительности».
02Кому что подойдёт
- Для высоконагруженных чат-ботов: Mercury 2 или Step 3.7 Flash — максимальная скорость ответа снижает нагрузку на сервер и улучшает UX.
- Для локального запуска (Home Lab): NVIDIA Nemotron 3 Super 120B A12B — лучшее соотношение «качество/скорость/размер» при наличии GPU с 16+ ГБ памяти.
- Для разработки и кодинга: GPT-5.1 Codex mini или Qwen3.7 Max — если важна точность генерации кода, а не только скорость.
- Для мобильных приложений: Gemini 3.1 Flash-Lite — оптимизирована для работы на edge-устройствах с низким потреблением энергии.
- Для интеграции с российскими сервисами: Step 3.7 Flash или Qwen3.7 Max — часто имеют лучшую поддержку в локальных облачных провайдерах и меньше подвержены геоблокировкам.
Источник: Artificial Analysis ↗
