В августе 2026 года гонка скоростей генерации текста достигла нового уровня: модели с интеллектом не ниже 25 баллов теперь способны выдавать десятки токенов в секунду, не жертвуя логикой и фактологией. Мы протестировали актуальные решения на доступных GPU, чтобы выделить лидеров по скорости вывода (tokens/sec) при сохранении приемлемого качества ответов.
Рейтинг составлен с учетом реальных условий работы: доступность API из РФ, стоимость inference и возможность локального запуска на потребительском железе. В таблице ниже представлены только модели, прошедшие порог интеллектуальности ≥25, так как «быстрые, но глупые» модели теряют смысл в продакшене.
01Таблица сравнения
| # | Модель | Создатель | Скорость tok/s | Интеллект | Цена $/1M |
|---|---|---|---|---|---|
| 1 | Ling-3.0-flash | InclusionAI | 406 | 37.8 | $0.11 |
| 2 | Gemini 3.7 Flash | 35 | 53.4 | $1.5 | |
| 3 | Gemini 3.5 Flash-Lite | 344 | 37.4 | $0.85 | |
| 4 | Gemini 3.5 Flash | 285 | 46.7 | $3.38 | |
| 5 | Gemini 3.6 Flash | 201 | 51.6 | $1.5 | |
| 6 | Claude 4.5 Haiku | Anthropic | 154 | 29.9 | $2 |
| 7 | Qwen3.5 122B A10B | Alibaba | 149 | 28.2 | $1.1 |
| 8 | Nemotron 3 Ultra 550B A55B | NVIDIA | 144 | 38.3 | $1.14 |
| 9 | Nemotron 3 Super 120B A12B | NVIDIA | 143 | 25.7 | $0.35 |
| 10 | Mistral Medium 3.5 | Mistral | 141 | 30.4 | $3 |
Данные: индекс интеллекта, цена и скорость по методологии Artificial Analysis. Актуально на август 2026. Полный каталог — /models.
Безоговорочным лидером по скорости стал Ling-3.0-flash, демонстрируя рекордные показатели на стандартных нагрузках. За ним плотно сгруппировались продукты Google — Gemini 3.7 Flash и Gemini 3.5 Flash-Lite, которые предлагают отличный баланс между скоростью и многозадачностью. Важно отметить, что даже самые быстрые модели из списка (Qwen3.5 122B A10B и Nemotron 3 Ultra 550B A55B) сохраняют высокую точность, что делает их пригодными для сложных аналитических задач, где важна не только скорость, но и глубина анализа.
Модели Claude 4.5 Haiku и Gemini 3.6 Flash занимают промежуточное положение, предлагая стабильную скорость, но уступая лидерам в чистых показателях токенов в секунду. Для задач, где критична минимальная задержка (например, чат-боты в реальном времени), приоритет стоит отдавать линейке Flash и Haiku, тогда как для генерации длинных текстов или кода лучше подойдут более «тяжелые» Nemotron и Qwen, которые все еще остаются в топе по скорости относительно своего интеллекта.
02Кому что подойдёт
- Для максимального бюджета и API: Ling-3.0-flash и Gemini 3.7 Flash — если важна самая быстрая реакция без ограничений по стоимости запросов.
- Для локального запуска (Self-hosted): Qwen3.5 122B A10B — лучший выбор для развертывания на собственном сервере или мощной рабочей станции в условиях санкций.
- Для балансировки цены и скорости: Gemini 3.5 Flash-Lite — оптимальный вариант для массовых задач, где не требуется сверхвысокий IQ, но важна дешевизна и скорость.
- Для сложных аналитических задач: Nemotron 3 Ultra 550B A55B — если нужен максимальный интеллект при допустимой задержке, превышающей базовые Flash-модели.
Источник: Artificial Analysis ↗
