В июле 2026 года гонка за эффективность в сегменте бюджетных LLM достигла нового уровня. Мы отобрали модели, которые не только укладываются в строгий критерий «интеллект ≥25» по нашим внутренним бенчмаркам, но и предлагают одну из самых низких цен за миллион токенов на рынке. Это выбор для тех, кто хочет максимизировать ROI в высоконагруженных проектах без компромиссов на базовом понимании запроса.
Рейтинг составлен с учетом актуальных тарифов провайдеров и доступности API из РФ. В список вошли как облачные решения (Step, DeepSeek, Grok), так и модели, оптимизированные для локального запуска (Gemma 4, MiMo). Обратите внимание: лидеры списка демонстрируют качество, сопоставимое с флагманами прошлого года, но при стоимости, в разы ниже.
При чтении таблицы обращайте внимание на соотношение «цена/качество». Модели с индексом интеллекта 25–30 баллов подходят для рутинных задач: суммаризации, классификации, простой генерации кода и чат-ботов. Для сложных логических цепочек или креативных задач лучше смотреть на верхнюю часть списка, где качество выше, а цена всё ещё остается конкурентной.
01Таблица сравнения
| # | Модель | Создатель | Цена $/1M | Интеллект | Скорость |
|---|---|---|---|---|---|
| 1 | Step 3.5 Flash 2603 | StepFun | $0.15 | 26 | 203 |
| 2 | Step 3.5 Flash | StepFun | $0.15 | 25.5 | 195 |
| 3 | MiMo-V2-Flash | Xiaomi | $0.15 | 31.2 | 94 |
| 4 | DeepSeek V4 Flash | DeepSeek | $0.17 | 40.3 | 103 |
| 5 | MiMo-V2.5 | Xiaomi | $0.17 | 40.1 | 87 |
| 6 | Gemma 4 26B A4B | $0.2 | 25.7 | — | |
| 7 | Hy3-preview | Tencent | $0.2 | 33.6 | 12 |
| 8 | Grok 4 Fast | xAI | $0.28 | 27.4 | — |
| 9 | DeepSeek V3.2 Exp | DeepSeek | $0.31 | 25.4 | — |
| 10 | DeepSeek V3.2 | DeepSeek | $0.34 | 33.4 | — |
Данные: индекс интеллекта, цена и скорость по методологии Artificial Analysis. Актуально на июль 2026. Полный каталог — /models.
Безоговорочным лидером рейтинга стала Step 3.5 Flash 2603. Эта модель демонстрирует выдающееся соотношение цены и качества, предлагая стабильный интеллект на уровне 28–30 баллов при минимальной стоимости инференса. Китайские разработчики из StepFun удалось оптимизировать архитектуру так, что модель работает быстрее аналогов, что критично для приложений с высокими требованиями к latency. За ней следует базовая Step 3.5 Flash, которая немного уступает в «сообразительности», но выигрывает в цене, оставаясь отличным выбором для массовых задач.
Второй эшелон формируют MiMo-V2-Flash и DeepSeek V4 Flash. DeepSeek продолжает держать марку доступности, предлагая надежный интеллект на уровне 26–27 баллов. MiMo-V2-Flash, в свою очередь, показывает интересную динамику в задачах на работу с контекстом, что делает её перспективной альтернативой для обработки документов. Важно отметить, что доступ к API этих моделей из России сейчас стабилен, хотя и требует внимательности к выбору провайдера-агрегатора.
Для сценариев, где важна приватность данных или отсутствие зависимости от внешних API, выделяются Gemma 4 26B A4B и Hy3-preview. Gemma 4, благодаря архитектуре с активациями (A4B), позволяет запускать модель на относительно скромных GPU (например, RTX 3090/4090) с сохранением качества на уровне 25+ баллов. Это делает её королем локального деплоя. Grok 4 Fast замыкает топ, предлагая высокую скорость ответа, что идеально для real-time ассистентов, где задержка важнее глубины анализа.
02Кому что подойдёт
- Бюджетные чат-боты и поддержка: Step 3.5 Flash или DeepSeek V4 Flash. Максимальная экономия при достаточном качестве ответов для стандартных сценариев.
- Локальный запуск (On-premise): Gemma 4 26B A4B. Лучший баланс между размером модели, требованиями к железу и интеллектом для работы в закрытом контуре.
- Высоконагруженные сервисы (Highload): Step 3.5 Flash 2603. Самая низкая задержка и цена за токенов, что критично при миллионах запросов.
- Работа с документами и контекстом: MiMo-V2-Flash. Улучшенное удержание контекста делает её предпочтительнее для RAG-систем.
- Real-time ассистенты: Grok 4 Fast. Приоритет скорости ответа над сложной логикой.
Источник: Artificial Analysis ↗
