В июле 2026 года рынок open-weight моделей переживает качественный скачок: конкуренция сместилась от простого увеличения параметров к оптимизации архитектуры и эффективности мышления. Мы составили актуальный рейтинг лучших открытых моделей, доступных для скачивания и локального запуска, отсортировав их по показателям интеллектуального потенциала. В этот список вошли решения, которые не только демонстрируют передовые результаты в бенчмарках, но и остаются доступными для энтузиастов и бизнеса в условиях текущих ограничений.
Особое внимание в этом обзоре уделено моделям, которые можно запустить на оборудовании, доступном в РФ, без необходимости использования зарубежных облачных сервисов. Мы проанализировали баланс между качеством ответов, скоростью инференса и требованиями к видеопамяти. Рейтинг учитывает как «тяжеловесов» с триллионными параметрами, так и компактные решения, способные работать на потребительских видеокартах благодаря продвинутым техникам квантования и дистилляции.
При чтении рейтинга обращайте внимание на то, что позиция в списке отражает综合能力 (综合能力 —综合能力) в задачах логического вывода, программирования и работы с контекстом. Однако для практического применения важно учитывать не только «интеллект», но и скорость генерации токенов. Некоторые лидеры рейтинга требуют мощных серверных GPU, тогда как другие предлагают отличный компромисс между производительностью и доступностью железа.
01Таблица сравнения
| # | Модель | Создатель | Интеллект | Цена $/1M | Контекст |
|---|---|---|---|---|---|
| 1 | MiMo-V2-Flash | Xiaomi | 33.2 | $0 | 256k |
| 2 | DeepSeek V3.2 | DeepSeek | 32 | $0.32 | 128k |
| 3 | DeepSeek V3.1 Terminus | DeepSeek | 30.4 | $1.91 | 128k |
| 4 | Ling-2.6-1T | InclusionAI | 26.1 | $0.85 | 262k |
| 5 | Gemma 4 26B A4B | 25.7 | $0.2 | 256k | |
| 6 | DeepSeek V3.2 Exp | DeepSeek | 25.4 | $0.32 | 128k |
| 7 | DeepSeek V3.2 Speciale | DeepSeek | 22.2 | $0 | 128k |
| 8 | Apriel-v1.5-15B-Thinker | ServiceNow | 21.2 | $0 | 128k |
| 9 | DeepSeek V3.1 | DeepSeek | 21 | $0.84 | 128k |
| 10 | Apriel-v1.6-15B-Thinker | ServiceNow | 20.5 | $0 | 128k |
Данные: индекс интеллекта, цена и скорость по методологии Artificial Analysis. Актуально на июль 2026. Полный каталог — /models.
Безоговорочным лидером рейтинга стала модель MiMo-V2-Flash. Несмотря на приставку «Flash», указывающую на оптимизацию скорости, она демонстрирует выдающиеся результаты в задачах на сложное логическое мышление, обходя многие более крупные аналоги. Это решение стало прорывом для локального запуска, так как позволяет получать ответы уровня проприетарных SOTA-моделей при значительно меньших требованиях к ресурсам. Для пользователей из РФ это особенно актуально, так как MiMo-V2-Flash легко вписывается в конфигурации с 24–48 ГБ VRAM при использовании эффективных форматов квантования.
На второй и третьей строчках расположились представители DeepSeek — V3.2 и V3.1 Terminus. Архитектура MoE (Mixture of Experts) позволяет этим моделям обрабатывать огромные объемы контекста с высокой скоростью. DeepSeek V3.2 выделяется улучшенной способностью к рассуждению (reasoning), что делает её идеальной для анализа сложных документов и написания кода. V3.1 Terminus, в свою очередь, предлагает более стабильную работу с узкоспециализированными запросами, оставаясь при этом одной из самых популярных моделей для локального деплоя благодаря зрелой экосистеме поддержки.
Среди других заметных игроков — Ling-2.6-1T и Gemma 4 26B A4B. Первая демонстрирует мощь «тысячелетних» моделей, но требует серьезного аппаратного обеспечения, что ограничивает её применение в домашних условиях. Вторая, Gemma 4, стала хитом благодаря отличному соотношению качества и размера: 26 миллиардов параметров позволяют ей работать на одной современной видеокарте, не уступая в базовых задачах моделям в 2–3 раза большего размера. Apriel-v1.5-15B-Thinker замыкает топ, предлагая уникальный подход к «мышлению» в компактном формате, что делает её отличным выбором для мобильных сценариев и edge-устройств.
02Кому что подойдёт
- Для максимального качества и анализа: Выбирайте DeepSeek V3.2 или MiMo-V2-Flash, если у вас есть доступ к серверным GPU (A100/H100) или мощным рабочим станциям с 80+ ГБ VRAM. Эти модели лучше всего справляются с сложными логическими задачами и длинными контекстами.
- Для локального запуска на потребительском железе: Оптимальный выбор — Gemma 4 26B A4B или Apriel-v1.5-15B-Thinker. Они стабильно работают на видеокартах с 12–16 ГБ памяти, обеспечивая быстрый отклик и хорошее качество ответов для повседневных задач.
- Для баланса скорости и интеллекта: MiMo-V2-Flash и DeepSeek V3.1 Terminus предлагают наилучший компромисс. Они генерируют ответы быстрее тяжелых аналогов, что критично для интерактивных приложений и чат-ботов.
- Для специализированных задач и исследований: Ling-2.6-1T подойдет исследователям и компаниям, готовым инвестировать в инфраструктуру для работы с моделями экстремально большого размера, где важна максимальная точность и глубина понимания данных.
Источник: Artificial Analysis ↗
