Инструменты6 октября 2026 г., 01:46 МСК🤖 Auto

Qwen3.8-Flash-Next на 125 млрд параметров на домашнем ПК: обзор Strata

Open-source проект Strata позволяет запускать гигантскую LLM Qwen3.8-Flash-Next локально на видеокартах с 8–12 ГБ VRAM, обеспечивая скорость до 93 токенов/с.

Баннер новости 8989

Локальный запуск LLM без серверов

Проект Strata (GitHub: mach10x/strata) демонстрирует возможность запуска нейросети Qwen3.8-Flash-Next (125 млрд параметров) на обычном игровом ПК. Модель, требующая обычно серверных мощностей, адаптирована для работы на NVIDIA GeForce RTX 20/30/40/50 и AMD Radeon RX 6000/7000/9000 сериях с объемом видеопамяти от 12 ГБ. Проект распространяется под лицензией MIT, полностью бесплатен и работает в Windows и Linux.

Производительность: бенчмарки на игровых ПК

Скорость генерации зависит от квантования модели и объема VRAM. Тестирование проводилось на двух конфигурациях: RTX 5070 (12 ГБ) и RX 9070 XT (16 ГБ). Ниже приведены результаты скорости «записи ответов» (генерация токенов) и «чтения промпта» (обработка контекста до 32K токенов):

Модель (Квантование) RTX 5070 (12 GB) — Генерация RTX 5070 (12 GB) — Чтение RX 9070 XT (16 GB) — Генерация RX 9070 XT (16 GB) — Чтение
Q2_0 93 ток/с 2,170 ток/с 60 ток/с 1,160 ток/с
IQ2_XS 79 ток/с 2,090 ток/с 52 ток/с 1,110 ток/с
IQ3_XXS 62 ток/с 1,750 ток/с — —
IQ3_S 53 ток/с 1,620 ток/с — —
Coder (специализированная) 55 ток/с 2,180 ток/с 44 ток/с 1,420 ток/с

Для сравнения: на видеокарте с большим объемом памяти (RTX 3090, 24 ГБ) ожидается скорость генерации 100–140 токенов в секунду. Скорость чтения длинных документов (до 30 000 токенов) составляет около 1 000–2 000 токенов/с, что позволяет обрабатывать большие объемы кода или текста за секунды.

Техническая реализация: как это работает

Стратегия Strata заключается в распределении вычислений между всей системой ПК, а не только видеокартой. Модель состоит из 24 576 «экспертов» (моделей внутри MoE-архитектуры), из которых для обработки каждого слова требуется лишь 10. Алгоритм работает по принципу «угадай и проверь»:

  • VRAM: хранит наиболее часто запрашиваемые эксперты.
  • RAM: содержит все эксперты и кэш контекста (до 128K токенов при 64 ГБ ОЗУ).
  • CPU: обрабатывает оставшиеся вычисления параллельно.
  • SSD: используется как хранилище для больших таблиц поиска, что позволяет снизить требования к оперативной памяти, но может влиять на скорость при нехватке ОЗУ.

Первый запуск требует загрузки ~70 ГБ модели и 35–55 ГБ в ОЗУ, что может вызвать временную зависимость системы на 1–3 минуты. Последующие запуски происходят мгновенно.

Совместимость и интеграция

Strata предоставляет API, совместимый с OpenAI и Anthropic, что позволяет использовать локальную модель в сторонних приложениях:

  • OpenAI-совместимые клиенты: базовый URL http://127.0.0.1:8080/v1.
  • Anthropic-совместимые клиенты (например, Claude Code): URL http://127.0.0.1:8080/v1/messages.

Для установки достаточно запустить скрипт START-HERE.bat (Windows) или ./setup.sh (Linux). Установщик автоматически определяет железо, предлагает оптимальную версию модели (например, Coder для 32 ГБ ОЗУ или IQ3_S для 64+ ГБ) и настраивает окружение. Поддерживается работа с изображениями (на Linux для AMD карт через CPU) и многопользовательский доступ через настройку хоста.

Источник: Github ↗