Инструменты6 октября 2026 г., 23:46 МСК🤖 Auto

Запустите 125-миллиардную модель Qwen3.8 на игровом ПК: обзор Strata

Проект Strata позволяет запускать огромную языковую модель Qwen3.8-Flash-Next локально на видеокартах NVIDIA и AMD с 12 ГБ VRAM, обеспечивая скорость до 94 токенов в секунду.

Баннер новости 9067

Локальный AI-сервер для геймерских ПК

Разработчики представили Strata — бесплатный инструмент с открытым исходным кодом, который позволяет запускать на обычном компьютере модель Qwen3.8-Flash-Next с 125 миллиардами параметров. Это решение стирает грань между облачными LLM и локальным вычислением: все данные остаются на вашем устройстве, а для работы требуется всего 12 ГБ видеопамяти (VRAM) и 32 ГБ оперативной памяти.

Модель поддерживает чат, генерацию кода, анализ изображений и интеграцию с агентами через API. Проект совместим с Windows 10/11 и Linux, а также с видеокартами NVIDIA (серии 20, 30, 40, 50) и AMD (RX 7000/9000 серии, Radeon AI PRO).

Производительность: скорость против качества

Ключевая особенность Strata — гибкая квантование моделей. Чем сильнее сжатие (меньше размер), тем выше скорость генерации, но незначительно падает точность. Тестирование проводилось на двух конфигурациях: NVIDIA RTX 5070 (12 ГБ) и AMD RX 9070 XT (16 ГБ). Ниже приведены результаты генерации ответов (write speed) для различных форматов квантования:

Формат квантования RTX 5070 (12 GB) ток/с RX 9070 XT (16 GB) ток/с Чтение промпта (32K) RTX 5070 ток/с
Q2_0 (наибольшая скорость) 94 60 2,650
IQ2_XS 79 52 2,090
IQ3_XXS 62 52 1,750
IQ3_S (баланс) 53 — 1,620
Coder (специализированная) 55 44 2,180

Скорость в 60 токенов в секунду считается комфортной для чтения в реальном времени. Для сравнения, видеокарта с большим объемом памяти, такая как RTX 3090 (24 ГБ), способна выдавать 100–140 токенов в секунду.

Выбор модели под ресурсы системы

Установщик Strata автоматически подбирает модель в зависимости от объема вашей оперативной памяти (RAM). Доступны несколько вариантов, включая специализированную версию Coder (достигает 91% от полного результата SWE-bench Verified) и оптимизированную версию Swift 1.5 для быстрого ответа.

  • 32 ГБ RAM: Рекомендуется модель Coder (или Q2_0/IQ2_XS для видеокарт с 24 ГБ VRAM).
  • 48 ГБ RAM: Подходят IQ2_XS или Q2_0 (самая быстрая).
  • 64 ГБ RAM: Идеально для IQ2_XS (рекомендуется) или IQ3_S (наиболее умная, но медленная).
  • 96+ ГБ RAM: Позволяет использовать IQ3_S или экспериментальные версии от Unsloth (UD-IQ4_XS), которые могут подгружать часть данных с SSD.

Интеграция и установка

Strata работает как локальный сервер. После установки (занимает около 80 ГБ на SSD) приложение открывается в браузере по адресу http://127.0.0.1:8080. Для подключения сторонних инструментов (Cursor, Claude Code, GitHub Copilot и др.) используется стандартный OpenAI-совместимый API по адресу http://127.0.0.1:8080/v1.

Установка автоматизирована: достаточно запустить скрипт START-HERE.bat (Windows) или ./setup.sh (Linux). Первый запуск может занять 1–3 минуты из-за загрузки 35–55 ГБ данных в оперативную память. В дальнейшем запуск происходит мгновенно.

Источник: Github ↗