Локальный AI-сервер для геймерских ПК
Разработчики представили Strata — бесплатный инструмент с открытым исходным кодом, который позволяет запускать на обычном компьютере модель Qwen3.8-Flash-Next с 125 миллиардами параметров. Это решение стирает грань между облачными LLM и локальным вычислением: все данные остаются на вашем устройстве, а для работы требуется всего 12 ГБ видеопамяти (VRAM) и 32 ГБ оперативной памяти.
Модель поддерживает чат, генерацию кода, анализ изображений и интеграцию с агентами через API. Проект совместим с Windows 10/11 и Linux, а также с видеокартами NVIDIA (серии 20, 30, 40, 50) и AMD (RX 7000/9000 серии, Radeon AI PRO).
Производительность: скорость против качества
Ключевая особенность Strata — гибкая квантование моделей. Чем сильнее сжатие (меньше размер), тем выше скорость генерации, но незначительно падает точность. Тестирование проводилось на двух конфигурациях: NVIDIA RTX 5070 (12 ГБ) и AMD RX 9070 XT (16 ГБ). Ниже приведены результаты генерации ответов (write speed) для различных форматов квантования:
| Формат квантования | RTX 5070 (12 GB) ток/с | RX 9070 XT (16 GB) ток/с | Чтение промпта (32K) RTX 5070 ток/с |
|---|---|---|---|
| Q2_0 (наибольшая скорость) | 94 | 60 | 2,650 |
| IQ2_XS | 79 | 52 | 2,090 |
| IQ3_XXS | 62 | 52 | 1,750 |
| IQ3_S (баланс) | 53 | — | 1,620 |
| Coder (специализированная) | 55 | 44 | 2,180 |
Скорость в 60 токенов в секунду считается комфортной для чтения в реальном времени. Для сравнения, видеокарта с большим объемом памяти, такая как RTX 3090 (24 ГБ), способна выдавать 100–140 токенов в секунду.
Выбор модели под ресурсы системы
Установщик Strata автоматически подбирает модель в зависимости от объема вашей оперативной памяти (RAM). Доступны несколько вариантов, включая специализированную версию Coder (достигает 91% от полного результата SWE-bench Verified) и оптимизированную версию Swift 1.5 для быстрого ответа.
- 32 ГБ RAM: Рекомендуется модель Coder (или Q2_0/IQ2_XS для видеокарт с 24 ГБ VRAM).
- 48 ГБ RAM: Подходят IQ2_XS или Q2_0 (самая быстрая).
- 64 ГБ RAM: Идеально для IQ2_XS (рекомендуется) или IQ3_S (наиболее умная, но медленная).
- 96+ ГБ RAM: Позволяет использовать IQ3_S или экспериментальные версии от Unsloth (UD-IQ4_XS), которые могут подгружать часть данных с SSD.
Интеграция и установка
Strata работает как локальный сервер. После установки (занимает около 80 ГБ на SSD) приложение открывается в браузере по адресу http://127.0.0.1:8080. Для подключения сторонних инструментов (Cursor, Claude Code, GitHub Copilot и др.) используется стандартный OpenAI-совместимый API по адресу http://127.0.0.1:8080/v1.
Установка автоматизирована: достаточно запустить скрипт START-HERE.bat (Windows) или ./setup.sh (Linux). Первый запуск может занять 1–3 минуты из-за загрузки 35–55 ГБ данных в оперативную память. В дальнейшем запуск происходит мгновенно.
Источник: Github ↗
