Локальный запуск LLM без серверов
Проект Strata (GitHub: mach10x/strata) демонстрирует возможность запуска нейросети Qwen3.8-Flash-Next (125 млрд параметров) на обычном игровом ПК. Модель, требующая обычно серверных мощностей, адаптирована для работы на NVIDIA GeForce RTX 20/30/40/50 и AMD Radeon RX 6000/7000/9000 сериях с объемом видеопамяти от 12 ГБ. Проект распространяется под лицензией MIT, полностью бесплатен и работает в Windows и Linux.
Производительность: бенчмарки на игровых ПК
Скорость генерации зависит от квантования модели и объема VRAM. Тестирование проводилось на двух конфигурациях: RTX 5070 (12 ГБ) и RX 9070 XT (16 ГБ). Ниже приведены результаты скорости «записи ответов» (генерация токенов) и «чтения промпта» (обработка контекста до 32K токенов):
| Модель (Квантование) | RTX 5070 (12 GB) — Генерация | RTX 5070 (12 GB) — Чтение | RX 9070 XT (16 GB) — Генерация | RX 9070 XT (16 GB) — Чтение |
|---|---|---|---|---|
| Q2_0 | 93 ток/с | 2,170 ток/с | 60 ток/с | 1,160 ток/с |
| IQ2_XS | 79 ток/с | 2,090 ток/с | 52 ток/с | 1,110 ток/с |
| IQ3_XXS | 62 ток/с | 1,750 ток/с | — | — |
| IQ3_S | 53 ток/с | 1,620 ток/с | — | — |
| Coder (специализированная) | 55 ток/с | 2,180 ток/с | 44 ток/с | 1,420 ток/с |
Для сравнения: на видеокарте с большим объемом памяти (RTX 3090, 24 ГБ) ожидается скорость генерации 100–140 токенов в секунду. Скорость чтения длинных документов (до 30 000 токенов) составляет около 1 000–2 000 токенов/с, что позволяет обрабатывать большие объемы кода или текста за секунды.
Техническая реализация: как это работает
Стратегия Strata заключается в распределении вычислений между всей системой ПК, а не только видеокартой. Модель состоит из 24 576 «экспертов» (моделей внутри MoE-архитектуры), из которых для обработки каждого слова требуется лишь 10. Алгоритм работает по принципу «угадай и проверь»:
- VRAM: хранит наиболее часто запрашиваемые эксперты.
- RAM: содержит все эксперты и кэш контекста (до 128K токенов при 64 ГБ ОЗУ).
- CPU: обрабатывает оставшиеся вычисления параллельно.
- SSD: используется как хранилище для больших таблиц поиска, что позволяет снизить требования к оперативной памяти, но может влиять на скорость при нехватке ОЗУ.
Первый запуск требует загрузки ~70 ГБ модели и 35–55 ГБ в ОЗУ, что может вызвать временную зависимость системы на 1–3 минуты. Последующие запуски происходят мгновенно.
Совместимость и интеграция
Strata предоставляет API, совместимый с OpenAI и Anthropic, что позволяет использовать локальную модель в сторонних приложениях:
- OpenAI-совместимые клиенты: базовый URL
http://127.0.0.1:8080/v1. - Anthropic-совместимые клиенты (например, Claude Code): URL
http://127.0.0.1:8080/v1/messages.
Для установки достаточно запустить скрипт START-HERE.bat (Windows) или ./setup.sh (Linux). Установщик автоматически определяет железо, предлагает оптимальную версию модели (например, Coder для 32 ГБ ОЗУ или IQ3_S для 64+ ГБ) и настраивает окружение. Поддерживается работа с изображениями (на Linux для AMD карт через CPU) и многопользовательский доступ через настройку хоста.
Источник: Github ↗
