Проблема: «Узкое горлышко» MoE на потребительском железе
Открытие весов моделей (weights) не решает проблему их запуска. Mixture-of-Experts (MoE) архитектуры, такие как DeepSeek-V4-Flash и GLM-5.2, требуют огромных объемов памяти для хранения всех экспертов, даже если в вычислении участвует лишь малая их часть. Существующие движки (llama.cpp, Ollama, KTransformers) страдают от трех критических недостатков:
- Разрушение разреженности при префилле: При обработке длинных контекстов PCIe-шина перегружается передачей всего пула экспертов, что занимает до 10 секунд на ноутбуках.
- Статическое размещение: Фиксация «горячих» экспертов при загрузке игнорирует динамическую маршрутизацию токенов, заставляя GPU простаивать, а CPU — перегружаться.
- Нехватка пропускной способности: Двухканальная DDR5 (80–90 ГБ/с) не справляется с нагрузкой, которую тянет GPU (1–1.8 ТБ/с).
Решение: Три механизма FreeToken
Команда разработала систему, которая рассматривает ПК как единый эластичный инференс-платформу. Ключевые инновации:
- Bandwidth-adaptive execution (q* policy): Алгоритм динамически делит нагрузку между GPU и CPU, основываясь на реальной пропускной способности шины. Если PCIe перегружен, часть экспертов вычисляется на CPU «на месте» (in-place), а результаты суммируются точно, без аппроксимации.
- Semantic-aware caching: Кэширование привязано к семантическим маркерам (блоки размышлений, вызовы инструментов). Это позволяет пере-префиллить только измененные суффиксы контекста, а не всю историю.
- Elastic memory management: Пересборка кэша экспертов на GPU происходит в безопасных точках планировщика без перезагрузки движка. Первый запрос обслуживается с «холодным» кэшем без предварительного прогрева.
Результаты бенчмарков
FreeToken демонстрирует значительный прирост скорости декодирования по сравнению с лидерами рынка. Ниже приведено сравнение производительности на RTX 5090 и RTX 4060:
| Модель / Конфигурация | FreeToken (tok/s) | llama.cpp (tok/s) | Ollama (tok/s) | KTransformers (tok/s) |
|---|---|---|---|---|
| Qwen3.6-35B-A3B (BF16), RTX 5090 | 77–83 | ~33-40* | ~35-40* | ~35-40* |
| DeepSeek-V4-Flash (MXFP4), RTX 5090 | 22–25 | ~10-15* | ~10-15* | ~10-15* |
| GLM-5.2 (753B, 40B active), RTX PRO 6000 | 14.9 | 7.3 | — | — |
| Qwen3.6-35B (NVFP4), RTX 4060 Laptop | 39.3 | — | — | — |
*Примечание: Точные цифры для baselines в таблице источника не всегда сопоставимы напрямую из-за разных настроек, но FreeToken показывает ускорение в 1.5–2.3 раза относительно сильнейшего базового уровня.
Важно: Реальность против маркетинга
Аудит FlashML выявил ряд неточностей в заявках авторов:
- Сравнение с Codex: Утверждение, что 39.3 tok/s на ноутбуке «превосходит медианный скор Codex (33 tok/s)», вводит в заблуждение. Данные Codex нормализованы, а чистый скор декодирования Codex составляет 57.1 tok/s.
- GLM-5.2 на одной GPU: Хотя VRAM позволяет запустить модель, хост-машины часто имеют 512 ГБ DRAM, что критически важно для работы с пулом экспертов.
- Базовые модели: Сравнение с KTransformers проводилось на 6 потоках CPU, что не отражает их реального потенциала на многоядерных системах.
Доступность и применение
FreeToken выпущен под лицензией Apache-2.0 и доступен через PyPI (uv pip install "freetoken[accel]") и как десктопное приложение. CLI-интерфейс ft serve эмулирует API OpenAI/Anthropic на порту 1919.
Целевая аудитория: Разработчики агентов, стартапы и компании в сфере здравоохранения, права и финансов, где конфиденциальность данных требует локального запуска (air-gapped) без отправки токенов в облако. Для энтерпрайза это не замена дата-центрам, а инструмент для защищенных рабочих нагрузок.
Источник: MarkTechPost ↗
