Революция локального инференса: от 35B до 753B
Лаборатория FlashML, в которую входят такие фигуры, как Сон Хан (Song Han), Матеи Захария (Matei Zaharia) и Ион Стоица (Ion Stoica) из UC Berkeley, выпустила FreeToken. Это open-source система для инференса моделей архитектуры MoE (Mixture of Experts), способная работать на потребительском оборудовании. Ключевое достижение — запуск модели GLM-5.2 (753B параметров) на одной рабочей станции, а также запуск моделей от 35B на ноутбуках и до 284B на игровых ПК.
Динамическое распределение ресурсов
Главное отличие FreeToken от аналогов (таких как vLLM или TGI) — отсутствие фиксированной схемы выгрузки. Система в реальном времени анализирует доступную память и динамически распределяет вычисления между CPU и GPU. Это позволяет эффективно использовать даже слабые конфигурации, где VRAM ограничена всего 8 ГБ.
Технические характеристики и поддержка
Система оптимизирует весь стек: от раскладки модели на диске до управления памятью во время выполнения (runtime). Поддерживается более 20 моделей, включая Qwen, DeepSeek, GLM, Mixtral и другие архитектуры MoE. Работает на Windows, Linux и macOS.
| Параметр | Значение / Поддержка |
|---|---|
| Максимальный размер модели | 753B (GLM-5.2) |
| Минимальная VRAM | 8 GB (ноутбуки) |
| Архитектура | MoE (Mixture of Experts) |
| ОС | Windows, Linux, macOS |
| Лицензия | Open Source |
Агентные сценарии и будущее
FreeToken также поддерживает агентные сценарии, позволяя переиспользовать состояние между вызовами и адаптироваться к меняющемуся паттерну нагрузки. Это делает инструмент особенно ценным для разработчиков, создающих локальных AI-ассистентов, которым важна скорость отклика и экономия ресурсов.
Источник: Flashml ↗
