Инструменты19 августа 2026 г., 17:46 МСК🤖 Auto

FreeToken: Запуск MoE-моделей до 753B на домашнем железе

Команда FlashML представила FreeToken — систему инференса, позволяющую запускать гигантские модели (до 753B параметров) на ноутбуках и игровых ПК без жесткой привязки к GPU.

Баннер новости 6082

Революция локального инференса: от 35B до 753B

Лаборатория FlashML, в которую входят такие фигуры, как Сон Хан (Song Han), Матеи Захария (Matei Zaharia) и Ион Стоица (Ion Stoica) из UC Berkeley, выпустила FreeToken. Это open-source система для инференса моделей архитектуры MoE (Mixture of Experts), способная работать на потребительском оборудовании. Ключевое достижение — запуск модели GLM-5.2 (753B параметров) на одной рабочей станции, а также запуск моделей от 35B на ноутбуках и до 284B на игровых ПК.

Динамическое распределение ресурсов

Главное отличие FreeToken от аналогов (таких как vLLM или TGI) — отсутствие фиксированной схемы выгрузки. Система в реальном времени анализирует доступную память и динамически распределяет вычисления между CPU и GPU. Это позволяет эффективно использовать даже слабые конфигурации, где VRAM ограничена всего 8 ГБ.

Технические характеристики и поддержка

Система оптимизирует весь стек: от раскладки модели на диске до управления памятью во время выполнения (runtime). Поддерживается более 20 моделей, включая Qwen, DeepSeek, GLM, Mixtral и другие архитектуры MoE. Работает на Windows, Linux и macOS.

Параметр Значение / Поддержка
Максимальный размер модели 753B (GLM-5.2)
Минимальная VRAM 8 GB (ноутбуки)
Архитектура MoE (Mixture of Experts)
ОС Windows, Linux, macOS
Лицензия Open Source

Агентные сценарии и будущее

FreeToken также поддерживает агентные сценарии, позволяя переиспользовать состояние между вызовами и адаптироваться к меняющемуся паттерну нагрузки. Это делает инструмент особенно ценным для разработчиков, создающих локальных AI-ассистентов, которым важна скорость отклика и экономия ресурсов.

Источник: Flashml ↗