Революция в on-device инференсе
Лаборатория Edge0 выпустила превью модели Edge0-8b-a1b — архитектуры класса 8B (Mixture of Experts), которая способна функционировать в условиях жестких ограничений памяти мобильных устройств. Ключевое достижение: полное использование весов модели происходит без их предварительной загрузки в оперативную память. Активная память (RAM) потребляет менее 1 ГБ, что позволяет запускать LLM на устройствах уровня iPhone без использования внешних GPU или облачных серверов.
Три технологии, делающие это возможным
Стабильная скорость генерации (25 токенов/с) и низкое потребление памяти достигнуты за счет комбинации трех инновационных механизмов в фреймворке edge0 (с бэкендом MLX):
- SSD expert offload: веса «экспертов» модели хранятся на SSD и подгружаются в RAM только по мере необходимости (on-demand). Пиковая память ограничена только активными весами, а не общим размером модели.
- Prerouter: обученная головка предсказывает маршрутизацию экспертов на шаг вперед. Это позволяет загружать данные параллельно с прямым проходом (forward pass), увеличивая пропускную способность декодирования до +59%.
- Recover-LoRA: базовая модель квантована до int4, а потери качества компенсируются через дистилляцию от учителя FP16. Адаптеры LoRA остаются неслитыми, что позволяет одному базовому чекпоинту обслуживать множество наборов адаптеров.
Сравнение качества: Int4 vs FP16
Несмотря на агрессивное квантование, модель сохраняет высокую точность. В бенчмарках OpenCompass модель Edge0-8b (int4) демонстрирует результаты, сопоставимые с базовой моделью inclusionAI Ling 3.0 tiny (fp16), а в некоторых метриках даже превосходит ее. Средняя потеря качества составляет всего 2.8 балла.
| Бенчмарк | Edge0-8b (int4) | Ling 3.0 tiny (fp16) |
|---|---|---|
| MMLU-Pro | 70.1 | 65.8 |
| AIME 2026 | 63.3 | 73.3 |
| HumanEval | 91.5 | 92.7 |
| GPQA-Diamond | 70.7 | 71.2 |
| IFBench | 53.9 | 60.6 |
| Среднее | 69.9 | 72.7 |
Технические характеристики и производительность
Модель построена на базе inclusionAI Ling 3.0 tiny (гибридная архитектура MLA + MoE). Она имеет 24 слоя, 128 экспертов, из которых на каждом токене активируется 8 (K=8). Контекстное окно составляет 128k токенов, поддерживается режим «мышления» (thinking mode).
Тестирование на Mac mini M4 Pro (24 ГБ ОЗУ) показало следующие результаты:
- Скорость декодирования: 23.9–25.3 токенов/с.
- Пропускная способность префилла: 500 токенов/с (холодный старт) / 1428 токенов/с (теплый).
- Пиковая активная память: 1.0 ГБ (для коротких контекстов). Для длинных контекстов (3.3k токенов) кэш KV добавляет ~3.3 ГБ.
Ограничения и перспективы
Это превью-релиз. Модель пока не оптимизирована для агентных задач (многошаговое планирование, использование инструментов). Бэкенд MLX на данный момент поддерживает только Apple Silicon, хотя другие платформы заявлены в дорожной карте. Лицензия — Apache 2.0, что делает модель открытой для коммерческого и исследовательского использования.
Источник: Huggingface ↗
