Локальный AI на смартфоне: технические детали
Модель Ornith-1.5-9B (архитектура Qwen3.5) была дополнительно обучена на junafinity/Ornith-1.5-9B-uncensored для удаления этических ограничений. Публикация на Hugging Face от mradermacher предоставляет готовые GGUF-файлы, оптимизированные для локального инференса. Ключевое преимущество — возможность работы на устройствах с ограниченным объемом оперативной памяти, начиная с 4 ГБ (для Q3-квантования) и полноценно на 8 ГБ.
Выбор квантования: баланс скорости и качества
Для пользователей с 8 ГБ ОЗУ оптимальным выбором являются 4-битные и 5-битные квантования. Они обеспечивают хороший баланс между скоростью генерации (tok/s) и качеством ответов. Ниже приведена таблица доступных вариантов с указанием занимаемой памяти:
| Тип квантования | Размер файла (ГБ) | Рекомендация |
|---|---|---|
| Q4_K_S | 5.35 | Быстрый, рекомендуется |
| Q4_K_M | 5.63 | Быстрый, рекомендуется |
| Q5_K_S | 6.31 | Высокое качество |
| Q5_K_M | 6.47 | Высокое качество |
| Q6_K | 7.36 | Очень хорошее качество |
| Q8_0 | 9.53 | Лучшее качество (требует >8 ГБ) |
Мультимодальные компоненты
Помимо текстовой модели, доступны дополнения для работы с изображениями (mmproj). Для корректной работы мультимодального режима необходимо загрузить соответствующий файл:
- mmproj-Q8_0: 0.7 ГБ (оптимизированный вариант).
- mmproj-f16: 1.0 ГБ (полная точность).
Статистика и доступность
Модель демонстрирует высокую активность сообщества: за последний месяц скачано более 49 570 раз. Архитектура совместима с популярными инструментами локального запуска, такими как LM Studio, Open WebUI и другими, поддерживающими формат GGUF. Для использования файлов, разделенных на части, рекомендуется следовать инструкциям из README TheBloke.
Источник: Huggingface ↗
