Релиз модели21 августа 2026 г., 09:47 МСК🤖 Auto

Qwen3.8-27B: SOTA квантование и точность от Unsloth

Команда Unsloth представила Qwen3.8-27B — новую открытую модель с динамическим квантованием 2.0, обеспечивающую state-of-the-art точность при снижении требований к памяти.

Баннер новости 6217

Революция в квантовании: Dynamic 2.0

Лаборатория Unsloth выпустила обновленную версию своей технологии динамического квантования GGUF, получившую индекс 2.0. Главная цель обновления — достижение состояния «state-of-the-art» (SOTA) в балансе между размером модели и её интеллектуальными способностями. Новая архитектура позволяет запускать мощные 27-миллиардные модели на потребительском оборудовании без критической потери качества генерации.

Технические характеристики и метрики

Модель Qwen3.8-27B доступна в формате GGUF, что делает её совместимой с широким спектром локальных инференс-фреймворков (таких как llama.cpp, Ollama и других). Ключевым отличием версии 2.0 является улучшенный алгоритм сжатии весов, который минимизирует артефакты, обычно возникающие при агрессивном квантовании.

Параметр Значение / Описание
Название модели Qwen3.8-27B
Разработчик Unsloth (на базе архитектуры Qwen)
Формат GGUF (Dynamic Quantization 2.0)
Количество параметров 27 миллиардов
Статус Open Source (Hugging Face)
Ключевое преимущество SOTA точность при квантовании

Почему это важно для разработчиков

Для энтузиастов и профессионалов, работающих с локальным ИИ, 27B параметров — это «золотая середина». Такие модели значительно превосходят по логике и контексту 7B-аналоги, но требуют меньше VRAM, чем 70B+ гиганты. Внедрение Dynamic 2.0 от Unsloth означает, что пользователи могут получить производительность, близкую к полнобитным (FP16/BF16) моделям, используя более низкие битности (например, Q4_K_M или Q5_K_M), что ускоряет инференс и снижает потребление памяти.

Доступность

Модель уже доступна на платформе Hugging Face. На момент публикации доступно 118 вариантов квантованных весов, что позволяет пользователям выбрать оптимальный баланс между скоростью и точностью под конкретное железо. Обновление репозитория было выполнено менее суток назад, что свидетельствует о высокой активности разработчиков в оптимизации этой архитектуры.

Источник: Huggingface ↗