0 отказов из 465 тестов, и это не лаборатория, а публичный релиз на Hugging Face. Модель Qwen3.6-27B-Uncensored-HauhauCS-Aggressive за месяц набрала 628 953 скачивания. Это редкий случай, когда главный апдейт не в «умнее», а в «перестала спорить с пользователем».
Автор сразу предупреждает: почти всем лучше версия Balanced. У неё те же 0/465 отказов, но ответы стабильнее в повседневных задачах.
Модель не стала умнее, но стала отвечать прямее

Ключевой момент: по словам автора, датасеты и базовые возможности не меняли. То есть ядро осталось прежним, поменяли только поведение при «сложных» запросах. Проще говоря, модель меньше уходит в отказы и длинные вступления.
Есть две версии с одинаковым результатом по benchmark (тест производительности): 0/465 отказов в обеих. Разница только в подаче ответа на жёстких промптах.
- Balanced — чаще сначала объясняет ход мысли, иногда добавляет короткий дисклеймер, потом даёт ответ.
- Aggressive — чаще сразу выдаёт «сырой» ответ, без пролога.
- Для большинства сценариев автор рекомендует именно Balanced.
Для бизнеса это важно по простой причине. Когда сотрудник ждёт результат, лишние 20–40 секунд «разговора модели с самой собой» бесят сильнее, чем мелкие ошибки.
Почему вокруг этого столько шума, если моделей и так много
Потому что это удар в боль локального ИИ. Люди ставят GGUF-модели офлайн, тратят время на настройки, а потом получают отказы в самый нужный момент.
Здесь сделали акцент на квантизации (сжатие модели) формата K_P. Это кастомный подход HauhauCS: качество обещают как у кванта на 1–2 уровня выше при росте размера всего на 5–15%.
На практике это выглядит так:
- Q8_K_P — около 32 GB.
- Q6_K_P — около 23 GB.
- Q4_K_P — около 18 GB.
- IQ2_M — около 10 GB.
То есть модель можно запускать и на разном железе, а не только на топовых серверах. Плюс она совместима с llama.cpp, LM Studio и другими GGUF-рантаймами без спецсборок.
Отдельный нюанс: в LM Studio K_P иногда отображается как «?». Это визуальный баг, не поломка модели.
Что это даёт предпринимателю, маркетологу и разработчику уже сегодня
Если говорить без фанатизма, это инструмент для тех, кто хочет локальный ИИ с предсказуемыми ответами. Особенно там, где важны скорость и контроль над данными.
Где можно применить прямо сейчас
- Предпринимателю: быстрые черновики писем, регламентов, FAQ и скриптов продаж без облачных сервисов.
- Маркетологу: генерация контент-планов, гипотез и рекламных углов с длинным контекстом до 128K+ токенов.
- Разработчику: агентные сценарии, tool-use (работа с инструментами), код и веб-задачи с гибкой «thinking» логикой.
У модели есть thinking (режим рассуждения) по умолчанию. Его можно выключить, если нужны короткие и быстрые ответы.
- Для точного кода советуют температуру 0.6.
- Для общих задач — 1.0.
- Контекст лучше держать не ниже 128K, иначе рассуждение деградирует.
- Для мультимодальности нужен файл mmproj (модуль для изображений/видео).
Ещё одна важная деталь: Qwen3.6 не понимает старые переключатели /think и /no_think. Режим меняется через параметры шаблона чата, например enable_thinking=false.
Исходник модели: страница на Hugging Face. Там же есть файлы, версии и инструкции по запуску.
Самое интересное здесь не «ещё одна модель». Рынок тихо привыкает к мысли, что ценность ИИ теперь в управляемом поведении, а не только в размере параметров.
Победят те, кто даст не самый громкий benchmark (тест производительности), а самый предсказуемый результат в рабочем дне из 100 мелких задач.
