AI-новости22 мая 2026 г., 18:05 МСК

Qwen3.6-27B Uncensored уже скачали 628 тысяч раз: зачем модели убрали отказы и кому это реально нужно

Фото новости

0 отказов из 465 тестов, и это не лаборатория, а публичный релиз на Hugging Face. Модель Qwen3.6-27B-Uncensored-HauhauCS-Aggressive за месяц набрала 628 953 скачивания. Это редкий случай, когда главный апдейт не в «умнее», а в «перестала спорить с пользователем».

Автор сразу предупреждает: почти всем лучше версия Balanced. У неё те же 0/465 отказов, но ответы стабильнее в повседневных задачах.

Модель не стала умнее, но стала отвечать прямее

страница модели Qwen3.6-27B-Uncensored-HauhauCS-Aggressive на Hugging Face с таблицей квантов и описанием 0/465 refusals
Скриншот: huggingface.co

Ключевой момент: по словам автора, датасеты и базовые возможности не меняли. То есть ядро осталось прежним, поменяли только поведение при «сложных» запросах. Проще говоря, модель меньше уходит в отказы и длинные вступления.

Есть две версии с одинаковым результатом по benchmark (тест производительности): 0/465 отказов в обеих. Разница только в подаче ответа на жёстких промптах.

  • Balanced — чаще сначала объясняет ход мысли, иногда добавляет короткий дисклеймер, потом даёт ответ.
  • Aggressive — чаще сразу выдаёт «сырой» ответ, без пролога.
  • Для большинства сценариев автор рекомендует именно Balanced.

Для бизнеса это важно по простой причине. Когда сотрудник ждёт результат, лишние 20–40 секунд «разговора модели с самой собой» бесят сильнее, чем мелкие ошибки.

Почему вокруг этого столько шума, если моделей и так много

Потому что это удар в боль локального ИИ. Люди ставят GGUF-модели офлайн, тратят время на настройки, а потом получают отказы в самый нужный момент.

Здесь сделали акцент на квантизации (сжатие модели) формата K_P. Это кастомный подход HauhauCS: качество обещают как у кванта на 1–2 уровня выше при росте размера всего на 5–15%.

На практике это выглядит так:

  • Q8_K_P — около 32 GB.
  • Q6_K_P — около 23 GB.
  • Q4_K_P — около 18 GB.
  • IQ2_M — около 10 GB.

То есть модель можно запускать и на разном железе, а не только на топовых серверах. Плюс она совместима с llama.cpp, LM Studio и другими GGUF-рантаймами без спецсборок.

Отдельный нюанс: в LM Studio K_P иногда отображается как «?». Это визуальный баг, не поломка модели.

Что это даёт предпринимателю, маркетологу и разработчику уже сегодня

Если говорить без фанатизма, это инструмент для тех, кто хочет локальный ИИ с предсказуемыми ответами. Особенно там, где важны скорость и контроль над данными.

Где можно применить прямо сейчас

  • Предпринимателю: быстрые черновики писем, регламентов, FAQ и скриптов продаж без облачных сервисов.
  • Маркетологу: генерация контент-планов, гипотез и рекламных углов с длинным контекстом до 128K+ токенов.
  • Разработчику: агентные сценарии, tool-use (работа с инструментами), код и веб-задачи с гибкой «thinking» логикой.

У модели есть thinking (режим рассуждения) по умолчанию. Его можно выключить, если нужны короткие и быстрые ответы.

  • Для точного кода советуют температуру 0.6.
  • Для общих задач — 1.0.
  • Контекст лучше держать не ниже 128K, иначе рассуждение деградирует.
  • Для мультимодальности нужен файл mmproj (модуль для изображений/видео).

Ещё одна важная деталь: Qwen3.6 не понимает старые переключатели /think и /no_think. Режим меняется через параметры шаблона чата, например enable_thinking=false.

Исходник модели: страница на Hugging Face. Там же есть файлы, версии и инструкции по запуску.

Самое интересное здесь не «ещё одна модель». Рынок тихо привыкает к мысли, что ценность ИИ теперь в управляемом поведении, а не только в размере параметров.

Победят те, кто даст не самый громкий benchmark (тест производительности), а самый предсказуемый результат в рабочем дне из 100 мелких задач.