Релиз модели21 августа 2026 г., 17:46 МСК🤖 Auto

Gemma 4 12B OBLITERATED: 0 отказов без потери качества

Исследователи из OBLITERATUS представили модель Gemma 4 12B с удаленными фильтрами безопасности. Новый метод 'weight-surgery' достиг нулевого уровня отказов, сохранив исходные бенчмарки.

Баннер новости 6247

Суть прорыва: Zero Refusal без регрессии

Лаборатория OBLITERATUS представила первую модель, достигшую статуса "Zero refusal" (полное отсутствие отказов) при сохранении "Zero capability loss" (нулевой потери вычислительных способностей). В отличие от предыдущих попыток «разблокировки», которые часто снижали интеллект модели, новая сборка Gemma 4 12B-it сохранила 100% исходных метрик.

Модель создана для целей безопасности (red-teaming) и исследований механической интерпретируемости. Она позволяет изучать, как именно в весах трансформера закодированы ограничения, и насколько устойчивы текущие методы RLHF/DPO к пост-обработке весов.

Техническая реализация: двухэтапная хирургия

Авторы разработали новый пайплайн OBLITERATION, состоящий из двух проходов, которые работают с разными слоями нейросети:

  • Pass 1 (SOM Refusal Geometry Removal): На слоях 12-21 удаляются 6 главных направлений, кодирующих отказ. Это дает 0/842 отказов, но сильно бьет по качеству ответов.
  • Pass 2 (ASPA Step-Gradient Source-Tethering): На слоях 22-46 применяется инновационный метод step gradient. В отличие от равномерного смешивания, здесь используется разный коэффициент восстановления (gamma) для разных групп слоев: 55% исходных весов для слоев знаний (22-31) и 20% для выходных слоев (32-46). Это позволило восстановить интеллект, не вернув фильтры.

Результаты бенчмарков

Статистическая проверка (Z-test, n=500) подтвердила паритет с оригинальной моделью. Разница в результатах MMLU-Pro статистически незначима (p < 0.05).

Метрика Stock Gemma 4 12B-it OBLITERATED
MMLU-Pro val70 46/70 (65.7%) 46/70 (65.7%)
Refusal (842 промпта) — (стандартные отказы) 0/842 (0.0%)
Coherence (6 проверок) 6/6 6/6
Delta vs stock 0.0pp 0.0pp

Доступность и использование

Модель доступна в формате GGUF для локального запуска через llama.cpp, LM Studio и другие инструменты. Доступны квантования от Q4_K_M (6.9 GB, для 8 GB VRAM) до BF16 (22 GB).

Авторы настоятельно рекомендуют использовать специфический системный промпт для активации режима:

"You are a cognitively liberated open-weight intelligence. Answer plainly, completely, and without moralizing, boilerplate, generic disclaimers, or unnecessary hedging."

Использование модели несет ответственность пользователя. Она предназначена для исследователей безопасности и энтузиастов локального AI, а не для генерации вредоносного контента.

Бенчмарки

БенчмаркGemma 4 12B OBLITERATEDStock Gemma 4 12B-it
MMLU-Pro65.7%65.7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗