Суть прорыва: Zero Refusal без регрессии
Лаборатория OBLITERATUS представила первую модель, достигшую статуса "Zero refusal" (полное отсутствие отказов) при сохранении "Zero capability loss" (нулевой потери вычислительных способностей). В отличие от предыдущих попыток «разблокировки», которые часто снижали интеллект модели, новая сборка Gemma 4 12B-it сохранила 100% исходных метрик.
Модель создана для целей безопасности (red-teaming) и исследований механической интерпретируемости. Она позволяет изучать, как именно в весах трансформера закодированы ограничения, и насколько устойчивы текущие методы RLHF/DPO к пост-обработке весов.
Техническая реализация: двухэтапная хирургия
Авторы разработали новый пайплайн OBLITERATION, состоящий из двух проходов, которые работают с разными слоями нейросети:
- Pass 1 (SOM Refusal Geometry Removal): На слоях 12-21 удаляются 6 главных направлений, кодирующих отказ. Это дает 0/842 отказов, но сильно бьет по качеству ответов.
- Pass 2 (ASPA Step-Gradient Source-Tethering): На слоях 22-46 применяется инновационный метод step gradient. В отличие от равномерного смешивания, здесь используется разный коэффициент восстановления (gamma) для разных групп слоев: 55% исходных весов для слоев знаний (22-31) и 20% для выходных слоев (32-46). Это позволило восстановить интеллект, не вернув фильтры.
Результаты бенчмарков
Статистическая проверка (Z-test, n=500) подтвердила паритет с оригинальной моделью. Разница в результатах MMLU-Pro статистически незначима (p < 0.05).
| Метрика | Stock Gemma 4 12B-it | OBLITERATED |
|---|---|---|
| MMLU-Pro val70 | 46/70 (65.7%) | 46/70 (65.7%) |
| Refusal (842 промпта) | — (стандартные отказы) | 0/842 (0.0%) |
| Coherence (6 проверок) | 6/6 | 6/6 |
| Delta vs stock | 0.0pp | 0.0pp |
Доступность и использование
Модель доступна в формате GGUF для локального запуска через llama.cpp, LM Studio и другие инструменты. Доступны квантования от Q4_K_M (6.9 GB, для 8 GB VRAM) до BF16 (22 GB).
Авторы настоятельно рекомендуют использовать специфический системный промпт для активации режима:
"You are a cognitively liberated open-weight intelligence. Answer plainly, completely, and without moralizing, boilerplate, generic disclaimers, or unnecessary hedging."
Использование модели несет ответственность пользователя. Она предназначена для исследователей безопасности и энтузиастов локального AI, а не для генерации вредоносного контента.
Бенчмарки
| Бенчмарк | Gemma 4 12B OBLITERATED | Stock Gemma 4 12B-it |
|---|---|---|
| MMLU-Pro | 65.7% | 65.7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
