Проблема монолитных моделей
Современные передовые ИИ-модели содержат знания, которые могут быть использованы во вредоносных целях (создание биологического оружия, кибератаки). Традиционные методы защиты — фильтры запросов и поведенческие отказы — имеют недостатки: их можно обойти (jailbreak), и они не удаляют знание из модели, а лишь скрывают его. Ограничение доступа на уровне аккаунтов слишком грубо: пользователь либо получает все возможности, либо ничего.
Решение: Gradient Routed Auxiliary Modules (GRAM)
Исследователи из AE Studio и Anthropic разработали метод GRAM. Он добавляет в каждый блок Transformer-архитектуры небольшие вспомогательные модули (дополнительные нейроны). Во время обучения модель учится привязывать специфические знания (например, из области вирусологии) к конкретным модулям. При инференсе эти модули можно «отключить», физически удаляя способность модели генерировать опасный контент, сохраняя при этом общую полезность.
Ключевые результаты и метрики
Эксперименты проводились на моделях от 50M до 5B параметров. Использовалась метрика Compute Ratio (соотношение вычислительных затрат к базовой модели). Ниже приведены сравнительные данные эффективности изоляции знаний:
| Метод | Масштаб модели | Эффективность изоляции (Compute Ratio) | Примечание |
|---|---|---|---|
| GRAM | 26M (синтетические данные) | Высокая | Изоляция тем в детских историях сопоставима с обучением с нуля без этих тем |
| GRAM | 800M (реальные данные) | Высокая | Одна модель заменяет 5 различных моделей с разными фильтрами данных (вирусология, кибербезопасность и др.) |
| LoRA | 800M | Средняя | Уступает GRAM в сложных сценариях с разреженными данными |
| Data Filtering | 50M - 5B | База | Требует отдельного обучения для каждого набора данных, что дорого |
Почему это важно
GRAM позволяет создавать единые модели, которые могут адаптироваться под уровень доверия пользователя. Например, лаборатория биобезопасности может получить доступ к модулю с знаниями о вирусах, а обычный пользователь — нет, при этом общая языковая способность модели остается неизменной. Это решает проблему «грубого» ограничения доступа и снижает затраты на обучение множества специализированных версий моделей. Исследование является предварительным и пока не внедрено в продакшн-модели Anthropic.
Источник: LessWrong ↗
