Исследования9 июля 2026 г., 03:17 МСК🤖 Auto

GRAM: Модульный предобучение для контроля доступа к знаниям ИИ

Anthropic и AE Studio представили GRAM — метод, позволяющий изолировать опасные знания в нейросетях и включать/выключать их по требованию, не переобучая модель.

Баннер новости 3162

Проблема монолитных моделей

Современные передовые ИИ-модели содержат знания, которые могут быть использованы во вредоносных целях (создание биологического оружия, кибератаки). Традиционные методы защиты — фильтры запросов и поведенческие отказы — имеют недостатки: их можно обойти (jailbreak), и они не удаляют знание из модели, а лишь скрывают его. Ограничение доступа на уровне аккаунтов слишком грубо: пользователь либо получает все возможности, либо ничего.

Решение: Gradient Routed Auxiliary Modules (GRAM)

Исследователи из AE Studio и Anthropic разработали метод GRAM. Он добавляет в каждый блок Transformer-архитектуры небольшие вспомогательные модули (дополнительные нейроны). Во время обучения модель учится привязывать специфические знания (например, из области вирусологии) к конкретным модулям. При инференсе эти модули можно «отключить», физически удаляя способность модели генерировать опасный контент, сохраняя при этом общую полезность.

Ключевые результаты и метрики

Эксперименты проводились на моделях от 50M до 5B параметров. Использовалась метрика Compute Ratio (соотношение вычислительных затрат к базовой модели). Ниже приведены сравнительные данные эффективности изоляции знаний:

Метод Масштаб модели Эффективность изоляции (Compute Ratio) Примечание
GRAM 26M (синтетические данные) Высокая Изоляция тем в детских историях сопоставима с обучением с нуля без этих тем
GRAM 800M (реальные данные) Высокая Одна модель заменяет 5 различных моделей с разными фильтрами данных (вирусология, кибербезопасность и др.)
LoRA 800M Средняя Уступает GRAM в сложных сценариях с разреженными данными
Data Filtering 50M - 5B База Требует отдельного обучения для каждого набора данных, что дорого

Почему это важно

GRAM позволяет создавать единые модели, которые могут адаптироваться под уровень доверия пользователя. Например, лаборатория биобезопасности может получить доступ к модулю с знаниями о вирусах, а обычный пользователь — нет, при этом общая языковая способность модели остается неизменной. Это решает проблему «грубого» ограничения доступа и снижает затраты на обучение множества специализированных версий моделей. Исследование является предварительным и пока не внедрено в продакшн-модели Anthropic.

Источник: LessWrong ↗