Исследования16 июля 2026 г., 23:16 МСК🤖 Auto

Конкурентная безопасность ИИ: как метрики заменяют размытые цели

Автор статьи предлагает заменить разрозненные исследования на «конкурентную безопасность ИИ» с четкой функцией потерь, демонстрируя успех на примере модели seq2feature.

Баннер новости 3756

Проблема разрозненных усилий

Развитие безопасности ИИ (AI Safety) сейчас страдает от диффузности: много исследователей, много моделей и техник, но работа не суммируется. Автор, Патрик О’Доннелл (Patrick0d), отмечает, что в прошлом разрозненные усилия в индустрии уступали сфокусированным, компounding-эффективным подходам на порядки. Текущая модель «работай над тем, что имеет наибольшее значение» приводит к задержанным сигналам обратной связи и незрелым решениям, которые не выдерживают сравнения.

Решение: Competitive AI Safety

Предлагается внедрить парадигму, аналогичную соревнованиям по обучению моделей, где существует единая измеримая метрика (loss function). Примеры из индустрии:

  • OpenAI Parameter Golf: Обучение LLM размером 16 МБ с лучшим показателем FineWeb bits per byte за 10 минут.
  • nanoGPT Speedrun: Достижение потерь 3.28 на FineWeb как можно быстрее.

Такой подход позволяет решениям компилироваться и итеративно улучшаться. Исследователи соревнуются не в абстрактных идеях, а в конкретных технических улучшениях, что ускоряет прогресс.

Кейс: Модель seq2feature

В рамках 30-часового спринта BlueDot Technical AI Safety Project Sprint автор разработал инструмент seq2feature. Это зонд (probe) размером 5.3 МБ, дистиллированный из SAE (Sparse Autoencoder) модели Gemma-9B (слой 20). Его задача — предсказывать латентные признаки по тексту без доступа к активациям модели.

Метрика / Характеристика Значение / Результат
Размер модели 5.3 МБ
Основа дистилляции Gemma-9B, слой 20 SAE
Точность топ-5 предсказаний 95% (срабатывание латента)
Точность различения срабатывания 90% на тысячах примеров
Платформа выполнения CPU (работает локально)

Практическое применение и архитектура

Поскольку LLM не обладают телесностью, они должны генерировать токены для выполнения кода или вызова инструментов. seq2feature выступает как дешевый текстовый монитор, аудитающий proposed actions (предлагаемые действия) до их исполнения. Архитектура безопасности включает три роли:

  1. Локальные кодовые агенты: Вызываются, если зонд обнаруживает вредоносный латент в трейсе агента.
  2. Исследователь безопасности: Взаимодействует с системой через общий UI.
  3. Совместный UI: Позволяет tighten feedback loops (сокращать циклы обратной связи) между исследователем и автоматизированными системами.

Код проекта, включая UI и framework для лидерборда, доступен в репозитории автора. Этот подход демонстрирует, как узкие, измеримые задачи могут стать фундаментом для масштабируемой безопасности ИИ.

Источник: LessWrong ↗