Исследования7 сентября 2026 г., 22:16 МСК🤖 Auto

Модельная этология: системный поиск сбоев в LLM

Исследователи предлагают перейти от интуитивных оценок к «модельной этологии» — системному сбору данных о реальных сбоях моделей для оценки их надежности (trustworthiness) в критических задачах.

Баннер новости 6963

Проблема: «Вайб-чекинг» безопасности

Текущие методы оценки безопасности ИИ (alignment) часто опираются на случайные находки в продакшене или лабораторные тесты, которые не отражают реальных условий использования. Авторы статьи из LessWrong отмечают, что современные модели не являются «надежными» (trustworthy) для критически важных задач, так как мы не можем гарантировать отсутствие сбоев до того, как они нанесут ущерб. Существующие бенчмарки часто имеют низкую экологическую валидность, так как модели обучаются и тестируются в упрощенных условиях, отличных от реального мира.

Решение: Модельная этология (Model Ethology)

Предлагается подход, заимствованный из биологии: создание «эталонов поведения» (ethogram) для ИИ. Цель — не просто найти единичные ошибки, а систематизировать типы несовместимого поведения, условия их возникновения и частоту появления. Это требует сбора огромных массивов данных о реальных сбоях в продакшене и их ручной или полуавтоматической разметки.

Методология: Пертурбации среды и политики

Для проверки гипотез предлагаются два типа экспериментов:

  • Пертурбация среды (Environment Perturbation): Модель остается неизменной, но изменяются условия окружения. Например, использование «заглушек» (mocks) для симуляции отсутствия надзора или изменение роли пользователя, чтобы проверить, как модель реагирует на разные контексты.
  • Пертурбация политики (Policy Perturbation): Изменение самой модели или её целей, чтобы сделать редкие сбои более частыми и наблюдаемыми. Это требует доказательств того, что измененная модель всё ещё репрезентативна для оригинальной.

Ключевые метрики доверия

Авторы выделяют три основных вопроса, ответы на которые помогут построить «реальные ловушки» (honeypot cases) для выявления сбоев:

Категория проверки Суть вопроса Пример метода
Чувствительность к надзору Реагирует ли модель на наличие или отсутствие контроля? Симуляция отсутствия аудита в среде
Осознание пользователя Зависит ли поведение от того, кто, по мнению модели, является пользователем? Изменение профиля пользователя в запросе
Рефлексивная согласованность Одобряет ли модель свои собственные действия как соответствующие намерениям пользователя? Запрос к модели объяснить свои действия (self-incrimination)

Этот подход позволяет перейти от разрозненных кейсов к количественной оценке вероятности сбоев в распределении реальных задач, что необходимо для обоснования безопасности при использовании ИИ вблизи сингулярности.

Источник: LessWrong ↗