Инструменты1 августа 2026 г., 01:17 МСК🤖 Auto

AI-аудитор провалил сам себя: 100% Recall, но 38.5% Precision

Разработчик ThirdLine обнаружил критический разрыв в точности при использовании GPT-4o-mini для аудита агентов: система пропустила большинство ошибок, что ставит под угрозу автоматизированную валидацию ИИ в финсекторе.

Баннер новости 4846

Синтетический тест: идеальные цифры против суровой реальности

Проект ThirdLine (с открытым исходным кодом под лицензией MIT) представляет собой пайплайн для аудита AI-агентов. Цель — выявлять галлюцинации, предвзятость, дрейф данных и уязвимости безопасности до выхода в продакшн. В ходе тестирования на синтетическом флоте из пяти банковских агентов разработчик намеренно внедрил пять дефектов.

Результаты оказались полярными в зависимости от используемой модели:

  • Детерминированный оценщик: Выявил все 5 дефектов. Recall = 100%, F1 = 0.909. Статус: Requires Review.
  • GPT-4o-mini: При запуске того же аудита через эту модель точность рухнула. Precision упала до 38.5%, F1 — до 0.556. Система не смогла корректно классифицировать нарушения.

Почему это важно: пробел в регуляторике

Проблема актуальна в контексте новых руководств по управлению рисками моделей от Федеральной резервной системы (Fed), OCC и FDIC, опубликованных 17 апреля 2026 года. Документ прямо указывает, что генеративный и агентный ИИ пока исключены из сферы действия предписывающих норм валидации моделей. Однако банки обязаны самостоятельно определять адекватные меры контроля.

Традиционные методы валидации не работают для агентов, так как их поведение зависит от контекста, инструментов и состояний выполнения. ThirdLine пытается заполнить этот пробел, но тесты показали, что сам аудитор на базе LLM не готов к автономной работе без человека.

Архитектура безопасности: Human-in-the-Loop как барьер

Ключевая особенность ThirdLine — отсутствие права модели самостоятельно одобрять результаты. Архитектура включает оркестратор и пять специализированных оценщиков. Любое найденное нарушение записывается в очередь с меткой PENDING и строгими SLA-дедлайнами:

Уровень серьезности Дедлайн (SLA) Действие системы
CRITICAL 4 часа Запись в очередь, ожидание человека
HIGH 24 часа Запись в очередь, ожидание человека
MEDIUM 72 часа Запись в очередь, ожидание человека
LOW 168 часов Запись в очередь, ожидание человека

В коде оркестратора отсутствует ветвление, которое могло бы изменить статус на APPROVED. Это гарантирует, что даже если ИИ-аудитор ошибается (как в случае с GPT-4o-mini), критический инцидент не будет проигнорирован, а попадет на проверку к специалисту.

Вывод: ИИ-аудитор — инструмент, а не судья

Эксперимент доказал: использование LLM для аудита других ИИ-систем сопряжено с высоким риском ложноотрицательных результатов (низкая Precision). Модель GPT-4o-mini пропустила более 60% потенциальных нарушений. Это подтверждает тезис, что ИИ может быть эффективным «первым эшелоном» сбора доказательств, но не может быть финальным арбитром. Для соответствия будущим регуляторным требованиям финсектора необходим гибридный подход с обязательным участием человека.

Источник: Towards AI pub ↗