Исследования22 июля 2026 г., 06:18 МСК🤖 Auto

RAIL Guard: Замкнутый цикл исправления LLM-агентов

Исследователи представили RAIL Guard — систему, которая не просто блокирует ошибки LLM-агентов, но и исправляет их через цикл оценки и переписывания, повышая надежность с 49% до 96.9%.

Баннер новости 4100

Проблема бинарных классификаторов

Существующие системы безопасности (guardrails) для больших языковых моделей (LLM) часто работают как бинарные фильтры: они либо пропускают вывод, либо блокируют его. При блокировке организации вынуждены отбрасывать неудачный результат и запускать процесс заново, что ведет к потере времени и контекста. Авторы исследования Sumit Verma, Pritam Prasun и Pritish Kumar предлагают решение — RAIL Guard, конвейер ответственного ИИ с замкнутым циклом (closed-loop), который оценивает вывод LLM по восьми измеримым параметрам и итеративно исправляет ошибки.

Методология и масштаб тестирования

Команда провела три эксперимента, протестировав систему на четырех передовых LLM. Объем выборки включал 4 276 контентов и 6 400 сценариев вызова инструментов (tool-call) агентами. Ключевым отличием подхода стал цикл «оценка — переписывание — повторная оценка» (evaluate-rewrite-reevaluate), позволяющий модели самостоятельно корректировать свои ответы на основе полученных фидбеков.

Ключевые метрики эффективности

Сравнение замкнутого цикла с традиционным методом «блокировка и повтор» (block-and-retry) показало радикальное улучшение показателей сходимости (convergence) — способности системы достичь безопасного и корректного результата:

Метод Показатель сходимости Влияние на полезность (Utility)
RAIL Guard (Closed-loop) 96.9% Снижение на 22.3%
Feedback-driven self-repair 86.6% (на исправляемых измерениях) Нет значимой потери (p = 0.177)
Block-and-retry (База) 49.1% Информация недостаточна

Особое внимание стоит уделить методу feedback-driven self-repair (самоисправление на основе обратной связи). Он достиг сходимости 86.6% на измерениях, которые поддаются исправлению, при этом статистически значимой потери полезности ответа не произошло. Это делает его наиболее сбалансированным решением для продакшена.

Предиктивная безопасность и архитектурные ограничения

Система также демонстрирует высокую эффективность в предотвращении опасных действий агентов до их совершения. Предварительная оценка перед вызовом инструмента (pre-tool-call evaluation) снизила количество небезопасных выполнений агентов на 33% (p = 0.007) при нулевом влиянии на завершение задач.

Исследователи выявили важное разделение на «исправляемые» и «структурные» измерения. В то время как многие аспекты можно исправить алгоритмически, такие параметры, как Прозрачность (Transparency) (93.0% провалов), Подотчетность (Accountability) (92.8% провалов) и Инклюзивность (Inclusivity) (82.5% провалов), требуют архитектурных изменений в самой модели, а не просто постобработки.

Доступность

Система RAIL Guard доступна как open-source SDK, что позволяет разработчикам интегрировать замкнутый цикл безопасности в свои проекты с LLM-агентами. Код и бенчмарки опубликованы для воспроизводимости результатов.

Источник: arXiv cs.AI ↗