Проблема доверия к ИИ в сетевой безопасности
Команда исследователей из Университета Пердью и Университета Карнеги-Меллона представила работу RFCLLM, принятую в EMNLP 2026 (Findings). Авторы ставят под сомнение слепое доверие к Large Language Models в задачах формальной верификации. Ключевая проблема: LLM часто генерируют некорректные конечные автоматы (FSM) на основе текстовых спецификаций, что может привести к уязвимостям в сетевом оборудовании и ПО.
Методология: 16 протоколов и 1482 запроса
Для оценки способности моделей к логическому выводу (reasoning) в контексте сетевых протоколов был создан специализированный бенчмарк. Исследователи сравнили неявные представления FSM, сгенерированные LLM, с вручную созданными эталонными моделями (ground-truth). В тестировании участвовали 16 различных сетевых протоколов, а общее количество запросов составило 1482.
Ключевые метрики и факторы влияния
Авторы выделили четыре типа задач и проанализировали влияние различных типов контекста и характеристик протоколов. Результаты показали существенный разрыв в сложности задач и высокую чувствительность моделей к формату входных данных. Ниже приведена структура оцениваемых параметров:
| Параметр оценки | Значение / Описание |
|---|---|
| Количество протоколов | 16 (различные сетевые стандарты) |
| Объем выборки | 1482 task queries |
| Тип задачи | 4 категории (mapping, validation, etc.) |
| Объект сравнения | LLM-generated FSM vs Manual Ground-Truth |
| Влияющие факторы | 4 типа контекста, bias судей, сложность протокола |
Почему это важно для индустрии
Автоматизированный перевод спецификаций в код или формальные модели часто используется для тестирования безопасности (fuzzing) и верификации. Если LLM не может точно интерпретировать состояние протокола, сгенерированные тесты будут пропускать критические ошибки. RFCLLM демонстрирует, что текущие модели не готовы к автономному использованию в критически важных сетевых инфраструктурах без строгой человеческой проверки.
Источник: arXiv cs.CL ↗
