Исследования16 сентября 2026 г., 05:17 МСК🤖 Auto

RFCLLM: LLM не доверяют в анализе сетевых протоколов

Исследование RFCLLM показало, что LLM плохо справляются с переводом текстовых спецификаций протоколов в формальные автоматы, что критично для безопасности.

Баннер новости 7593

Проблема доверия к ИИ в сетевой безопасности

Команда исследователей из Университета Пердью и Университета Карнеги-Меллона представила работу RFCLLM, принятую в EMNLP 2026 (Findings). Авторы ставят под сомнение слепое доверие к Large Language Models в задачах формальной верификации. Ключевая проблема: LLM часто генерируют некорректные конечные автоматы (FSM) на основе текстовых спецификаций, что может привести к уязвимостям в сетевом оборудовании и ПО.

Методология: 16 протоколов и 1482 запроса

Для оценки способности моделей к логическому выводу (reasoning) в контексте сетевых протоколов был создан специализированный бенчмарк. Исследователи сравнили неявные представления FSM, сгенерированные LLM, с вручную созданными эталонными моделями (ground-truth). В тестировании участвовали 16 различных сетевых протоколов, а общее количество запросов составило 1482.

Ключевые метрики и факторы влияния

Авторы выделили четыре типа задач и проанализировали влияние различных типов контекста и характеристик протоколов. Результаты показали существенный разрыв в сложности задач и высокую чувствительность моделей к формату входных данных. Ниже приведена структура оцениваемых параметров:

Параметр оценки Значение / Описание
Количество протоколов 16 (различные сетевые стандарты)
Объем выборки 1482 task queries
Тип задачи 4 категории (mapping, validation, etc.)
Объект сравнения LLM-generated FSM vs Manual Ground-Truth
Влияющие факторы 4 типа контекста, bias судей, сложность протокола

Почему это важно для индустрии

Автоматизированный перевод спецификаций в код или формальные модели часто используется для тестирования безопасности (fuzzing) и верификации. Если LLM не может точно интерпретировать состояние протокола, сгенерированные тесты будут пропускать критические ошибки. RFCLLM демонстрирует, что текущие модели не готовы к автономному использованию в критически важных сетевых инфраструктурах без строгой человеческой проверки.

Источник: arXiv cs.CL ↗