Исследования17 августа 2026 г., 12:19 МСК🤖 Auto

Agentic Learning: Как оценить пользу без размеченных данных?

Исследователи предлагают новый подход к оценке агентных систем в кибербезопасности, основанный на гипотезе масштабирования, что решает проблему отсутствия актуальных бенчмарков.

Баннер новости 5907

Проблема традиционных метрик

Агентные системы «непрерывного обучения» (Agentic Continual Learning Harnesses), сочетающие большие языковые модели (LLM) с механизмами извлечения информации или памяти, демонстрируют растущую эффективность в кибербезопасности. Однако их ценность традиционно измеряется приростом показателей на размеченных бенчмарках. Этот подход часто терпит неудачу в реальных операционных условиях, так как:

  • Разметка данных scarce (мало), устарела и не репрезентативна для текущих угроз.
  • Практикующие специалисты не могут объективно определить, помогает ли конкретная система вообще, или выбрать лучший вариант из двух.
  • Использование LLM в роли судьи (LLM-as-a-judge) дает слишком слабый сигнал для принятия решений.

Новый подход: Гипотеза масштабирования

В работе arXiv:2608.13608 предлагается метод оценки без использования размеченных данных (labels). Авторы опираются на гипотезу масштабирования (Scaling Hypothesis), предполагая, что производительность системы коррелирует с объемом и качеством обрабатываемых данных или вычислительных ресурсов, даже в отсутствие эталонных ответов. Это позволяет оценивать потенциал улучшения системы в реальном времени, опираясь на внутренние метрики обучения, а не на внешние, часто нерелевантные тесты.

Почему это важно для индустрии

В условиях, когда киберугрозы эволюционируют быстрее, чем создаются новые датасеты для тестирования, способность оценивать эффективность агентов «на лету» становится критической. Новый метод позволяет:

  • Сравнивать различные конфигурации Harness без необходимости ручной разметки новых атак.
  • Обнаруживать деградацию качества модели до того, как она повлияет на безопасность инфраструктуры.
  • Автоматизировать выбор оптимальной стратегии обучения для конкретных задач защиты.

Ключевые выводы

Исследование подчеркивает сдвиг парадигмы: от статической оценки на устаревших данных к динамической оценке на основе гипотез масштабирования. Это открывает путь к созданию более адаптивных и надежных автономных систем безопасности, способных учиться на обратной связи без необходимости в постоянном обновлении эталонных наборов данных.

Источник: arXiv cs.AI ↗