Исследования3 октября 2026 г., 17:18 МСК🤖 Auto

Как измерить креативность LLM-агентов: новые метрики и бенчмарки

Исследователи разработали методологию оценки способности LLM-агентов к открытиям, переводя креативность из разряда субъективных понятий в измеримые метрики.

Баннер новости 8858

От субъективности к метрикам

Вопрос о том, могут ли большие языковые модели (LLM) не просто генерировать текст, а совершать реальные открытия (discover), остается одним из самых сложных в области искусственного интеллекта. Традиционные оценки креативности часто опираются на человеческое восприятие, что делает их субъективными и трудно масштабируемыми. Новая методология, представленная в исследовании, предлагает системный подход к измерению «потенциала креативности» LLM-агентов через призму способности к открытиям.

Суть подхода: агент как исследователь

Ключевая идея заключается в том, что креативность LLM-агента должна оцениваться не по качеству отдельного ответа, а по его способности в процессе взаимодействия с окружением находить новые, неочевидные решения или паттерны. Агенты тестируются в средах, требующих не линейного выполнения инструкций, а поиска нестандартных путей достижения цели. Это позволяет измерить когнитивную гибкость и способность к абстрактному мышлению машины.

Ключевые метрики оценки

Для объективизации процесса исследователи выделяют несколько критериев, которые позволяют количественно оценить креативный потенциал агента. В отличие от стандартных метрик точности (accuracy), здесь важны такие параметры, как оригинальность найденного решения и его эффективность в условиях неопределенности.

МетрикаЧто измеряетЗначение для оценки
Novelty (Новизна)Насколько найденное решение отличается от стандартных шаблоновПоказывает способность к нестандартному мышлению
Effectiveness (Эффективность)Успешность достижения цели с помощью найденного решенияГарантирует, что креативность не ведет к хаосу
Path Efficiency (Эффективность пути)Количество шагов/итераций до открытияОценивает рациональность процесса поиска

Почему это важно для индустрии

Разработка надежных метрик для оценки креативности LLM-агентов открывает путь к созданию более автономных систем, способных к научным открытиям, оптимизации сложных процессов и генерации инновационных идей. Это смещает фокус с «генерации контента» на «генерацию знаний» и решений. Для разработчиков AI это означает необходимость внедрения новых стандартов тестирования, выходящих за рамки традиционных бенчмарков, таких как MMLU или GSM8K, которые проверяют скорее знание фактов, чем способность к открытиям.

Источник: Towards Data Science ↗