Исследования12 августа 2026 г., 05:17 МСК🤖 Auto

WuYuEval: LLM провалили тесты по управлению отходами

Новый бенчмарк WuYuEval показал, что даже топовые LLM теряют точность с 84% до 42% на сложных инженерных задачах по утилизации отходов.

Баннер новости 5575

Проблема общих моделей в узкой сфере

Большие языковые модели (LLM) часто используются как технические ассистенты, но их компетенция в сфере управления твердыми бытовыми отходами (SWM) остается под вопросом. Существующие бенчмарки фокусируются на общих знаниях, игнорируя инженерные, экологические и политические ограничения. Исследователи из Китая представили WuYuEval — многоуровневый тест, оценивающий модели по трем критериям: базовые знания, доменная логика и экспертные решения.

Структура и масштаб теста

После аудита качества датасет включает два модуля. Первый, Foundation Module, содержит 4 590 закрытых вопросов с множественным выбором, охватывающих 8 категорий. Второй, Expert Module, состоит из 247 открытых сценарных задач, требующих многоцелевой оптимизации и учета компромиссов. Для оценки экспертных ответов использовалась комбинация LLM-as-a-Judge с якорной калибровкой и Elo-сравнений.

Результаты: разрыв между легкими и сложными задачами

Тестирование 33 моделей выявило огромный разброс результатов. Лидер достиг точности 94.64% на базовом модуле, однако средняя точность по всем моделям резко падает по мере усложнения задач. Особенно плохо модели справляются с расчетами, проектированием экспериментов и городским планированием.

Параметр Значение / Характеристика
Количество моделей 33
Базовые вопросы (Foundation) 4 590 (8 категорий)
Экспертные задачи (Expert) 247 (открытые сценарии)
Точность лидера (базовый) 94.64%
Средняя точность (легкие вопросы) 84.14%
Средняя точность (сложные вопросы) 42.50%

Почему это важно

Исследование показывает, что режимы рассуждения (Thinking modes) помогают только тогда, когда они привязаны к единицам измерения, допущениям и инженерным ограничениям. Без этого «размышления» модели могут отклоняться от границ правильного ответа. WuYuEval служит эмпирической базой для создания специализированных фундаментальных моделей, способных работать с профессиональными цепочками рассуждений в экологической сфере.

Источник: arXiv cs.CL ↗