Проблема общих моделей в узкой сфере
Большие языковые модели (LLM) часто используются как технические ассистенты, но их компетенция в сфере управления твердыми бытовыми отходами (SWM) остается под вопросом. Существующие бенчмарки фокусируются на общих знаниях, игнорируя инженерные, экологические и политические ограничения. Исследователи из Китая представили WuYuEval — многоуровневый тест, оценивающий модели по трем критериям: базовые знания, доменная логика и экспертные решения.
Структура и масштаб теста
После аудита качества датасет включает два модуля. Первый, Foundation Module, содержит 4 590 закрытых вопросов с множественным выбором, охватывающих 8 категорий. Второй, Expert Module, состоит из 247 открытых сценарных задач, требующих многоцелевой оптимизации и учета компромиссов. Для оценки экспертных ответов использовалась комбинация LLM-as-a-Judge с якорной калибровкой и Elo-сравнений.
Результаты: разрыв между легкими и сложными задачами
Тестирование 33 моделей выявило огромный разброс результатов. Лидер достиг точности 94.64% на базовом модуле, однако средняя точность по всем моделям резко падает по мере усложнения задач. Особенно плохо модели справляются с расчетами, проектированием экспериментов и городским планированием.
| Параметр | Значение / Характеристика |
|---|---|
| Количество моделей | 33 |
| Базовые вопросы (Foundation) | 4 590 (8 категорий) |
| Экспертные задачи (Expert) | 247 (открытые сценарии) |
| Точность лидера (базовый) | 94.64% |
| Средняя точность (легкие вопросы) | 84.14% |
| Средняя точность (сложные вопросы) | 42.50% |
Почему это важно
Исследование показывает, что режимы рассуждения (Thinking modes) помогают только тогда, когда они привязаны к единицам измерения, допущениям и инженерным ограничениям. Без этого «размышления» модели могут отклоняться от границ правильного ответа. WuYuEval служит эмпирической базой для создания специализированных фундаментальных моделей, способных работать с профессиональными цепочками рассуждений в экологической сфере.
Источник: arXiv cs.CL ↗
