Разделение логики и знаний
Исследователи Samir Abdaljalil, Erchin Serpedin и Hasan Kurban представили IsoSci — специализированный бенчмарк для оценки больших языковых моделей. Главная особенность набора данных: он состоит из пар изоморфных задач из разных научных дисциплин. Задачи имеют идентичную логическую структуру, но требуют разного предметного знания. Это позволяет изолированно измерить, насколько модель полагается на способность к рассуждению (reasoning), а насколько — на извлечение фактов (knowledge retrieval).
Главный вывод: 91,3% — это память, а не интеллект
Анализ пяти пар моделей из четырех семейств выявил критический факт: 91,3% прироста точности при включении режима рассуждений (reasoning-mode) обусловлено именно знанием предметной области, а не улучшением структурного вывода. Статистически значимая разница подтверждена доверительным интервалом Уилсона 95% [82,3%, 96,0%]. Это ставит под сомнение общепринятую гипотезу о том, что цепочка мыслей (Chain-of-Thought) кардинально улучшает решение краткосрочных научных задач.
Парадокс специализированных моделей
Исследование показало, что переключение тумблера «рассуждение» на высококлассных моделях дает прирост точности менее чем на 5 процентных пунктов во всех доменах. Более того, модель, заточенная под рассуждения (o3-mini), демонстрирует разрыв в эффективности в зависимости от типа задачи:
| Модель | Результат на GPQA Diamond | Результат на IsoSci | Вывод |
|---|---|---|---|
| o3-mini (Reasoning) | +19,2 п.п. (лучше базовой) | -24,7 п.п. (хуже базовой) | Специализация на логике вредит в изоморфных задачах |
Этот разрыв показывает, что выбор бенчмарка напрямую диктует выводы об эффективности рассуждений: то, что работает для сложных открытых вопросов, может проваливаться на задачах с изоморфной структурой.
Почему это важно для индустрии
Результаты IsoSci заставляют пересмотреть метрики оценки LLM. Если 91,3% успеха в «рассуждениях» — это просто подтягивание знаний, то инвестиции в архитектуру, имитирующую когнитивный процесс (CoT), могут быть неэффективны для узких научных задач. Исследователи подчеркивают, что текущие benchmarks часто переоценивают способность моделей к абстрактному выводу, игнорируя доминирование фактологической базы.
Источник: arXiv cs.CL ↗
