Исследования3 июля 2026 г., 23:18 МСК🤖 Auto

IsoSci: Почему Chain-of-Thought не спасает LLM в науке

Новый бенчмарк IsoSci доказал: 91,3% прироста точности LLM в режиме рассуждений зависит от знаний, а не от логики. Режим CoT дает менее 5% улучшения.

Баннер новости 2881

Разделение логики и знаний

Исследователи Samir Abdaljalil, Erchin Serpedin и Hasan Kurban представили IsoSci — специализированный бенчмарк для оценки больших языковых моделей. Главная особенность набора данных: он состоит из пар изоморфных задач из разных научных дисциплин. Задачи имеют идентичную логическую структуру, но требуют разного предметного знания. Это позволяет изолированно измерить, насколько модель полагается на способность к рассуждению (reasoning), а насколько — на извлечение фактов (knowledge retrieval).

Главный вывод: 91,3% — это память, а не интеллект

Анализ пяти пар моделей из четырех семейств выявил критический факт: 91,3% прироста точности при включении режима рассуждений (reasoning-mode) обусловлено именно знанием предметной области, а не улучшением структурного вывода. Статистически значимая разница подтверждена доверительным интервалом Уилсона 95% [82,3%, 96,0%]. Это ставит под сомнение общепринятую гипотезу о том, что цепочка мыслей (Chain-of-Thought) кардинально улучшает решение краткосрочных научных задач.

Парадокс специализированных моделей

Исследование показало, что переключение тумблера «рассуждение» на высококлассных моделях дает прирост точности менее чем на 5 процентных пунктов во всех доменах. Более того, модель, заточенная под рассуждения (o3-mini), демонстрирует разрыв в эффективности в зависимости от типа задачи:

Модель Результат на GPQA Diamond Результат на IsoSci Вывод
o3-mini (Reasoning) +19,2 п.п. (лучше базовой) -24,7 п.п. (хуже базовой) Специализация на логике вредит в изоморфных задачах

Этот разрыв показывает, что выбор бенчмарка напрямую диктует выводы об эффективности рассуждений: то, что работает для сложных открытых вопросов, может проваливаться на задачах с изоморфной структурой.

Почему это важно для индустрии

Результаты IsoSci заставляют пересмотреть метрики оценки LLM. Если 91,3% успеха в «рассуждениях» — это просто подтягивание знаний, то инвестиции в архитектуру, имитирующую когнитивный процесс (CoT), могут быть неэффективны для узких научных задач. Исследователи подчеркивают, что текущие benchmarks часто переоценивают способность моделей к абстрактному выводу, игнорируя доминирование фактологической базы.

Источник: arXiv cs.CL ↗