Исследования8 сентября 2026 г., 01:20 МСК🤖 Auto

Внутренние схемы LLM предсказывают их способность к обобщению

Исследователи из MIT и других вузов показали, что способность моделей понимать текстовые задачи на арифметику зависит от перекрытия нейронных цепей с числовыми аналогами.

Баннер новости 6975

Проблема хрупкости обобщения

Люди легко решают задачу 2+5 и её текстовый вариант "two plus five". Однако современные LLM демонстрируют высокую хрупкость: они почти идеально справляются с числовыми выражениями, но их точность резко падает на вербальных формулировках. Авторы исследования задались вопросом: можно ли предсказать эту способность, заглянув во внутренние механизмы модели, не прибегая к дообучению?

Методология: Attribution Patching

Команда использовала метод attribution patching для локализации «схем» (circuits) — подсетей нейронов, ответственных за решение задач. Исследование охватило три языка: английский, испанский и итальянский. Ученые независимо выделили схемы, используемые моделью для числовых и текстовых арифметических задач, и измерили степень их перекрытия.

Ключевые результаты

Главный вывод: степень перекрытия внутренней числовой схемы модели с её текстовой схемой является мощным предиктором успеха. Чем выше overlap, тем лучше модель обобщает знания на новые форматы. Этот метрик-подход сравним по точности с supervised probes, но не требует размеченных данных для обучения.

Аспект исследования Детали и результаты
Метод анализа Attribution patching для локализации нейронных цепей
Языки English, Spanish, Italian
Тип задач Арифметика (числовая vs. вербальная)
Ключевой индикатор Overlap (перекрытие) числовой и текстовой схем
Точность предсказания Сопоставима с supervised probes, без labeled data

Почему это важно

Результат открывает путь к интерпретируемости LLM. Вместо черного ящика исследователи могут теперь «заглянуть внутрь» модели, чтобы оценить её когнитивные способности к обобщению. Это критически важно для безопасности ИИ: понимание того, почему модель «не понимает» текст, позволяет точечно исправлять архитектуру, а не просто собирать больше данных.

Источник: arXiv cs.CL ↗