Проблема хрупкости обобщения
Люди легко решают задачу 2+5 и её текстовый вариант "two plus five". Однако современные LLM демонстрируют высокую хрупкость: они почти идеально справляются с числовыми выражениями, но их точность резко падает на вербальных формулировках. Авторы исследования задались вопросом: можно ли предсказать эту способность, заглянув во внутренние механизмы модели, не прибегая к дообучению?
Методология: Attribution Patching
Команда использовала метод attribution patching для локализации «схем» (circuits) — подсетей нейронов, ответственных за решение задач. Исследование охватило три языка: английский, испанский и итальянский. Ученые независимо выделили схемы, используемые моделью для числовых и текстовых арифметических задач, и измерили степень их перекрытия.
Ключевые результаты
Главный вывод: степень перекрытия внутренней числовой схемы модели с её текстовой схемой является мощным предиктором успеха. Чем выше overlap, тем лучше модель обобщает знания на новые форматы. Этот метрик-подход сравним по точности с supervised probes, но не требует размеченных данных для обучения.
| Аспект исследования | Детали и результаты |
|---|---|
| Метод анализа | Attribution patching для локализации нейронных цепей |
| Языки | English, Spanish, Italian |
| Тип задач | Арифметика (числовая vs. вербальная) |
| Ключевой индикатор | Overlap (перекрытие) числовой и текстовой схем |
| Точность предсказания | Сопоставима с supervised probes, без labeled data |
Почему это важно
Результат открывает путь к интерпретируемости LLM. Вместо черного ящика исследователи могут теперь «заглянуть внутрь» модели, чтобы оценить её когнитивные способности к обобщению. Это критически важно для безопасности ИИ: понимание того, почему модель «не понимает» текст, позволяет точечно исправлять архитектуру, а не просто собирать больше данных.
Источник: arXiv cs.CL ↗
