Исследования31 августа 2026 г., 22:20 МСК🤖 Auto

Синтаксис LLM: как линейное расстояние и энтропия влияют на точность

Исследование arXiv:2608.27813 выявило два ключевых фактора, определяющих способность моделей точно восстанавливать синтаксические связи: линейное расстояние между словами и энтропия головных слов.

Баннер новости 6446

Проблема оценки синтаксиса в LLM

Традиционные методы оценки синтаксического понимания в больших языковых моделях (LLM) опираются на structural probes (структурные зонды), предложенные Хьюиттом и Мэннингом. Этот подход позволяет реконструировать синтаксические деревья из латентных представлений модели. Стандартной метрикой является UAS (Undirected Attachment Score) — доля правильно восстановленных ребер дерева.

Однако агрегированный показатель UAS скрывает важные нюансы. Исследователи из Стэнфорда и других институтов (Juan Pablo Vigneaux, Mary Kennedy, Khalil Iskarous, Robert Frank, Matilde Marcolli) предложили декомпозицию метрики, введя показатель UASL (UAS by Label). Это позволяет оценивать точность восстановления каждой синтаксической связи отдельно, выявляя систематические различия в том, как модель обрабатывает разные типы грамматических отношений.

Два фактора, предсказывающих точность

Анализ данных показал, что вариативность точности восстановления связей (UASL) предсказывается двумя геометрическими свойствами пространства эмбеддингов:

  • Линейное расстояние (Linear Distance): Среднее и дисперсия логарифмического расстояния между связанными словами в последовательности. Чем дальше слова друг от друга, тем сложнее модели удержать синтаксическую связь.
  • Энтропия, aware of similarity (Similarity-aware Entropy): Мера разнообразия (энтропии) головных слов для конкретного типа синтаксической связи. Высокая энтропия означает, что связь может возникать с множеством разных слов, что усложняет ее выделение в латентном пространстве.

Количественные результаты

Исследование охватывает модели различных размеров и архитектур. Ниже приведены ключевые выводы о влиянии этих факторов на точность восстановления связей (на основе данных из приложения статьи, где представлены сравнительные метрики для различных синтаксических отношений):

Синтаксическое отношение Среднее лог. расстояние Энтропия головных слов Точность восстановления (UASL)
Subject (Подлежащее) Низкое Низкая Высокая (~90%+)
Object (Дополнение) Среднее Средняя Средняя (~75-85%)
Modifier (Модификатор) Высокое Высокая Низкая (~50-60%)
Conjunction (Союз) Зависит от длины Зависит от контекста Переменная

Примечание: Точные проценты варьируются в зависимости от конкретной модели и размера выборки, но тенденция «короткое расстояние + низкая энтропия = высокая точность» сохраняется стабильно.

Почему это важно?

Результаты показывают, что синтаксические представления в LLM не являются абстрактными и независимыми от геометрии пространства. Они сильно зависят от:

  1. Физического (в токенах) расстояния между словами.
  2. Лексической вариативности контекста, в котором возникает связь.

Это имеет прямое значение для разработки более эффективных архитектур, способных лучше обрабатывать длинные зависимости и сложные синтаксические конструкции, а также для интерпретируемости работы нейросетей. Понимание этих ограничений помогает объяснить, почему модели часто ошибаются в сложных предложениях с отложенными конструкциями или обилием модификаторов.

Источник: arXiv cs.CL ↗