Исследования31 августа 2026 г., 12:18 МСК🤖 Auto

LLM не ленивы, они медленны: новый тест на «антилокальность»

Исследование arXiv (2026) опровергает миф о «локальной предвзятости» трансформеров: модели успешно учат сложные паттерны, но тратят на это значительно больше эпох.

Баннер новости 6407

Суть эксперимента: что такое k-антилокальность

Команда исследователей (McInnerney, Storks, Abney, Lewis) создала синтетические языки с контролируемой структурой, чтобы изолировать способность моделей к обучению нелокальных зависимостей. Введение понятия k-антилокальных языков позволяет измерить, как далеко в последовательности символы могут передавать информацию. В таких языках отсутствует взаимная информация между любыми k смежными символами, что заставляет модель искать связи на больших дистанциях.

Ключевые метрики: скорость vs. точность

Главный вывод работы парадоксален для интуиции: трансформеры не проигрывают в финальной точности. Кросс-энтропийная потеря (loss) у моделей, обученных на языках с высокой антилокальностью, сопоставима с теми, что обучались на простых локальных паттернах. Проблема не в неспособности выучить правило, а в скорости сходимости.

Параметр Результат для LLM Интерпретация
Финальный Loss (Cross-Entropy) Сопоставимый Модель успешно находит паттерн, независимо от сложности дистанции.
Скорость сходимости Замедляется Чем выше k (сложность), тем больше эпох требуется для обучения.
Природа «предвзятости» Вычислительная «Локальная предвзятость» — это артефакт оптимизации, а не архитектуры.

Почему это важно для индустрии

Ранее считалось, что архитектура трансформера (механизм внимания) имеет врожденный bias в сторону локальных контекстов. Данное исследование показывает, что это bias обучения, а не bias модели. Если мы дадим модели достаточно вычислительных ресурсов и времени (эпох), она справится с нелокальными задачами так же хорошо, как с локальными.

Это меняет подход к тонкой настройке (fine-tuning) больших языковых моделей для сложных логических или математических задач, где зависимости часто разнесены по всему документу. Ограничением является не «слепота» модели к дальним контекстам, а цена их обнаружения.

Источник: arXiv cs.CL ↗