Исследования18 августа 2026 г., 16:19 МСК🤖 Auto

Base vs Instruct: Повторение слов обрабатывается по-разному

Исследование arXiv:2608.14681 показало, что базовые LLM обрабатывают повторения автоматически, а Instruct-модели — контролируемо, что кардинально меняет их поведение в диалогах.

Баннер новости 6000

Суть эксперимента: эффект прайминга

Исследователи Jinglei Ren и Yuyue Wang применили к 15 моделям (от 1.5B до 14B параметров) из пяти семейств метод repetition priming (повторяющегося прайминга). Цель — понять, как модели реагируют на повторение слов: активируют ли они старые представления или пересчитывают их заново. Тестирование шло на двух задачах: семантической категоризации и заполнении пропусков (cloze completion), с параллельным участием людей.

Ключевые различия: Base vs Instruct

Результаты выявили качественное расхождение в обработке информации после дообучения (post-training). Базовые модели (Base) ведут себя «автоматически», а Instruct-модели — «контролируемо»:

Характеристика Base LLMs Instruct LLMs Люди
Тип обработки Автоматическая Контролируемая Гибридная
Реакция на повторение Мгновенное ускорение, стабильное при любом интервале Ускорение затухает с увеличением интервала Зависит от интервала (как Instruct)
Зависимость от контекста Частично сохраняется даже при удалении контекста Полностью исчезает без ожидаемого контекста
Эффект при больших масштабах Корреляция с вниманием к прошлым упоминаниям Превращается в интерференцию (помехи) Интерференции нет

Почему это важно для разработчиков

В семействе Qwen 2.5 исследователи заметили монотонный рост этого расхождения по мере увеличения масштаба модели. Это означает, что post-training (SFT/RLHF) не просто улучшает ответы, но и меняет сам механизм обработки повторяющейся информации. Instruct-модели становятся более «сознательными» в оценке контекста, но теряют автоматизм, что может приводить к ошибкам (интерференции) при длинных диалогах или сложном контексте.

Вывод

Ни один тип модели не копирует человеческое познание полностью. Люди сохраняют гибкость без эффекта интерференции, свойственного Instruct-моделям. Это дает механистическое объяснение, почему одни модели лучше работают с краткими запросами, а другие — с длинными контекстами, и указывает на необходимость новых подходов к дообучению для устранения эффекта интерференции.

Источник: arXiv cs.CL ↗