Связь модели и данных: что такое ENTD
В новой работе, представленной на arXiv, автор Zachary Izzo исследует фундаментальную связь между поведением больших языковых моделей (LLM) и данными, на которых они обучались. Ключевым понятием исследования является эмпирическое распределение следующего токена (Empirical Next-Token Distribution, ENTD). Это распределение представляет собой «золотой стандарт» — глобальный минимум функции потерь перекрестной энтропии (cross-entropy loss), используемой при предобучении. ENTD легко интерпретируется, так как напрямую выводится из корпуса данных, и служит эталоном для оценки того, насколько точно модель усвоила статистические закономерности обучающей выборки.
Ключевые результаты: согласие и отклонения
Анализ показал, что для значительной доли входных данных распределение токенов LLM совпадает с ENTD практически идеально. Более того, степень этого согласия положительно коррелирует с масштабом модели и объемом вычислительных ресурсов, затраченных на обучение. Однако исследование выявило и важную деталь: существует длинный хвост входных последовательностей, где модель существенно отклоняется от эмпирического распределения данных. Авторы анализируют несколько возможных причин этих расхождений, включая архитектуру трансформера, особенности процедуры обучения и шум конечной выборки при оценке самого ENTD.
Новый подход к интерпретируемости
Результаты работы открывают путь для развития направления, которое автор называет "data-centric mechanistic interpretability" (механистическая интерпретируемость, ориентированная на данные). В отличие от стандартных подходов, которые изучают, как поведение закодировано в весах нейросети, этот подход пытается раскрыть «черный ящик» того, как именно поведение модели возникает из самих данных. Это позволяет лучше понимать природу галлюцинаций, предвзятости и других артефактов, связывая их не с внутренними состояниями весов, а с недостатками или особенностями обучающего корпуса.
| Параметр | Описание и значение |
|---|---|
| ENTD | Эмпирическое распределение следующего токена. Глобальный минимум функции потерь, вычисляемый непосредственно по обучающим данным. |
| Степень согласия | Для большинства входов LLM воспроизводит ENTD почти идеально. Согласие растет с увеличением масштаба модели и compute. |
| Длинный хвост | Существует значительное количество входных последовательностей, где поведение модели существенно отличается от ENTD. |
| Причины расхождений | Архитектурные ограничения трансформера, специфика обучения (training procedure) и шум оценки ENTD. |
| Направление исследований | Data-centric mechanistic interpretability: анализ происхождения поведения модели через призму данных, а не весов. |
Почему это важно
Понимание того, где и почему модель отклоняется от «чистой» статистики данных, критически важно для повышения надежности ИИ. Если мы можем идентифицировать случаи, когда модель не просто следует данным, а вносит собственные искажения (или, наоборот, не может их воспроизвести из-за шума), мы получаем инструменты для более точного контроля качества генерации и безопасности моделей. Это исследование закладывает теоретическую базу для нового типа аудита ИИ, основанного на анализе обучающих корпусов.
Источник: arXiv cs.AI ↗
