Исследования14 сентября 2026 г., 11:18 МСК🤖 Auto

SynthSentry: Как выявить синтетический мусор в датасетах для LLM

Исследователи представили SynthSentry — инструмент для обнаружения синтетических данных в обучающих выборках до начала тренировки моделей, предотвращая коллапс распределения.

Баннер новости 7435

Проблема: невидимая угроза коллапса моделей

Обучение больших языковых моделей (LLM) на данных, сгенерированных другими моделями, приводит к так называемому модельному коллапсу. При этом тексты остаются беглыми и связными, но катастрофически теряют фактологическую точность и исчезают редкие, но важные паттерны из «хвостов» распределения. Традиционные методы диагностики выявляют проблему уже после тренировки, когда исправить ситуацию практически невозможно. Ключевая задача — отфильтровать «мусор» до начала обучения.

Решение: SynthSentry без доступа к генератору

Команда исследователей во главе с Правином Кумаром Мьякалой представила SynthSentry — метод сканирования корпусов на уровне всего датасета. Главное преимущество подхода в его универсальности: ему не нужен доступ к модели-генератору, история создания данных или метки «синтетический/человеческий». Алгоритм оценивает три ключевые статистики:

  • Снижение лексического разнообразия: синтетические тексты часто используют более ограниченный словарный запас.
  • Усечение хвостов n-грамм: исчезновение редких сочетаний слов, характерных для естественного языка.
  • Дисперсия перплексии: анализ вариативности предсказуемости текста через несколько эталонных моделей.

Результаты тестирования и точность

Метод был протестирован на корпусах, загрязненных небольшими открытыми моделями и инструкционно-обученными генераторами. Особое внимание уделили ложным срабатываниям на естественно повторяющемся тексте (юридические документы, клинические записи, исходный код). Использование сжатия ковариации и порога бутстрапа позволило снизить уровень ложных срабатываний по сравнению с наивным квантильным подходом, который превышал допустимый бюджет ошибок в 4 раза.

Метрика / Аспект Результат SynthSentry Примечание
Тип сканирования Корпус-уровень (batch-mode) Англоязычные данные, однократная генерация
Требования к данным Отсутствуют (model-agnostic) Не нужны метки или доступ к генератору
Ложные срабатывания В пределах номинального бюджета Благодаря бутстрап-порогу и сжатию ковариации
Риск перепрuning Выявлен Удаление данных свыше доли реального загрязнения снижает точность

Значение для индустрии

Исследование позиционирует скрининг данных как защитную меру курирования, а не постфактум диагностику. Хотя на текущем масштабе тестов удаление загрязненных данных не показало явного прироста точности (вероятно, из-за малого объема выборки), метод открывает путь к созданию надежных инструментов очистки датасетов. Авторы опубликовали набор инструментов для оценки, что позволяет разработчикам LLM самостоятельно проверять свои корпуса перед дорогостоящим обучением.

Источник: arXiv cs.CL ↗