Исследования22 сентября 2026 г., 11:21 МСК🤖 Auto

CLIC: Как различить LLM по стилю кода, а не только по баллам

Исследователи представили систему CLIC, которая анализирует «подписи токенов» в коде, позволяя выявлять поведенческие различия между моделями, даже если их тестовые баллы идентичны.

Баннер новости 8027

Проблема: Pass@k больше не всё решает

Оценка способностей больших языковых моделей (LLM) к программированию традиционно опирается на метрики производительности, такие как pass@k. Однако по мере развития индустрии многие модели достигают базового порога качества, что снижает дискриминационную способность этих метрик. Возникает критический вопрос: чем именно модели отличаются в процессе написания кода, если их финальный результат одинаков?

Решение: Система CLIC и токеномная аналитика

Команда исследователей во главе с Цзунпэном Ваном (Junpeng Wang) предложила метод CLIC (Code Learning for Identification and Comparison). Подход базируется на анализе частоты использования токенов. Каждая выборка кода преобразуется в вектор признаков, на основе которого обучается интерпретируемое решающее дерево для разделения наборов кода двух разных LLM.

Ключевое отличие метода — использование двух новых метрик, выходящих за рамки простой классификации:

  • Robustness (Устойчивость): показывает, остаются ли модели различимыми по мере последовательного удаления их самых дискриминативных токенов.
  • Concentration (Концентрация): определяет, вызваны ли различия несколькими доминирующими токенами или распределены по всему словарю.

Масштаб исследования: 10 моделей и 22 задачи

Для валидации подхода была проведена интерактивная визуальная аналитика, охватывающая сравнение 10 различных LLM в контексте 22 задач машинного обучения с Kaggle. Система позволяет исследователям навигировать по ландшафту сравнений, выявлять пары моделей с интересными поведенческими паттернами и детально изучать контекст использования дискриминативных токенов.

Практическая польза для разработчиков

Результаты кейс-стади предоставляют конкретные инсайты для выбора моделей под специфические задачи и оптимизации промпт-инжиниринга. Понимание того, как модель «думает» на уровне токенов, помогает предсказывать её поведение в edge-кейсах, где стандартные бенчмарки могут давать сбой.

Метрика / Аспект Описание и значение
Pass@k Традиционная метрика успешности решения задачи. Теряет информативность при сравнении моделей высокого уровня.
Robustness Измеряет стабильность различий между моделями при удалении ключевых токенов. Высокая устойчивость указывает на глубокие структурные различия.
Concentration Показывает, сосредоточены ли различия в узком наборе токенов (специфика) или размазаны по всему коду (общий стиль).
CLIC Визуально-аналитическая система для сравнения поведенческих паттернов LLM через частотный анализ токенов.

Источник: arXiv cs.CL ↗