Проблема: Pass@k больше не всё решает
Оценка способностей больших языковых моделей (LLM) к программированию традиционно опирается на метрики производительности, такие как pass@k. Однако по мере развития индустрии многие модели достигают базового порога качества, что снижает дискриминационную способность этих метрик. Возникает критический вопрос: чем именно модели отличаются в процессе написания кода, если их финальный результат одинаков?
Решение: Система CLIC и токеномная аналитика
Команда исследователей во главе с Цзунпэном Ваном (Junpeng Wang) предложила метод CLIC (Code Learning for Identification and Comparison). Подход базируется на анализе частоты использования токенов. Каждая выборка кода преобразуется в вектор признаков, на основе которого обучается интерпретируемое решающее дерево для разделения наборов кода двух разных LLM.
Ключевое отличие метода — использование двух новых метрик, выходящих за рамки простой классификации:
- Robustness (Устойчивость): показывает, остаются ли модели различимыми по мере последовательного удаления их самых дискриминативных токенов.
- Concentration (Концентрация): определяет, вызваны ли различия несколькими доминирующими токенами или распределены по всему словарю.
Масштаб исследования: 10 моделей и 22 задачи
Для валидации подхода была проведена интерактивная визуальная аналитика, охватывающая сравнение 10 различных LLM в контексте 22 задач машинного обучения с Kaggle. Система позволяет исследователям навигировать по ландшафту сравнений, выявлять пары моделей с интересными поведенческими паттернами и детально изучать контекст использования дискриминативных токенов.
Практическая польза для разработчиков
Результаты кейс-стади предоставляют конкретные инсайты для выбора моделей под специфические задачи и оптимизации промпт-инжиниринга. Понимание того, как модель «думает» на уровне токенов, помогает предсказывать её поведение в edge-кейсах, где стандартные бенчмарки могут давать сбой.
| Метрика / Аспект | Описание и значение |
|---|---|
| Pass@k | Традиционная метрика успешности решения задачи. Теряет информативность при сравнении моделей высокого уровня. |
| Robustness | Измеряет стабильность различий между моделями при удалении ключевых токенов. Высокая устойчивость указывает на глубокие структурные различия. |
| Concentration | Показывает, сосредоточены ли различия в узком наборе токенов (специфика) или размазаны по всему коду (общий стиль). |
| CLIC | Визуально-аналитическая система для сравнения поведенческих паттернов LLM через частотный анализ токенов. |
Источник: arXiv cs.CL ↗
