Проблема разрыва между данными и оценкой
Ключевая проблема при обучении больших языковых моделей (LLM) заключается в том, что способность модели не наблюдается напрямую. Данные формируют её проактивно, а оценка выявляет её ретроспективно, сжимая сложные процессы (выборки, промпты, декодирование) в один зашумленный балл. На практике оптимизация часто идет «задом наперед»: инженер видит провал на бенчмарке и должен интуитивно догадаться, какие данные исправить. Два языка — названия бенчмарков против источников данных — несовместимы, что делает процесс ненадежным.
Решение: «Слайс способностей» (Capability Slice)
Авторы (Чжисюань Ли, Цзянган Юань, Хань Сюй) предлагают закрыть этот разрыв с помощью концепции «слайса способностей». Это группа образцов оценки, объединенных общим фоновым условием, типом задачи, операцией решения и ограничениями вывода. Такой подход позволяет локализовать конкретную слабость модели, оставаясь стабильным при агрегации, в отличие от слишком общих названий бенчмарков или слишком шумных единичных образцов.
Эксперименты: Исключение и Включение данных
Метод был протестирован на двух противоположных кейсах, демонстрируя, что оценка может стать рутиной, а не интуицией:
- Исключение данных (Data Out): Продолженное обучение (continued pre-training) привело к падению результатов BBH на -46.82%. Диагностика через слайсы выявила, что причина не в ослаблении рассуждений, а в единичной потере маскированного токена <EOS>. Восстановление этого токена вернуло BBH к 66.44 (выше исходного чекпоинта) без изменения данных.
- Включение данных (Data In): Устойчивая слабость в математическом рассуждении была декомпозирована по операциям решения. Целевой выборка данных, основанная на этом анализе, подняла метрику AIME2025/AIME2026 Pass@128 с 6.67/0.00 до 26.67.
Результаты оптимизации
Ниже приведено сравнение эффективности подхода на ключевых метриках:
| Метрика / Кейс | До оптимизации | После оптимизации | Изменение |
|---|---|---|---|
| BBH (при ошибке <EOS>) | -46.82% (относительно) | 66.44 | Восстановление + рост |
| AIME2025 Pass@128 | 6.67 | 26.67 | +20.00 |
| AIME2026 Pass@128 | 0.00 | 26.67 | +26.67 |
Этот замкнутый цикл позволяет превратить интуитивные догадки инженеров в проверяемые, аудируемые эксперименты, где каждый шаг оптимизации данных имеет четкое обоснование на основе детальной диагностики модели.
Источник: arXiv cs.AI ↗
