Исследования30 июня 2026 г., 11:46 МСК🤖 Auto

Замкнутый цикл: как точная оценка данных улучшает LLM

Исследователи представили метод «слайса способностей», превращающий интуитивный подбор данных в точный, измеримый процесс оптимизации моделей.

Баннер новости 2553

Проблема разрыва между данными и оценкой

Ключевая проблема при обучении больших языковых моделей (LLM) заключается в том, что способность модели не наблюдается напрямую. Данные формируют её проактивно, а оценка выявляет её ретроспективно, сжимая сложные процессы (выборки, промпты, декодирование) в один зашумленный балл. На практике оптимизация часто идет «задом наперед»: инженер видит провал на бенчмарке и должен интуитивно догадаться, какие данные исправить. Два языка — названия бенчмарков против источников данных — несовместимы, что делает процесс ненадежным.

Решение: «Слайс способностей» (Capability Slice)

Авторы (Чжисюань Ли, Цзянган Юань, Хань Сюй) предлагают закрыть этот разрыв с помощью концепции «слайса способностей». Это группа образцов оценки, объединенных общим фоновым условием, типом задачи, операцией решения и ограничениями вывода. Такой подход позволяет локализовать конкретную слабость модели, оставаясь стабильным при агрегации, в отличие от слишком общих названий бенчмарков или слишком шумных единичных образцов.

Эксперименты: Исключение и Включение данных

Метод был протестирован на двух противоположных кейсах, демонстрируя, что оценка может стать рутиной, а не интуицией:

  • Исключение данных (Data Out): Продолженное обучение (continued pre-training) привело к падению результатов BBH на -46.82%. Диагностика через слайсы выявила, что причина не в ослаблении рассуждений, а в единичной потере маскированного токена <EOS>. Восстановление этого токена вернуло BBH к 66.44 (выше исходного чекпоинта) без изменения данных.
  • Включение данных (Data In): Устойчивая слабость в математическом рассуждении была декомпозирована по операциям решения. Целевой выборка данных, основанная на этом анализе, подняла метрику AIME2025/AIME2026 Pass@128 с 6.67/0.00 до 26.67.

Результаты оптимизации

Ниже приведено сравнение эффективности подхода на ключевых метриках:

Метрика / Кейс До оптимизации После оптимизации Изменение
BBH (при ошибке <EOS>) -46.82% (относительно) 66.44 Восстановление + рост
AIME2025 Pass@128 6.67 26.67 +20.00
AIME2026 Pass@128 0.00 26.67 +26.67

Этот замкнутый цикл позволяет превратить интуитивные догадки инженеров в проверяемые, аудируемые эксперименты, где каждый шаг оптимизации данных имеет четкое обоснование на основе детальной диагностики модели.

Источник: arXiv cs.AI ↗