Проблема «узкого горлышка» данных для Edge AI
Разработка эффективных языковых моделей (LLM) для локального развертывания (on-device) сталкивается с критическим дефицитом качественных обучающих данных. В то время как крупные корпорации используют закрытые корпоративные датасеты, открытое сообщество лишено специализированных STEM-корпусов, которые обеспечивали бы высокую ценность обучения на один токен. Это особенно важно для моделей с ограниченным бюджетом токенов, где каждый байт данных должен работать на максимуме.
Архитектура QVAC Genesis III: Двойная стратегия генерации
Корпус QVAC Genesis III состоит из 191.43 миллиарда токенов и охватывает 19 различных доменов STEM-области. Уникальность датасета заключается в методологии его создания — двойной стратегии генерации с использованием дистилляции знаний:
- Работа над ошибками: Слабая модель-студент (edge-scale) используется как источник сигнала. Её ошибки преобразуются в корректирующие объяснения, помогая модели понять, почему ответ неверен.
- Контрастивное рассуждение: Успешные ответы студента расширяются в формат контрастивного анализа всех вариантов ответов, что развивает способность модели к логическому выбору.
Результаты бенчмарков: Превосходство над Cosmopedia
Для валидации эффективности данных авторы провели контролируемые эксперименты по обучению с нуля (from-scratch) моделей объемом 1.7B параметров. Результаты показали, что использование QVAC Genesis III дает статистически значимое преимущество перед моделями, обученными на открытых синтетических корпусах (Cosmopedia-v2) или базовыми моделями (Cosmo-1B).
| Метрика / Датасет | Результат QVAC Genesis III | Сравнительный эффект |
|---|---|---|
| ARC-E (Elementary) | +28.57% | Значительный прирост точности на простых тестах |
| ARC-C (Challenge) | +21.35% | Улучшение решения сложных логических задач |
| Valid Answer Rate | до 99.45% | Минимизация «галлюцинаций» и форматных ошибок |
Инновация: LLM-as-a-parser
Авторы также представили новый протокол оценки LLM-as-a-parser. Вместо жесткого сопоставления строк, эта система извлекает финальные ответы из свободных текстовых выходов модели, отслеживая как точность, так и валидность ответа. Это позволяет более объективно оценивать способность малых моделей к рассуждению в STEM-задачах, где формат ответа может варьироваться.
Значение для индустрии
QVAC Genesis III закрывает нишу высококачественных открытых данных для создания «умных» ассистентов, работающих непосредственно на смартфонах и IoT-устройствах. Доказано, что при правильном отборе и генерации данных, модели малого размера (1.7B) могут достигать результатов, сопоставимых с более крупными аналогами, что снижает затраты на inference и повышает приватность пользователей.
Источник: arXiv cs.AI ↗
