Исследования18 сентября 2026 г., 11:16 МСК🤖 Auto

QVAC Genesis III: Синтетические данные для STEM-моделей на edge-устройствах

Исследователи представили корпус QVAC Genesis III объемом 191B токенов, оптимизированный для обучения малых языковых моделей (1.7B) в области STEM с прицелом на работу на устройствах.

Баннер новости 7780

Проблема «узкого горлышка» данных для Edge AI

Разработка эффективных языковых моделей (LLM) для локального развертывания (on-device) сталкивается с критическим дефицитом качественных обучающих данных. В то время как крупные корпорации используют закрытые корпоративные датасеты, открытое сообщество лишено специализированных STEM-корпусов, которые обеспечивали бы высокую ценность обучения на один токен. Это особенно важно для моделей с ограниченным бюджетом токенов, где каждый байт данных должен работать на максимуме.

Архитектура QVAC Genesis III: Двойная стратегия генерации

Корпус QVAC Genesis III состоит из 191.43 миллиарда токенов и охватывает 19 различных доменов STEM-области. Уникальность датасета заключается в методологии его создания — двойной стратегии генерации с использованием дистилляции знаний:

  • Работа над ошибками: Слабая модель-студент (edge-scale) используется как источник сигнала. Её ошибки преобразуются в корректирующие объяснения, помогая модели понять, почему ответ неверен.
  • Контрастивное рассуждение: Успешные ответы студента расширяются в формат контрастивного анализа всех вариантов ответов, что развивает способность модели к логическому выбору.

Результаты бенчмарков: Превосходство над Cosmopedia

Для валидации эффективности данных авторы провели контролируемые эксперименты по обучению с нуля (from-scratch) моделей объемом 1.7B параметров. Результаты показали, что использование QVAC Genesis III дает статистически значимое преимущество перед моделями, обученными на открытых синтетических корпусах (Cosmopedia-v2) или базовыми моделями (Cosmo-1B).

Метрика / Датасет Результат QVAC Genesis III Сравнительный эффект
ARC-E (Elementary) +28.57% Значительный прирост точности на простых тестах
ARC-C (Challenge) +21.35% Улучшение решения сложных логических задач
Valid Answer Rate до 99.45% Минимизация «галлюцинаций» и форматных ошибок

Инновация: LLM-as-a-parser

Авторы также представили новый протокол оценки LLM-as-a-parser. Вместо жесткого сопоставления строк, эта система извлекает финальные ответы из свободных текстовых выходов модели, отслеживая как точность, так и валидность ответа. Это позволяет более объективно оценивать способность малых моделей к рассуждению в STEM-задачах, где формат ответа может варьироваться.

Значение для индустрии

QVAC Genesis III закрывает нишу высококачественных открытых данных для создания «умных» ассистентов, работающих непосредственно на смартфонах и IoT-устройствах. Доказано, что при правильном отборе и генерации данных, модели малого размера (1.7B) могут достигать результатов, сопоставимых с более крупными аналогами, что снижает затраты на inference и повышает приватность пользователей.

Источник: arXiv cs.AI ↗