SkyworkAI/Skywork
Модели серии Skywork предварительно обучены на 3.2 ТБ высококачественных многоязычных (преимущественно китайских и английских) и кодовых данных. Мы открыли исходный код модели, обучающих данных, данных для оценки, методов оценки и т. д.
Что это за инструмент
Skywork — это серия открытых больших языковых моделей (LLM) объемом 13B параметров, разработанных командой Kunlun Group, с акцентом на двуязычие (китайский и английский) и специализированные навыки.
Зачем нужен
Инструмент предназначен для развертывания локальных LLM на потребительских GPU благодаря наличию квантованных версий. Он полезен для задач генерации текста, математических вычислений и мультимодального анализа изображений, предлагая альтернативу коммерческим решениям с открытым исходным кодом.
Что можно реализовать
- Генерация креативного контента и диалогов с уровнем качества, близким к ChatGPT, благодаря специализированной дообучке (Skywork-13B-Chat).
- Решение сложных математических задач и логических головоломок с высокой точностью на бенчмарках GSM8K, MATH и CMATH (Skywork-13B-Math).
- Анализ изображений и ответы на вопросы по визуальным данным с помощью мультимодальной модели (Skywork-13B-MM).
- Исследование архитектуры и методов предобучения LLM с использованием открытых данных, метрик и технической документации.
- Обучение новых моделей на крупнейшем открытом датасете китайского сегмента интернета Skypile-150B (150B токенов).
Ключевые возможности
- Наличие квантованных версий (например, 8-bit) для эффективного запуска на видеокартах потребительского класса.
- Специализированные модели для конкретных доменов: математика (Skywork-13B-Math) и мультимодальность (Skywork-13B-MM).
- Открытый датасет Skypile-150B объемом около 600 ГБ, являющийся одним из крупнейших открытых наборов данных на китайском языке.
- Полная прозрачность: публикация методов оценки, данных для тестирования и технической документации (tech report).
- Коммерческое использование разрешено при соблюдении условий лицензии и запрете на вредоносную деятельность.
👤 Кому подойдёт: разработчики LLM, исследователи в области NLP, компании, ищущие локальные решения для генерации текста и анализа данных, энтузиасты, желающие запускать мощные модели на собственном оборудовании