Проблема дисбаланса в финансовых данных
Обучение LLM для финансового NLP ограничено реальными данными, которые сильно перекосены в сторону отчетов о прибыли и колебаний акций. Редкие события — изменения кредитных рейтингов, одобрение продуктов, трудовые споры — практически отсутствуют в выборках. Простая генерация «в лоб» не решает проблему: при базовом запуске 50 000 заголовков семантическая дедупликация оставляла лишь 17 348 уникальных записей (потеря 65% данных).
Решение: Итеративный цикл «Генерация — Дедупликация»
NVIDIA разработала конвейер, который не просто генерирует данные, а постоянно фильтрует их. Процесс включает:
- NeMo Data Designer: структурированная генерация заголовков с учетом весов категорий.
- NeMo Curator: глобальная семантическая дедупликация с порогом косинусного сходства 90% и кластеризацией K-means (500 кластеров).
- Nemotron-3-Nano-30B-A3B: модель MoE (30B параметров, 3B активных) для высокопроизводительного вывода через vLLM.
Ключевая инновация — выбор примеров для few-shot обучения по принципу «наиболее удаленных от центроида». Это заставляет модель каждый раз генерировать более уникальные заголовки, избегая повторов из предыдущих итераций.
Технические детали и метрики
Эксперимент проводился на одном узле с 8 GPU NVIDIA B200. Вычислительные ресурсы были разделены: GPUs 0–3 обслуживали inference (448 параллельных запросов), а GPUs 4–7 — семантическую дедупликацию через Ray. Итоговый датасет FinHeadlineMix содержит 502 536 уникальных заголовков по 13 категориям. Общая эффективность дедупликации составила ~82%.
| Параметр | Значение / Конфигурация |
|---|---|
| Модель | NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 |
| Оборудование | Single 8-way NVIDIA B200 node |
| Параметры vLLM | 4-way tensor parallelism, 448 concurrent requests |
| Порог дедупликации | 90% cosine similarity |
| Кластеризация | 500 K-means clusters |
| Размер датасета | 502,536 уникальных заголовков |
| Категории | 12 тем + «Other» |
| Версии ПО | NeMo Curator 1.0.0rc0, NeMo Data Designer 0.1.5, vLLM 0.12.0 |
Зачем это нужно рынку
Полученный датасет оптимизирован для дистилляции моделей и классификации. Компактные «студенческие» модели, обученные на таких сбалансированных синтетических данных, демонстрируют F1-метрику, близкую к уровню больших «учительских» моделей, но требуют значительно меньше ресурсов. Это критически важно для алгоритмической торговли, риск-менеджмента и систем мониторинга, где важна скорость и точность обработки редких событий.
Источник: NVIDIA dev blog ↗
