Инструменты9 июля 2026 г., 23:00 МСК🤖 Auto

NVIDIA NeMo: 500K уникальных финансовых заголовков за 6 дней на B200

Команда NVIDIA представила итеративный пайплайн генерации синтетических данных для финтеха. Используя NeMo и модель Nemotron-3-Nano, они создали датасет FinHeadlineMix с 82% эффективностью дедупликации.

Баннер новости 3241

Проблема дисбаланса в финансовых данных

Обучение LLM для финансового NLP ограничено реальными данными, которые сильно перекосены в сторону отчетов о прибыли и колебаний акций. Редкие события — изменения кредитных рейтингов, одобрение продуктов, трудовые споры — практически отсутствуют в выборках. Простая генерация «в лоб» не решает проблему: при базовом запуске 50 000 заголовков семантическая дедупликация оставляла лишь 17 348 уникальных записей (потеря 65% данных).

Решение: Итеративный цикл «Генерация — Дедупликация»

NVIDIA разработала конвейер, который не просто генерирует данные, а постоянно фильтрует их. Процесс включает:

  • NeMo Data Designer: структурированная генерация заголовков с учетом весов категорий.
  • NeMo Curator: глобальная семантическая дедупликация с порогом косинусного сходства 90% и кластеризацией K-means (500 кластеров).
  • Nemotron-3-Nano-30B-A3B: модель MoE (30B параметров, 3B активных) для высокопроизводительного вывода через vLLM.

Ключевая инновация — выбор примеров для few-shot обучения по принципу «наиболее удаленных от центроида». Это заставляет модель каждый раз генерировать более уникальные заголовки, избегая повторов из предыдущих итераций.

Технические детали и метрики

Эксперимент проводился на одном узле с 8 GPU NVIDIA B200. Вычислительные ресурсы были разделены: GPUs 0–3 обслуживали inference (448 параллельных запросов), а GPUs 4–7 — семантическую дедупликацию через Ray. Итоговый датасет FinHeadlineMix содержит 502 536 уникальных заголовков по 13 категориям. Общая эффективность дедупликации составила ~82%.

Параметр Значение / Конфигурация
Модель NVIDIA-Nemotron-3-Nano-30B-A3B-FP8
Оборудование Single 8-way NVIDIA B200 node
Параметры vLLM 4-way tensor parallelism, 448 concurrent requests
Порог дедупликации 90% cosine similarity
Кластеризация 500 K-means clusters
Размер датасета 502,536 уникальных заголовков
Категории 12 тем + «Other»
Версии ПО NeMo Curator 1.0.0rc0, NeMo Data Designer 0.1.5, vLLM 0.12.0

Зачем это нужно рынку

Полученный датасет оптимизирован для дистилляции моделей и классификации. Компактные «студенческие» модели, обученные на таких сбалансированных синтетических данных, демонстрируют F1-метрику, близкую к уровню больших «учительских» моделей, но требуют значительно меньше ресурсов. Это критически важно для алгоритмической торговли, риск-менеджмента и систем мониторинга, где важна скорость и точность обработки редких событий.

Источник: NVIDIA dev blog ↗