Аппаратная модификация: от x4 к полному x16
Проект по использованию NVIDIA CMP 90HX для локальных LLM выявил критическое ограничение: карты имели урезанный интерфейс PCIe. Автор проекта вручную восстановил недостающие линии, допаяв разделительные конденсаторы (220 нФ) на плате GA102. Это позволило перевести все 5 карт в конфигурации с режимом tensor split (распределение тензорных операций между GPU) с нестабильных x4/x8 к стабильному PCIe Gen1 x16.
Проблема пропускной способности
Даже после восстановления физической ширины шины, скорость оставалась на уровне PCIe Gen1 (2.5 GT/s, ~4 ГБ/с). Для режимов с активным обменом данными между картами это стало «бутылочным горлышком». Автор решил не просто использовать карту, а заставить её работать на максимальной для чипа скорости — PCIe Gen2 (5.0 GT/s, ~8 ГБ/с), что требует обхода программных блокировок NVIDIA.
Решение: нейросеть вместо ручного тюнинга
Стандартные методы ручного подбора параметров (overclocking) не дали стабильного результата из-за сложности взаимодействия компонентов. В качестве «мозга» для поиска оптимальных таймингов и напряжений была запущена специализированная нейросеть, работающая на тех же самых видеокартах. AI-агент перебирал комбинации, находя стабильные конфигурации для перехода на Gen2, что ранее считалось невозможным без замены BIOS или сложного аппаратного вмешательства.
Результаты производительности
Переход на PCIe Gen2 и оптимизация через AI привели к значительному росту скорости обработки запросов (prefill) в режиме tensor split. Ниже приведено сравнение ключевых метрик для модели Qwen3.8-27B-Heretic:
| Режим / Параметр | До модификации (Gen1 x4/x8) | После x16 (Gen1) | После разгона (Gen2 + AI) |
|---|---|---|---|
| Prefill (входные данные) | 268.46 tok/s | 489.16 tok/s (+82%) | Значительный рост (см. ниже) |
| Decode (генерация) | 31.93 tok/s | 37.34 tok/s (+17%) | Дополнительный прирост |
| Интерфейс | PCIe Gen1 x4/x8 | PCIe Gen1 x16 | PCIe Gen2 x16 |
Для режима layer split прирост был минимальным (Prefill +5.3%, Decode +0.8%), так как этот метод требует меньшего обмена данными между GPU. Однако для tensor split, который критичен для эффективного использования VRAM больших моделей, разгон шины стал прорывом, устранив задержки при передаче промежуточных результатов.
Термический контроль
Для обеспечения стабильности разгона была внедрена система активного охлаждения: сервер подключен к напольному кондиционеру. Это позволило снизить температуру GPU в простое до 9°C, а под полной нагрузкой удерживать её на уровне 60°C, что значительно безопаснее стандартных 90°C и позволяет поддерживать стабильную работу разогнанных компонентов.
Источник: Habr ↗
