Память — король декодирования
В локальном запуске больших языковых моделей (LLM) фаза декодирования (генерация токенов) является последовательной. Скорость вывода текста зависит не от вычислительной мощности GPU, а от пропускной способности памяти, так как веса модели должны постоянно подгружаться в ядро. Apple M4 Max использует 512-битную шину памяти с пропускной способностью 546 ГБ/с, что вдвое превышает показатели конкурентов. Это позволяет чипу Apple обгонять Nvidia GB10 и AMD Strix Halo в скорости генерации токенов в секунду (tokens-per-second).
Сравнение спецификаций: Apple против Nvidia и AMD
Apple не раскрывает детальную архитектуру своих GPU, поэтому точное сравнение FLOPS затруднено. Однако, основываясь на данных о количестве ядер и предположениях об архитектуре, можно составить следующую таблицу характеристик тестируемых систем:
| Параметр | Nvidia GB10 | AMD Ryzen AI Max+ 395 (Strix Halo) | Apple M4 Max (16C CPU, 40C GPU) |
|---|---|---|---|
| Цена (B&H/Amazon) | $4,999 / $3,649 | $6,793 | $8,499 |
| CPU Performance Cores | 10 | 16 | 12 |
| GPU Cores / CUs | 48 SM | 40 CU | 40 |
| Shader ALUs (оценка) | 6,144 | 2,560 | 5,120 (предположительно) |
| Объем памяти | 128GB LPDDR5X-8533 | 128GB LPDDR5X-8000 | 128GB LPDDR5X-8533 (предположительно) |
| Ширина шины | 256 bit | 256 bit | 512 bit |
| Пропускная способность | 273 GB/s | 256 GB/s | 546 GB/s |
Проблемы с доступностью и ценой
Несмотря на технологическое превосходство в пропускной способности, Mac Studio сталкивается с серьезными рыночными проблемами. Из-за дефицита компонентов (RAMpocalypse) конфигурации с 64 ГБ и более памяти стали труднодоступны, а сроки поставки превышают два месяца. Тестируемая модель с 128 ГБ памяти стоила около $3,699 при анонсе, но сейчас базовая цена за аналогичную производительность у Nvidia (DGX Spark) составляет $3,999, что делает Apple менее выгодным предложением «за свои деньги».
Почему Nvidia GB10 все еще выигрывает
Tom's Hardware отмечает, что системы на базе Nvidia GB10 остаются предпочтительными для разработчиков AI. Причина — широкая совместимость программного обеспечения и отсутствие ограничений macOS. На Mac невозможно использовать GPU-пасsthrough для контейнеров (Docker), что критично для многих AI-пайплайнов. M4 Max выигрывает в чистой скорости декодирования, но GB10 предлагает более сбалансированную экосистему для локальной разработки.
Источник: Tom's Hardware ↗
