Прорыв в энергоэффективности на устаревшем техпроцессе
Компании SK hynix, TetraMem и Университет Южной Калифорнии (USC) разработали экспериментальный системный чип (SoC) на базе мемристоров. Главная цель проекта — ускорение инференса легких нейросетей (например, MobileNet) на периферийных устройствах (Edge AI) с минимальным потреблением энергии. Ключевая особенность: чип изготовлен по устаревшему 65-нм техпроцессу CMOS, что делает его производство потенциально дешевым, но требует инновационных архитектурных решений для компенсации ограничений технологии.
Архитектура: Z-образные кроссбары для Depthwise Convolution
Стандартные кроссбарные массивы плохо справляются с операциями глубинной свертки (Depthwise Convolution, DWC), которые критичны для легких моделей. Авторы решили эту проблему, внедрив специализированный NPU с «зигзагообразной» (zig-zag) топологией. Вместо прямых линий выбора используются диагональные, что позволяет активировать 252 ячейки памяти в 28 столбцах одновременно. Это обеспечивает параллельное выполнение 28 независимых свертки 3×3, используя 100% массива для хранения весов. Остальные 9 из 10 NPU используют классические 1T1R кроссбары для точечных и плотных операций.
Метрики: эффективность против абсолютной мощности
Чип демонстрирует выдающиеся показатели энергоэффективности, но скромную абсолютную производительность. Пиковая пропускная способность составляет всего 2.54 TOPS (теоретически), что в 16 раз ниже требований Microsoft для Copilot+ устройств. Однако по соотношению производительность/ватт чип превосходит многие современные решения. Ниже приведено сравнение ключевых метрик.
| Параметр | Значение / Характеристика | Примечание |
|---|---|---|
| Техпроцесс | 65 нм CMOS | Использована бэкенд-интеграция мемристоров |
| Пиковая производительность (SoC) | ~2.54 TOPS | Теоретический максимум, не подтвержден полной загрузкой |
| Энергоэффективность (пик) | 21.3 TOPS/W | При тактовой частоте 100 МГц |
| Энергоэффективность (нагрузка) | 11.9 TOPS/W | При тактовой частоте 400 МГц |
| Точность инференса | 80.36% | Совпадает с 4-битной цифровой моделью (MobileNetV1Small) |
| Эффективная точность весов | ~4 бита | Достигнута за счет техники компенсации двух подмассивов (аналог NVFP4, но на аналоговом уровне) |
Критика: «Слепые зоны» в бенчмарках
Несмотря на впечатляющую эффективность, исследование оставляет открытым вопрос о реальной масштабируемости. В демонстрации на задаче Visual Wake Words использовался только один специализированный NPU для DWC и пять обычных NPU для точечных слоев. Четыре NPU остались простаивать. Авторы не предоставили данных о суммарной пропускной способности всех 10 блоков под полной нагрузкой и не подтвердили, что все NPU могут работать синхронно. Таким образом, заявленная эффективность 21.3 TOPS/W валидирует подход, но не гарантирует, что чип сможет конкурировать с современными GPU/NPU в сложных сценариях без потери производительности при масштабировании.
Источник: Tom's Hardware ↗
