AI-новости10 июля 2026 г., 20:16 МСК🤖 Auto

SK hynix и TetraMem создали чип на мемристорах для Edge AI

Консорциум представил SoC с архитектурой вычислений в памяти (IMC), оптимизированной для мобильных сетей. Чип демонстрирует рекордную энергоэффективность, но его реальная производительность остается под вопросом.

Баннер новости 3322

Прорыв в энергоэффективности на устаревшем техпроцессе

Компании SK hynix, TetraMem и Университет Южной Калифорнии (USC) разработали экспериментальный системный чип (SoC) на базе мемристоров. Главная цель проекта — ускорение инференса легких нейросетей (например, MobileNet) на периферийных устройствах (Edge AI) с минимальным потреблением энергии. Ключевая особенность: чип изготовлен по устаревшему 65-нм техпроцессу CMOS, что делает его производство потенциально дешевым, но требует инновационных архитектурных решений для компенсации ограничений технологии.

Архитектура: Z-образные кроссбары для Depthwise Convolution

Стандартные кроссбарные массивы плохо справляются с операциями глубинной свертки (Depthwise Convolution, DWC), которые критичны для легких моделей. Авторы решили эту проблему, внедрив специализированный NPU с «зигзагообразной» (zig-zag) топологией. Вместо прямых линий выбора используются диагональные, что позволяет активировать 252 ячейки памяти в 28 столбцах одновременно. Это обеспечивает параллельное выполнение 28 независимых свертки 3×3, используя 100% массива для хранения весов. Остальные 9 из 10 NPU используют классические 1T1R кроссбары для точечных и плотных операций.

Метрики: эффективность против абсолютной мощности

Чип демонстрирует выдающиеся показатели энергоэффективности, но скромную абсолютную производительность. Пиковая пропускная способность составляет всего 2.54 TOPS (теоретически), что в 16 раз ниже требований Microsoft для Copilot+ устройств. Однако по соотношению производительность/ватт чип превосходит многие современные решения. Ниже приведено сравнение ключевых метрик.

Параметр Значение / Характеристика Примечание
Техпроцесс 65 нм CMOS Использована бэкенд-интеграция мемристоров
Пиковая производительность (SoC) ~2.54 TOPS Теоретический максимум, не подтвержден полной загрузкой
Энергоэффективность (пик) 21.3 TOPS/W При тактовой частоте 100 МГц
Энергоэффективность (нагрузка) 11.9 TOPS/W При тактовой частоте 400 МГц
Точность инференса 80.36% Совпадает с 4-битной цифровой моделью (MobileNetV1Small)
Эффективная точность весов ~4 бита Достигнута за счет техники компенсации двух подмассивов (аналог NVFP4, но на аналоговом уровне)

Критика: «Слепые зоны» в бенчмарках

Несмотря на впечатляющую эффективность, исследование оставляет открытым вопрос о реальной масштабируемости. В демонстрации на задаче Visual Wake Words использовался только один специализированный NPU для DWC и пять обычных NPU для точечных слоев. Четыре NPU остались простаивать. Авторы не предоставили данных о суммарной пропускной способности всех 10 блоков под полной нагрузкой и не подтвердили, что все NPU могут работать синхронно. Таким образом, заявленная эффективность 21.3 TOPS/W валидирует подход, но не гарантирует, что чип сможет конкурировать с современными GPU/NPU в сложных сценариях без потери производительности при масштабировании.

Источник: Tom's Hardware ↗