Суть сделки: Специализация вместо универсальности
AMD приобретает Taalas, компанию, разрабатывающую чипы для AI-инференса, оптимизированные под конкретные модели. В отличие от программируемых GPU (как NVIDIA H200/B200), где веса модели загружаются из памяти HBM, архитектура Taalas «выжигает» модель прямо в CMOS. Это устраняет накладные расходы на пересылку данных, но требует замены физического оборудования при смене модели.
Технические характеристики и производительность
Демонстрационный чип Taalas HC1 изготовлен по техпроцессу TSMC 6nm. Кристалл площадью 815 мм² содержит 53 миллиарда транзисторов. Компания заявляет о выдающихся результатах при работе с моделью Llama 3.1 8B:
| Параметр | Значение / Характеристика |
|---|---|
| Техпроцесс | TSMC 6nm |
| Площадь кристалла | 815 мм² |
| Количество транзисторов | 53 млрд |
| Производительность (Llama 3.1 8B) | до 17 000 токенов/сек на пользователя |
| Ключевое преимущество | Отсутствие накладных расходов памяти HBM |
Экономика производства: Маски против Tape-out
Главный аргумент в пользу специализированных чипов — экономия на этапе производства. Taalas утверждает, что изменение весов или размерности матриц требует изменения всего двух масок (mask layers). Это значительно дешевле, чем полная перетасовка (tape-out) универсальных GPU, что делает решение рентабельным для стабильных, высоконагруженных сценариев.
Стратегия AMD: Полный стек
Технология Taalas будет интегрирована в линейку ускорителей Instinct и систему Helios. Это дает AMD два пути для клиентов:
- Универсальные решения: Instinct для гибких рабочих нагрузок и экспериментов.
- Специализированные решения: Чипы Taalas для моделей с устойчивым спросом (например, gpt-oss-20b/120b), где важна максимальная эффективность и низкая стоимость инференса.
Риски и перспективы
Основная проблема подхода — логистика. Если модель требует нескольких чипов (из-за размера кристалла), задержка поставки одного из них может остановить сборку всей стойки. Однако для крупных корпоративных клиентов, использующих устоявшиеся модели, этот компромисс между гибкостью и эффективностью выглядит привлекательным.
Источник: ServeTheHome ↗
