
服务热线:
13510270108







取缔
清空纪录
汗青纪录
清空纪录
汗青纪录
XILINX Versal ACAP:异构推算与 AI 加快下一代硬件平台
摩尔定律撞墙的,,,,,单靠堆晶体管已经喂不鼓算力需要了。。。。。Xilinx(现AMD)押注的Versal ACAP,,,,,就是冲着这个死结来的——它不是FPGA的升级版,,,,,而是一套把标量引擎、自适应引擎、智能引擎焊在一路的异构推算怪物。。。。。

架构拆开看:三种引擎干三种活
Versal ACAP基于台积电7nm FinFET工艺,,,,,芯片上塞了三套齐全分歧的推算引擎,,,,,各管各的活,,,,,又通过片上网络(NoC)高速互通。。。。。
标量引擎是两颗Arm Cortex-A72加两颗Cortex-R5F,,,,,跑操作系统、管节造平面,,,,,干的是CPU的老本行。。。。。自适应引擎就是传统FPGA那套可编程逻辑,,,,,LUT、BRAM、DSP????????橐挥闳,,,,掌管数据搬运和非矢量推算。。。。。智能引擎才是真正的晒赜转—AI Engine阵列,,,,,每个拼块(Tile)带512位SIMD矢量单元、标量RISC处置器和32KB本地内存,,,,,单周期能跑7路并行操作。。。。。
三套引擎不是单一拼盘。。。。。NoC把它们缝成一张网,,,,,内存映射接见无缝衔接,,,,,数据不用来回拷贝。。。。。这套架构的AI揣度机能,,,,,在NeatNet50图像分类模型上,,,,,是英伟达Tesla V100的1.6倍、T4的2.3倍。。。。。片上存储器带宽干到123TB/s,,,,,是V100的9倍、T4的25倍。。。。。
AI Engine怎么编程????????不写RTL,,,,,写C++
好多人一听AI加快就头大,,,,,以为要啃Verilog。。。。。Versal的AI Engine偏偏不走这条路。。。。。
开发用的是ADF(Adaptive Data Flow)Graph,,,,,性质上就是用C++搭数据流图。。。。。每个节点是一个kernel函数,,,,,边是数据通路,,,,,编译时直接映射到硬件。。。。。好比一个图像处置流水线,,,,,read_image、denoise、edge_detection三个kernel用connect
以内核为例,,,,,单内核吞吐量能到1.2TOPS,,,,,400个AI Engine拼块整体利用率超过90%。。。。。ResNet-50推理工作里,,,,,5W功耗跑出200TOPS,,,,,能效比是传统GPU规划的5倍。。。。。
产品线铺得很开,,,,,从云端怼到车规

Versal不是一个芯片,,,,,是一整个家族:
?
AI Core系列:算力天花板,,,,,多400个AI Engine拼块,,,,,专啃云端AI揣度和超高速网络。。。。。
?
Prime系列:走量款,,,,,收发器和I/O经过优化,,,,,100G到200G联网设备、存储加快都能覆盖。。。。。
?
Premium系列:2020年推出的旗舰,,,,,直接把112G PAM4收发器、600G以太网硬核、400G加密引擎做成了ASIC硬核。。。。。相比Virtex UltraScale+ VU19P,,,,,吞吐量翻了5倍以上,,,,,功耗不到100瓦就能撑起单芯片800G DCI吞吐。。。。。赛灵思自己算过,,,,,这套网络硬核等效22个16nm FPGA的逻辑密度,,,,,基础设施部门对LUT的亏损直接归零。。。。。
?
AI Edge系列:2022年杀进边缘市。。。。。,,,,对准汽车ADAS和工业场景。。。。。算力从上一代的4TOPS飙到17.4TOPS,,,,,面积缩幼60%,,,,,AI单元功耗机能是英伟达Jetson AGX Xavier的4.4倍。。。。。并且支持动态职能切换(DFx),,,,,毫秒级切换车路偏离预警、停车辅助等分歧职能,,,,,一颗芯片从L2级ADAS一路扩大到L5自动驾驶。。。。。
第二代Versal AI Edge更进一步,,,,,AIE-ML v2引擎原生支持INT4和BFLOAT16,,,,,MX6算力370TFLOPS,,,,,INT8达184TOPS,,,,,每瓦TOPS机能比上代提升3倍。。。。。斯巴鲁已经官宣在EyeSight系统里用这颗芯片,,,,,干碰撞前造动、车路维持这些活。。。。。

写在
Versal ACAP干的事很明确:CPU不善于并行,,,,,GPU不善于矫捷,,,,,FPGA不善于软件——那就把三个全揉一块。。。。。从数据中心到5G基站,,,,,从自动驾驶到工业节造,,,,,这套异构架构在把"一种芯片通吃所有场景"的空想,,,,,造成"一块平台适配所有工作负载"的现实。。。。。
