超威发布基于五接口的加速卡 主打智能体与多租户虚拟化
超威半导体(Advanced Micro Devices,简称AMD)近日正式推出Instinct MI350P,这是一款基于PCIe 5.0接口的AI加速卡。与传统的OAM(开放加速器模块)封装不同,MI350P采用了更为通用的插卡式设计,旨在让具备高性能计算需求的普通服务器甚至高端工作站也能便捷地接入先进的AI算力。该产品的核心定位是服务于“Agentic AI”(智能体人工智能),即能够自动执行任务、协助用户的AI代理应用。
显存减半但容量仍具优势
MI350P在硬件规格上进行了显著的“瘦身”,但其核心参数依然强劲。该卡搭载了144GB的HBM3e堆叠内存,这一容量足以支撑参数量在2000亿至2500亿之间的大语言模型运行。相比之下,AMD此前推出的Radeon AI Pro 9700工作站显卡仅配备32GB显存,在处理400亿至500亿参数规模的模型时便已触及瓶颈。MI350P的显存容量是后者的四倍以上,显示出其在处理更大规模上下文和复杂推理任务上的优势。
从架构上看,MI350P可以被视为Instinct MI350X/355X系列的“半速版”。后者采用OAM封装,拥有256个计算单元(CUs)和288GB HBM3e显存。而MI350P仅激活了128个计算单元,并减半了显存容量。这种设计源于其内部封装结构的改变:MI350P仅使用一个输入/输出芯片(IOD)连接四个计算芯片(XCD),从而将GPU封装体积缩小一半,使其能够适配标准的PCIe插槽。
支持四路虚拟化与视频加速
除了强大的AI推理能力,MI350P还集成了丰富的多媒体处理功能。它支持包括AV1在内的Zui新视频编加速,并具备将物理GPU划分为多个虚拟实例的能力。通过SPX、DPX和CPX三种分区模式,用户可以根据需求灵活分配资源:SPX为全功率独占模式;DPX模式下,两个用户可平分计算单元、内存及L2缓存等资源;而在CPX模式下,Zui多可支持四个用户同时使用,其中每两个分区共享一个视频引擎和一个JPEG引擎。

在多媒体性能方面,该芯片的理论吞吐量极为惊人。完整芯片每秒可处理99路1080p30帧的AV1视频流,或4425张1080p分辨率的JPEG图像。即便在CPX四分区模式下,每个分区仍保留有充足的计算余量,能够满足多用户并发的高清视频处理需求。


功耗对标NVIDIA高端产品
MI350P的热设计功耗(TDP)为600瓦,这一数值与NVIDIA的RTX Pro 6000 Blackwell及H200 NVL相当,表明AMD意在直接竞争这些高端数据中心加速卡市场。供电方面,该卡采用了争议较大的ATX 12V-2×6接口,同时也支持450瓦的低功耗模式以适应不同的散热环境。尽管采用被动散热设计,但其尺寸(约26.7厘米长,双插槽)明确指向了拥有强劲气流的风冷机架式服务器环境。
在理论算力方面,MI350P在FP8精度下的计算能力为2300 TFLOPS(若启用稀疏性技术,数值可翻倍至4600 TFLOPS)。这一数据约为其全尺寸兄弟型号MI355X的一半,略低于NVIDIA H200 NVL的1670 TFLOPS(满配矩阵)或3340 TFLOPS(稀疏模式)。AMD表示,在实际运行中,该卡的吞吐量能达到理论峰值的60%至70%,但在MXFP6精度下效率略有下降,仅为理论的40%。
对于中国AI基础设施建设和算力应用企业而言,MI350P的出现提供了一条新的技术路径。在当前的国际供应链环境下,获取高性能AI加速卡面临诸多挑战,而PCIe接口的通用性使得该卡可以部署在现有的大量非专用服务器硬件中,降低了硬件替换成本。尽管其单卡算力不及OAM模块,但其支持的多租户虚拟化特性非常适合云服务商和大型企业提供按需分配的AI推理服务。中国企业可重点关注其在Agentic AI场景下的落地能力,以及通过软件优化弥补硬件规格差距的潜力,从而在边缘计算和中型数据中心场景中寻找差异化竞争优势。