AMD的MI300X能否挑战Nvidia的H100？-EDN 电子技术设计

 AMD的新GPU能否与竞争对手Nvidia(英伟达)的旗舰H100 GPU相抗衡？虽然它看起来在原始性能上击败了H100，但这就足够了吗？

上周二，AMD的高管在旧金山举行的一次活动中展示了他们对AI的愿景，包括新的数据中心CPU和GPU产品。他们展示了公司产品组合中几乎所有能够运行AI的产品，并推出一个又一个超大规模(hyperscale)的客户，以表明他们在超级计算机和超大规模领域取得的成功。但大家真正想知道的是：AMD的新GPU能否与竞争对手Nvidia(英伟达)的旗舰H100 GPU相抗衡？虽然它看起来在原始性能上击败了H100，但这就足够了吗？2Y3ednc

2Y3ednc

AMD首席执行官Lisa Su(苏姿丰)展示了MI300X。(来源：AMD)2Y3ednc

“人工智能是塑造下一代计算的决定性技术，”AMD首席执行官苏姿丰在活动中表示，“坦率地说，这是AMD最大、最具战略意义的增长机会。”2Y3ednc

据报道，由于对ChatGPT等大语言模型(LLM)的训练和推理需求增加，目前H100供不应求，现在是宣布一个可靠的H100竞争对手的最佳时机。2Y3ednc

AMD的数据中心GPU产品线包括之前宣布的MI300A，它将用于劳伦斯利弗莫尔国家实验室目前正在调试的2 ExaFLOP的El Capitan超级计算机。MI300A使用了13个小芯片，混合了CPU和GPU芯片，这是HPC(高性能计算)的一种流行的组合。2Y3ednc

在AMD的活动中，苏姿丰发布了新MI300X的详细信息(MI300A的纯GPU版，将MI300A的三个CPU小芯片替换为两个GPU小芯片)。还增加了更多HBM内存和内存带宽，专门针对LLM和其他AI工作负载进行优化。GPU小芯片采用AMD的第三代CDNA 3架构，与MI250和早期产品相比，该架构具有新的计算引擎和对AI友好的数据格式。2Y3ednc

2Y3ednc

AMD的12芯片组MI300X GPU直接与Nvidia的H100竞争。(来源：AMD)2Y3ednc

总的来说，新的旗舰GPU有十几个5纳米和6纳米的小芯片，总共有1530亿个晶体管。它具有192GB HBM3内存和5.2TB/s内存带宽。相比之下，Nvidia的H100有一个带有80GB HBM2e的版本，总带宽为3.3TB/s。这让MI300X拥有2.4倍的HBM密度和1.6倍的HBM带宽。2Y3ednc

“有了所有这些额外的容量，我们在更大的模型上就有了优势，因为你可以直接在内存中运行更大的模型，” 苏姿丰说，“对于最大的模型，这会减少您需要的GPU数量，加快了性能——尤其是推理——并降低了(总拥有成本，TCO)。”2Y3ednc

换句话说，忘记“the more you buy, the more you save,”(根据Nvidia首席执行官黄仁勋2018年的演讲，大意为买的越多，省的越多)，AMD表示，如果你愿意，你可以使用更少的GPU。总体效果是云服务提供商可以在每个GPU上运行更多的推理任务，降低LLM的成本，使其更容易被生态所接受。它还减少了部署所需的开发时间，苏姿丰说。2Y3ednc

2Y3ednc

根据AMD的计算，与具有80GB内存(推测为Nvidia H100-80GB)的竞争对手GPU相比，各种LLM的FP16精度的推理需要更少的MI300X。Falcon-40B模型需要1个AMD的GPU或2个竞争对手的GPU。PaLM 540B模型需要7个AMD的GPU或15个竞争者的GPU。(来源：AMD)2Y3ednc

AMD还展示了AMD Instinct平台，这是一个8xMI300X的系统(带有2个AMD Genoa主机CPU)，类似于Nvidia的HGX-H100，采用OCP兼容格式。该系统旨在快速轻松地融入现有基础设施。它将在第三季度向主要客户提供样品。2Y3ednc

软件之旅

Nvidia皇冠上的明珠是其成熟的AI和HPC软件栈CUDA。这通常被认为是AI芯片初创公司难以从它这一领导者手中夺取市场份额的关键原因之一。2Y3ednc

“毫无疑问，软件对于使我们的硬件能够得到广泛部署非常重要，” 苏姿丰说，并承认软件是“a journey(一段旅程)”。2Y3ednc

AMD的AI软件栈称为ROCm(“Rock-'em”)，苏姿丰说去年取得了“巨大”进展。2Y3ednc

AMD总裁Victor Peng表示，与Nvidia的CUDA相比，ROCm的“很大一部分”是开放的。开放部分包括驱动程序、语言、运行时刻、AMD的调试器和分析器等工具以及库。ROCm还支持开放框架、模型和工具，以及针对HPC和AI优化的内核。AMD一直在与PyTorch合作，以确保对PyTorch 2.0的零日支持，并测试PyTorch-ROCm堆栈是否能如约运作。2Y3ednc

AMD还宣布了与HuggingFace的新合作。HuggingFace将为AMD Instinct加速器以及AMD边缘产品组合中的其他部分优化其数千个模型。2Y3ednc

HuggingFace首席执行官Clem Delangue上台谈论人工智能的民主化和LLM。2Y3ednc

“当人工智能发展时，硬件不要成为它的瓶颈或守门员，这一点非常重要，”他说，“我们正在努力做的是扩大人工智能建设者在训练和推理方面的选择范围。得益于(MI300X)的内存容量和带宽优势，我们对AMD为数据中心的LLM提供支持的能力感到非常兴奋。”2Y3ednc

原始性能VS时机

虽然MI300X看起来在原始性能上击败了H100，但Nvidia有一些技巧，包括“transformer engine”(转换器引擎)，这是一种软件功能，可以对LLM进行混合精度训练以提高吞吐量。在软件方面，尽管AMD在ROCm上取得了进展，并做出了像OpenAI的Triton这样的努力，但Nvidia的CUDA仍然占据主导地位。软件成熟度一直是该领域初创企业面临的巨大挑战。2Y3ednc

然后是时间问题。Nvidia H100现已上市(如果你能买到的话)，但MI300X直到第四季度才会开始量产。Nvidia预计将在2024年推出其新一代GPU架构，这可能会让MI300X再次处于不利地位。这种节奏意味着AMD将永远跟随，而不是领先。2Y3ednc

未来的AMD GPU可能会继续利用其小芯片技术，而尽管英伟达拥有Grace Hopper超级芯片等多芯片产品，但它尚未以同样的方式转向小芯片。2Y3ednc

更早转向小芯片是否会对AMD有利？似乎不可避免的是，Nvidia最终将不得不转向小芯片(继英特尔和AMD之后)，但这将在多长时间内发生仍不清楚。2Y3ednc

MI300X是否足以从Nvidia手中夺取至少一部分数据中心AI市场份额？考虑到AMD在HPC和数据中心CPU方面的现有客户群，它看起来确实是这样——与初创公司相比，这是一个巨大的优势。2Y3ednc

有一件事是肯定的：这个市场对两个玩家来说足够大。2Y3ednc

(原文刊登于EDN姊妹网站EE Times，参考原文：Can AMD’s MI300X Take On Nvidia’s H100?，由Ricardo Xie编译。)2Y3ednc

2Y3ednc

责编：Ricardo

本文为电子技术设计原创文章，未经授权禁止转载。请尊重知识产权，违者本司保留追究责任的权利。

阅读全文，请先

上一篇： AMD展示“锐龙9 5950X3D”原型，201MB缓存 下一篇： 四种不同技术的接近式传感器性能对比

微信扫一扫
一键转发
最前沿的电子设计资讯
请关注“电子技术设计微信公众号”

毫米波雷达与音频技术重塑汽车驾乘新体验汽车行业的发展正由两大创新领域主导：更为精准可靠的车内感知系统和高质量音频系统。传统方法如增加传感器或音频设备数量，虽可提升性能但会带来成本上升和复杂性增加的问题。
谷歌Willow芯片5分钟完成10亿亿亿年计算，突破量子纠错3 近日，谷歌宣布了其新一代量子处理器Willow的诞生，这款量子计算芯片采用105个量子比特的设计，完成了全球量子计算历史上一个难以企及的里程碑，让长达近30年的“量子纠错”难题成为过去···
天玑9400详解：AI时代，旗舰芯拿什么引领？联发科将最近刚刚发布的天玑9400称为旗舰5G“智能体AI芯片”——所谓的“智能体”究竟是什么意思？对手机又有什么价值？本文详细剖析了天玑9400的关键技术，来尝试一探究竟...
超英特尔12.5%？AMD锐龙9 9950X跑分48011功耗只有309W AMD的最新旗舰处理器锐龙9000系列也将在7月31日解禁上市，相关爆料显示AMD锐龙9 9950X 处理器在160W功耗的情况下性能就可以媲美英特尔的14900KS···
高通骁龙X Elite产品上市：跑分不敌苹果，兼容还有问题？前不久，首批搭载高通骁龙X Elite的笔记本产品陆续上市，那么这颗已经发布大半年的骁龙处理器在实际使用中的表现到底有没有宣传的那么强？
高通骁龙X笔记本实测结果曝光？成本低一半、续航长98% 根据相关消息的预测，搭载骁龙X系列处理器的PC预计将在2024年年中才会上市，而在最近有关于搭载该系列处理器的产品的更多细节被曝光出来···
Arm云服务器处理器测试排行，第一是中国的芯片新加坡国立大学的研究团队对市面上所有可用的Arm服务器处理器进行了测试，测试结果显示在超大规模云中处理数据库相关任务方面，2021年由阿里云开发的倚天710是当前速度最快的Arm服务器处理器···
高通又发骁龙X Plus芯片，要用AI PC挑战英特尔和苹果？ 4月24日，高通再次推出一款新的AI PC处理器平台——骁龙X Plus···
苹果M系列芯片被曝硬件架构漏洞，无法直接修复安全专家在苹果M系列芯片中发现了一个新的安全漏洞，使用该漏洞的攻击方式被命名为GoFetch，这种攻击方式使用的应用程序不需要root访问权限，只需要与macOS系统上安装的大多数第三方应用程序所需的相同用户权限，黑客就可窃取用户数据。
英特尔i9-14900KS超频至9117MHz，发布就打破4项世界纪录五年前英特尔发布了第一颗采用KS后缀的处理器酷睿i9-9900KS，虽然在10代和11代停更了两代，但之后基本保持了一年一颗的频率，也就是12代的酷睿i9-12900KS，以及后续13代的酷睿i9-13900KS，而今酷睿i9-14900KS也来了···
苹果最新MacBook Air“翻车”？M3处理器最高飙到114℃ 新款MacBook Air在运行3DMark Wild Life Extreme、CineBench 2024等测试项目时，M3处理器在测试中温度多次达到惊人的114℃，在CPU测试中即使降频后最高温度也有107℃，而机身最高达到了46℃···
骁龙8 Gen 4发布时间提前，高通或采用自研Nuvia架构？在2月举办的2024巴塞罗那世界移动通信大会（MWC 2024）上，高通高级副总裁兼首席营销官Don McGuire就宣布了2024年的骁龙峰会的举办时间，也就是今年10月，届时高通将发布旗舰产品骁龙8 Gen 4平台···

机器人所需要的传感器有哪些？随着机器人技术的迭代升级，传感器的重要性将持续提升，其功能性、精度和适配性也将得到显著改进，作为机器人不可
2024年墨西哥市场分析，中国品牌崛起 2024年，墨西哥汽车市场以近10%的增长率展现了强劲的复苏势头，中国品牌的崛起为市场注入了新活力，当然现在的政
2025，大众汽车集团在中国如何转型？ 2024 年，大众汽车集团（中国）在复杂多变的市场环境中成功达成销量目标，向客户交付超过 290 万辆汽车，新能源汽车领
国产射频芯片公司汇总对于射频芯片这项卡脖子技术，国内很多公司在这方面努力，而且也做出了不错的成绩。一些射频芯片公司无论从研发
拆解报告：松下电器1200W电吹风松下EH-NW90电吹风内置10万转高速无刷电机，并具备三档风速和四档风温可选。电吹风内置纳诺怡技术，为秀发提供
拆解报告：白牌电动工具电池多功能放电转换器这款白牌多功能放电转换器适配得伟电动工具电池使用，将电动工具电池和放电转换器组装起来，即可组成移动电源和
拆解报告：MOMA猛玛LARK M2无线麦克风 MOMA猛玛LARK M2无线麦克风在外观方面，采用了极富创新的设计，提供了轻盈舒适的佩戴使用体验。发射器采用了夹
阿根廷2024年：销量下滑，北汽增长240.1%。 2024年阿根廷汽车市场在整体销量下滑的背景下，依然展现出多元化的发展趋势···
2025年第3周：全球最快四足机器人发布 2025年将成为机器人产业的关键时间点，业内预期27年人形机器人出货量可达50~100万台。从技术进步到供应链成熟
欧洲2024年汽车市场：微弱复苏和电动化加速并存 2024年，欧盟新车注册量小幅增长0.8%，达到约1060万辆，欧盟+英国+北欧国家的销量为1296.4万台，同比增长0.9%，整个欧
射频微波领域有哪些高质量期刊？今天我们结合网络上的资料一起整理一份射频微波领域的期刊列表，以便同学们投稿时可以选择···
拆解报告：Portal智能屏幕24W电源适配器 Portal智能屏幕电源适配器采用黑色直板机身，外观整洁，配有2米长黑色输出线。适配器采用美规固定插脚，支持100-2

性能飞跃！升级电流传感器NSM201x-P系列赋能汽车三电和光伏逆变器纳芯微推出全新车规级集成电流路径霍尔传感器NSM201x-P系列。该系列产品是对纳芯微已量产的NSM201x系列的完
意法半导体推出STSPIN32G0新列电机驱动器，满足工业自动化和家电市意法半导体STSPIN32系列集成化电机驱动器新增八款产品，满足电动工具、家用电器、工业自动化等应用的低成本、
Melexis推出性能先进的温度传感器，以红外技术创新实现电磁炉智能全球微电子工程公司Melexis宣布，推出专为电磁炉设计的非接触式红外温度传感器芯片MLX90617···
康佳特SMARC模块更新: 全新英特尔酷睿3处理器低功耗 SMARC 模块AI 加速和图形处理性能再次提升···
康佳特针对要求苛刻的实时应用推出新型高性能COM-HPC模块基于英特尔酷睿 Bartlett Lake S处理器的模块性能全面提升···
为汽车安全保驾护航，纳芯微推出基于AMR技术的ABS轮速传感器纳芯微宣布推出全新基于AMR（各向异性磁阻技术）的轮速传感器NSM41xx系列。该系列产品通过集成先进的磁性传感敏
Microchip推出全新Switchtec™ PCIe® 4.0 16通道交换机系列 PCI100x系列器件可为任何需要加速或专用计算的应用提供高性能和成本效益···
RK3576有多强？实测三屏八摄像头轻松搞定-米尔米尔基于他们推出的MYD-LR3576开发板开发了一个3屏异显，8路摄像头输入的DEMO，实测下来，RK3576轻松搞定了该任
SynQor®推荐先进的军用级三相输入UPS（UPS-1500-S-1U-T） SynQor的三相输入UPS电源能使单相负载在电源端呈现出符合MIL-STD-1399-300B标准的清洁、表现良好且几乎零反
村田开发超小尺寸、超低功耗的Type 2GQ GNSS模块，以匠心品质助在几年前，定位系统充斥于生活方方面面的情节还仅见于各式的科幻影片，而今具备这一功能的产品已经以各种形态步
瑞萨推出性能卓越的新型MOSFET 瑞萨全新晶圆技术可以帮助MOSFET实现导通电阻降低30%、栅漏电荷减少40%、封装尺寸缩小50%的目标···
加特兰集成 Cadence Tensilica ConnX 220 DSP 全面升级汽 ConnX 220 DSP 集成至基于下一代 Andes SoC 的加特兰雷达解决方案后，将带来显著优势，包括提高灵活性、

热门评论
最新评论

换一换

杂志声明

AMD的MI300X能否挑战Nvidia的H100？

软件之旅

原始性能VS时机