华为AI芯片的“秘密武器”：达芬奇架构实力究竟如何？-EDN 电子技术设计

 2019年6月，华为发布全新8系列手机SoC芯片麒麟810，首次采用华为自研达芬奇架构NPU，实现业界领先端侧AI算力，在业界公认的苏黎世联邦理工学院推出的AI Benchmark榜单中，搭载麒麟810的手机霸榜TOP3，堪称华为AI芯片的“秘密武器”，这其中华为自研的达芬奇架构举足轻重。那么，达芬奇架构AI实力究竟怎么样？一起来深入了解下。

2019年6月，华为发布全新8系列手机SoC芯片麒麟810，首次采用华为自研达芬奇架构NPU，实现业界领先端侧AI算力，在业界公认的苏黎世联邦理工学院推出的AI Benchmark榜单中，搭载麒麟810的手机霸榜TOP3，堪称华为AI芯片的“秘密武器”，这其中华为自研的达芬奇架构举足轻重。JAsednc

JAsednc

2019年8月20日数据JAsednc

那么，达芬奇架构AI实力究竟怎么样？一起来深入了解下。JAsednc

源起：为什么要做达芬奇架构？

华为预测，到2025年全球的智能终端数量将会达到400亿台，智能助理的普及率将达到90%，企业数据的使用率将达到86%。可以预见，在不久的将来，AI将作为一项通用技术极大地提高生产力，改变每个组织和每个行业。JAsednc

基于这样的愿景，华为在2018全联接大会上提出全栈全场景AI战略。作为重要的技术基础，AI芯片在其中发挥着重要作用，而华为也基于AI芯片提供了完整的解决方案，加速使能AI产业化。JAsednc

为了实现AI在多平台多场景之间的协同，华为创新设计达芬奇计算架构，在不同体积和功耗条件下提供强劲的AI算力。JAsednc

初见：达芬奇架构的核心优势

达芬奇架构，是华为自研的面向AI计算特征的全新计算架构，具备高算力、高能效、灵活可裁剪的特性，是实现万物智能的重要基础。JAsednc

具体来说，达芬奇架构采用3D Cube针对矩阵运算做加速，大幅提升单位功耗下的AI算力，每个AI Core可以在一个时钟周期内实现4096个MAC操作，相比传统的CPU和GPU实现数量级的提升。JAsednc

012ednc20190822 JAsednc

3D CubeJAsednc

同时，为了提升AI计算的完备性和不同场景的计算效率，达芬奇架构还集成了向量、标量、硬件加速器等多种计算单元。同时支持多种精度计算，支撑训练和推理两种场景的数据精度要求，实现AI的全场景需求覆盖。JAsednc

深耕：达芬奇架构的AI硬实力

科普1：常见的AI运算类型有哪些？JAsednc

在了解达芬奇架构的技术之前，我们先来弄清楚一下几种AI运算数据对象：JAsednc

标量（Scalar）：由单独一个数组成JAsednc
向量（Vector）：由一组一维有序数组成，每个数由一个索引（index）标识JAsednc
矩阵（Matrix）：由一组二维有序数组成，每个数由两个索引（index）标识JAsednc
张量（Tensor）：由一组n维有序数组成，每个数由n个索引（index）标识JAsednc

其中，AI计算的核心是矩阵乘法运算，计算时由左矩阵的一行和右矩阵的一列相乘，每个元素相乘之后的和输出到结果矩阵。JAsednc

在此计算过程中，标量（Scalar）、向量（Vector）、矩阵（Matrix）算力密度依次增加，对硬件的AI运算能力不断提出更高要求。典型的神经网络模型计算量都非常大，这其中99%的计算都需要用到矩阵乘，也就是说，如果提高矩阵乘的运算效率，就能最大程度上提升AI算力——这也是达芬奇架构设计的核心：以最小的计算代价增加矩阵乘的算力，实现更高的AI能效。科普2：各单元角色分工揭秘，Da Vinci Core是如何实现高效AI计算的？JAsednc

在2018年全联接大会上，华为推出AI芯片Ascend 310（昇腾310），这是达芬奇架构的首次亮相。JAsednc

013ednc20190822 JAsednc

其中，Da Vinci Core只是NPU的一个部分，Da Vinci Core内部还细分成很多单元，包括核心的3D Cube、Vector向量计算单元、Scalar标量计算单元等，它们各自负责不同的运算任务实现并行化计算模型，共同保障AI计算的高效处理。JAsednc

014ednc20190822 JAsednc

3D Cube矩阵乘法单元：算力担当JAsednc

刚才已经提到，矩阵乘是AI计算的核心，这部分运算由3D Cube完成，Buffer L0A、L0B、L0C则用于存储输入矩阵和输出矩阵数据，负责向Cube计算单元输送数据和存放计算结果。JAsednc

Vector向量计算单元：灵活的多面手JAsednc

虽然Cube的算力很强大，但只能完成矩阵乘运算，还有很多计算类型要依靠Vector向量计算单元来完成。Vector的指令相对来说非常丰富，可以覆盖各种基本的计算类型和许多定制的计算类型。JAsednc

Scalar标量计算单元：流程控制的管家JAsednc

Scalar标量运算单元主要负责AI Core的标量运算，功能上可以看作一个小CPU，完成整个程序的循环控制，分支判断，Cube、Vector等指令的地址和参数计算以及基本的算术运算等。科普3：3D Cube计算方式的独特优势是什么？JAsednc

不同于以往的标量、矢量运算模式，华为达芬奇架构以高性能3D Cube计算引擎为基础，针对矩阵运算进行加速，大幅提高单位面积下的AI算力，充分激发端侧AI的运算潜能。JAsednc

以两个N*N的矩阵A*B乘法为例：如果是N个1D 的MAC，需要N^2（即N的2次方）的cycle数；如果是1个N^2的2D MAC阵列，需要N个Cycle；如果是1个N维3D的Cube，只需要1个Cycle。JAsednc

015ednc20190822 JAsednc

图中计算单元的数量只是示意，实际可灵活设计JAsednc

华为创新设计的达芬奇架构将大幅提升算力，16*16*16的3D Cube能够显著提升数据利用率，缩短运算周期，实现更快更强的AI运算。JAsednc

这是什么意思呢？举例来说，同样是完成4096次运算，2D结构需要64行*64列才能计算，3D Cube只需要16*16*16的结构就能算出。其中，64*64结构带来的问题是：运算周期长、时延高、利用率低。达芬奇架构的这一特性也完美体现在麒麟810上。作为首款采用达芬奇架构NPU的手机SoC芯片，麒麟810实现强劲的AI算力，在单位面积上实现最佳能效，FP16精度和INT8量化精度业界领先，搭载这款SoC芯片的华为Nova 5、Nova 5i Pro及荣耀9X手机已上市，为广大消费者提供多种精彩的AI应用体验。同时，麒麟810再度赋能HiAI生态，支持自研中间算子格式IR开放，算子数量多达240+，处于业内领先水平。更多算子、开源框架的支持以及提供更加完备的工具链将助力开发者快速转换集成基于不同AI框架开发出的模型，极大地增强了华为HiAI移动计算平台的兼容性、易用性，提高开发者的效率，节约时间成本，加速更多AI应用的落地。JAsednc

016ednc20190822 JAsednc

预见：达芬奇架构解锁AI无限可能

基于灵活可扩展的特性，达芬奇架构能够满足端侧、边缘侧及云端的应用场景，可用于小到几十毫瓦，大到几百瓦的训练场景，横跨全场景提供最优算力。JAsednc

017ednc20190822 JAsednc

以Ascend芯片为例，Ascend-Nano可以用于耳机电话等IoT设备的使用场景；Ascend-Tiny和Ascend-Lite用于智能手机的AI运算处理；在笔记本电脑等算力需求更高的便携设备上，由Ascend-Mini提供算力支持；而边缘侧服务器上则需要由Multi-Ascend 310完成AI计算；至于超复杂的云端数据运算处理，则交由算力最高可达256 TFLOPS@FP16的Ascend-Max来完成。JAsednc

正是由于达芬奇架构灵活可裁剪、高能效的特性，才能实现对上述多种复杂场景的AI运算处理。同时，选择开发统一架构也是一个非常关键的决策。统一架构优势很明显，那就是对广大开发者非常利好。基于达芬奇架构的统一性，开发者在面对云端、边缘侧、端侧等全场景应用开发时，只需要进行一次算子开发和调试，就可以应用于不同平台，大幅降低了迁移成本。JAsednc

不仅开发平台语言统一，训练和推理框架也是统一的，开发者可以将大量训练模型放在本地和云端服务器，再将轻量级的推理工作放在移动端设备上，获得一致的开发体验。JAsednc

018ednc20190822 JAsednc

在算力和技术得到突破性提升后，AI将广泛应用于智慧城市、自动驾驶、智慧新零售、机器人、工业制造、云计算AI服务等场景。华为轮值董事长徐直军在2018华为全联接大会上表示，“全场景意味着可以实现智能无所不及，全栈意味着华为有能力为AI应用开发者提供强大的算力和应用开发平台；有能力提供大家用得起、用得好、用得放心的AI，实现普惠AI”。未来，AI将应用更加广泛的领域，并逐渐覆盖至生活的方方面面。达芬奇架构作为AI运算的重要技术基础，将持续赋能AI应用探索，为各行各业的AI应用场景提供澎湃算力。JAsednc

8月23日，采用达芬奇架构的又一款“巨无霸”——AI芯片Ascend 910，将正式商用发布，与之配套的新一代AI开源计算框架MindSpore也将同时亮相，今年9月的华为全联接大会上，又将有哪些重量级新品呢？敬请关注！JAsednc

（来源：华为）JAsednc

阅读全文，请先

人工智能处理器/DSP 产业前沿

上一篇： 科技巨头推出力推动高速以太网络发展 下一篇： CPU顶盖为啥不用散热更好的银？

微信扫一扫
一键转发
最前沿的电子设计资讯
请关注“电子技术设计微信公众号”

创新的FPGA技术实现低功耗、模块化、小尺寸USB解决方本文总结了业界用于高性能 USB 3 设备的一些典型解决方案，并介绍了一种新的架构，这种架构既能节省功耗和面积，又能提高灵活性和易用性···
盘点CES 2025上基于Arm架构的AI创新和技术亮点近期在美国拉斯维加斯举行的 CES 2025 再次彰显了其作为展示最新科技创新的重要平台。今年展会上所呈现的众多前沿产品和新的发布将推动各个行业的变革与发展···
芯耀辉：从传统IP到IP2.0，AI时代国产IP机遇与挑战齐飞 2024年，集成电路行业在变革与机遇中持续发展。面对全球经济的新常态、技术创新的加速以及市场需求的不断变化，集成电路企业如何在新的一年里保持竞争力并实现可持续发展？
Arm 技术预测：2025 年及未来的技术趋势 Arm 对 2025 年及未来的技术发展做出了预测，范围涵盖技术的各个方面，从 AI 的未来发展到芯片设计，再到不同技术市场的主要趋势···
该如何设计PCB以保证恶劣环境下的信号完整性在现代电子设计中，保持PCB信号完整性是一项越来越具有挑战性的任务···
CES 2025：洞察汽车创新未来从CES 2025的汽车方案展示可以看到，汽车OEM正从黑盒解决方案转变为区域架构为主的处理主干，传感器功能也逐渐优化，结合多模态输入数据与情境感知的 ML...
CES 2025：Edge AI硬件加速再掀热潮边缘计算/边缘人工智能(Edge AI)一直是热门话题，在CES 2025也不例外。然而，实现边缘计算/智能的底层硬件是什么？又是如何实现与应用的呢？
英伟达50系列显卡发布，RTX 5090D近乎“零提升”？ 1月6日的CES展会上，英伟达正式发布了备受期待的RTX 50系列显卡···
全自动手术机器人出现，缝合速度比医生还快30%？美国约翰霍普金斯大学和斯坦福大学的联合团队创造了一项前所未有的突破，他们首次对机器人进行了训练，使其能够像人类医生一样熟练地执行相同的手术程序···
2024是AI MCU元年？ 2024年开启了MCU领域的AI时代，2025年可望见证更多轻量化AI模型在MCU上的进一步突破...
探索工业应用中边缘连接的未来我们的世界正变得更加智能且紧密相连，楼宇和工厂正以前所未有的方式实现自动化。为了确保这些新系统有效运行，可靠的信息通信至关重要···
其实CPU才是最适合AI推理的？因为这五大理由本文将具体介绍CPU成为AI推理工作负载最佳目标的五大理由···

机器人所需要的传感器有哪些？随着机器人技术的迭代升级，传感器的重要性将持续提升，其功能性、精度和适配性也将得到显著改进，作为机器人不可
2024年墨西哥市场分析，中国品牌崛起 2024年，墨西哥汽车市场以近10%的增长率展现了强劲的复苏势头，中国品牌的崛起为市场注入了新活力，当然现在的政
2025，大众汽车集团在中国如何转型？ 2024 年，大众汽车集团（中国）在复杂多变的市场环境中成功达成销量目标，向客户交付超过 290 万辆汽车，新能源汽车领
国产射频芯片公司汇总对于射频芯片这项卡脖子技术，国内很多公司在这方面努力，而且也做出了不错的成绩。一些射频芯片公司无论从研发
拆解报告：松下电器1200W电吹风松下EH-NW90电吹风内置10万转高速无刷电机，并具备三档风速和四档风温可选。电吹风内置纳诺怡技术，为秀发提供
拆解报告：白牌电动工具电池多功能放电转换器这款白牌多功能放电转换器适配得伟电动工具电池使用，将电动工具电池和放电转换器组装起来，即可组成移动电源和
拆解报告：MOMA猛玛LARK M2无线麦克风 MOMA猛玛LARK M2无线麦克风在外观方面，采用了极富创新的设计，提供了轻盈舒适的佩戴使用体验。发射器采用了夹
阿根廷2024年：销量下滑，北汽增长240.1%。 2024年阿根廷汽车市场在整体销量下滑的背景下，依然展现出多元化的发展趋势···
2025年第3周：全球最快四足机器人发布 2025年将成为机器人产业的关键时间点，业内预期27年人形机器人出货量可达50~100万台。从技术进步到供应链成熟
欧洲2024年汽车市场：微弱复苏和电动化加速并存 2024年，欧盟新车注册量小幅增长0.8%，达到约1060万辆，欧盟+英国+北欧国家的销量为1296.4万台，同比增长0.9%，整个欧
射频微波领域有哪些高质量期刊？今天我们结合网络上的资料一起整理一份射频微波领域的期刊列表，以便同学们投稿时可以选择···
拆解报告：Portal智能屏幕24W电源适配器 Portal智能屏幕电源适配器采用黑色直板机身，外观整洁，配有2米长黑色输出线。适配器采用美规固定插脚，支持100-2

性能飞跃！升级电流传感器NSM201x-P系列赋能汽车三电和光伏逆变器纳芯微推出全新车规级集成电流路径霍尔传感器NSM201x-P系列。该系列产品是对纳芯微已量产的NSM201x系列的完
意法半导体推出STSPIN32G0新列电机驱动器，满足工业自动化和家电市意法半导体STSPIN32系列集成化电机驱动器新增八款产品，满足电动工具、家用电器、工业自动化等应用的低成本、
Melexis推出性能先进的温度传感器，以红外技术创新实现电磁炉智能全球微电子工程公司Melexis宣布，推出专为电磁炉设计的非接触式红外温度传感器芯片MLX90617···
康佳特SMARC模块更新: 全新英特尔酷睿3处理器低功耗 SMARC 模块AI 加速和图形处理性能再次提升···
康佳特针对要求苛刻的实时应用推出新型高性能COM-HPC模块基于英特尔酷睿 Bartlett Lake S处理器的模块性能全面提升···
为汽车安全保驾护航，纳芯微推出基于AMR技术的ABS轮速传感器纳芯微宣布推出全新基于AMR（各向异性磁阻技术）的轮速传感器NSM41xx系列。该系列产品通过集成先进的磁性传感敏
Microchip推出全新Switchtec™ PCIe® 4.0 16通道交换机系列 PCI100x系列器件可为任何需要加速或专用计算的应用提供高性能和成本效益···
RK3576有多强？实测三屏八摄像头轻松搞定-米尔米尔基于他们推出的MYD-LR3576开发板开发了一个3屏异显，8路摄像头输入的DEMO，实测下来，RK3576轻松搞定了该任
SynQor®推荐先进的军用级三相输入UPS（UPS-1500-S-1U-T） SynQor的三相输入UPS电源能使单相负载在电源端呈现出符合MIL-STD-1399-300B标准的清洁、表现良好且几乎零反
村田开发超小尺寸、超低功耗的Type 2GQ GNSS模块，以匠心品质助在几年前，定位系统充斥于生活方方面面的情节还仅见于各式的科幻影片，而今具备这一功能的产品已经以各种形态步
瑞萨推出性能卓越的新型MOSFET 瑞萨全新晶圆技术可以帮助MOSFET实现导通电阻降低30%、栅漏电荷减少40%、封装尺寸缩小50%的目标···
加特兰集成 Cadence Tensilica ConnX 220 DSP 全面升级汽 ConnX 220 DSP 集成至基于下一代 Andes SoC 的加特兰雷达解决方案后，将带来显著优势，包括提高灵活性、

热门评论
最新评论

换一换

杂志声明

华为AI芯片的“秘密武器”：达芬奇架构实力究竟如何？

源起：为什么要做达芬奇架构？

初见：达芬奇架构的核心优势

深耕：达芬奇架构的AI硬实力

预见：达芬奇架构解锁AI无限可能