TinyML计算机视觉正在通过微型神经处理器(μNPU)变成现实-EDN 电子技术设计

 随着硬件成本的降低、计算能力的显著提高，以及用新方法训练和部署模型变得更加容易，无处不在的基于机器学习的边缘视觉处理正在不断发展。这减少了采用的障碍，并增加了计算机视觉人工智能在边缘的使用。

如今，计算机视觉(CV)技术正处于一个拐点，主要趋势在不断融合，使云技术在微型边缘人工智能设备中变得无处不在。技术进步正在使这种以云为中心的人工智能技术扩展到边缘，而新的发展将使边缘人工智能的愿景变得普遍。p8aednc

三大技术趋势促成了这一演变。新的瘦神经网络算法适合微型设备的存储空间和计算能力。与传统微控制器(MCU)相比，新硅片架构的神经网络处理效率提高了几个数量级。适用于小型微处理器的人工智能框架正在日趋成熟，因此减少了在边缘开发微型机器学习(tinyML)实现的障碍。p8aednc

当所有这些元素结合在一起时，毫瓦级的微型处理器可以托管强大的神经处理单元，这些单元可以利用成熟且易于使用的开发工具链执行极其高效的卷积神经网络CNN(视觉处理最常见的机器学习架构)。这将在我们生活的方方面面带来令人兴奋的新用例。p8aednc

计算机视觉在边缘的前景

数字图像处理(过去的称呼)的应用范围广泛，从半导体制造和检查到高级驾驶辅助系统(ADAS)功能(例如车道偏离警告和盲点检测)，再到移动设备上的图像美化和操作。展望未来，边缘计算机视觉技术将能实现更高水平的人机界面(HMI)。p8aednc

过去十年来，HMI取得了显著的发展。除了传统的键盘和鼠标等界面之外，现在还具有了触摸显示屏、指纹识别器、面部识别系统和语音命令功能。虽然这些方法明显改善了用户体验，但它们还有另一个共同属性——它们都会对用户操作做出反应。HMI的下一个阶段将是能通过上下文感知了解用户及其环境的设备。p8aednc

上下文感知设备不仅可以感知用户，还可以感知他们的操作环境，所有这些都是为了做出更好的决策，实现更有用的自动化交互。例如，笔记本电脑可以通过视觉感知用户何时集中注意力，并可以相应地调整其行为和电源策略。Synaptics的Emza Visual Sense技术已经实现了这一点，原始设备制造商(OEM)可以利用该技术在用户不观看显示屏时自适应调暗显示屏，从而降低功耗(图1)。通过跟踪旁观者的眼球(旁观者检测)，该技术还可以通过提醒用户并隐藏屏幕内容直到安全为止来增强安全性。p8aednc

p8aednc

图1：戴尔笔记本电脑使用Synaptics的Emza Visual Sense来实现智能隐私和效率功能，例如“视线移开检测”自适应屏幕调暗。(图片来源：Synaptics)p8aednc

另一个例子是，智能电视机可以感知是否有人在观看以及从哪里观看，然后相应地调整图像质量和声音。当无人在场时，它可以自动关闭以节省电量。或者，空调系统可根据房间占用情况优化电力和气流，以节省能源成本。从财务角度来看，建筑物中智能能源利用的这些例子对于家庭办公混合工作模式来说变得更加重要。p8aednc

从面向安全监管的对象检测(即限制区域、安全通道、防护装备执行)到面向制造过程控制的异常检测，视觉传感在工业领域也有无数的用例。在农业科技领域，计算机视觉技术支持的作物检验以及状态和质量监控都至关重要。p8aednc

无论是在笔记本电脑、消费电子产品、智能楼宇传感器还是在工业环境中，当微型便宜的微处理器、微型神经网络和优化的人工智能框架使设备更加智能和节能时，这种环境计算能力就得以实现。p8aednc

神经网络视觉处理的发展

随着Alex Krizhevsky及其同事发布AlexNet，2012年成为了计算机视觉开始从启发式计算机视觉方法转向深度卷积神经网络(DCNN)的转折点。那年DCNN赢得ImageNet大规模视觉识别挑战赛(ILSVRC)后就一发不可收了。p8aednc

从那时起，全球各地的团队不断寻求更高的检测性能，但不太关心底层硬件的效率。因此，CNN仍然需要大量的数据和计算。这种对性能的关注对于在云基础设施中运行的应用程序来说是很好的。p8aednc

2015年，ResNet152推出。它有6000万个参数，单次推理操作需要超过11Gflops，并且在ImageNet数据集上表现出94%的top-5准确率。这继续推动了CNN的性能和准确性。但直到2017年，随着Google的一组研究人员发布MobileNet，我们才看到了效率的提升。p8aednc

MobileNet(针对智能手机)比当时已有的神经网络(NN)架构要轻得多。以MobileNet V2为例，它有350万个参数，需要336Mflops。这种大幅减少最初是通过艰苦的劳动实现的——手动识别深度学习网络中的层，这并没有增加太多的准确性。后来，自动化架构搜索工具进一步改进了层的数量和组织。MobileNet V2在内存和计算负载方面比ResNet192“轻”大约20倍，展示了90%的top-5准确率。一组新的移动友好型应用程序现在可以使用人工智能。p8aednc

硬件也在不断发展

借助更小的神经网络并清楚地了解所涉及的工作负载，开发人员现在可以为微型人工智能设计优化的芯片。这催生了μNPU。通过严格管理内存组织和数据流，同时利用大规模并行性，这些小型专用内核执行神经网络推理的速度比典型MCU中的独立CPU快10倍或100倍。Arm Ethos U55 microNPU就是一个例子。p8aednc

p8aednc

图2：身体关键点估计等复杂的CNN模型，正在带有NPU的新一代微控制器上运行。(图片来源：Synaptics)p8aednc

让我们看一下μNPU影响的具体示例。计算机视觉的基本任务之一是目标检测。对象检测本质上需要执行两项任务：定位(确定对象在图像中的位置)和分类(识别检测到的对象)(图2)。p8aednc

Emza在Ethos U55 μNPU上实现了人脸检测模型，训练了对象检测和分类模型，也即单次检测器的轻量级版本，它经过Synaptics优化，仅检测人脸类别。结果令我们惊讶，模型执行时间不到5ms：这与强大的智能手机应用处理器(如Snapdragon 845)的执行速度相当。当使用四个Cortex A53内核在Raspberry Pi 3B上执行相同的模型时，执行时间延长六倍。p8aednc

人工智能框架和民主化

所有像机器学习这样复杂的技术的广泛采用，都需要有良好的开发工具。Google的TensorFlow Lite for Microcontrollers(TFLM)是一个旨在更轻松地训练和部署tinyML AI的框架。对于完整TensorFlow涵盖的运算符子集，TFLM会为解释器和在μNPU上运行的模型发出微处理器C代码。来自Meta的PyTorch Mobile框架和Glow编译器也瞄准了这一领域。此外，如今有相当多的人工智能自动化平台(称为AutoML)，可以对微小目标的人工智能部署的某些方面自动化。例子包括Edge Impulse、Deeplite、Qeexo和SensiML。p8aednc

但为了能够在特定硬件和μNPU上执行，必须修改编译器和工具链。Arm开发了Vela编译器，可优化U55 μNPU的CNN模型执行。Vela编译器通过自动在CPU和µNPU之间拆分模型执行任务，使包含CPU和μNPU的系统变得简单。p8aednc

更广泛地说，Apache TVM是一个适用于CPU、GPU、NPU和加速器的开源端到端机器学习编译器框架。TVM micro的目标是微控制器，其愿景是能在所有硬件上运行所有人工智能模型。AI框架、AutoML平台和编译器的演变，使开发人员可以更轻松地利用新的μNPU来满足其特定需求。p8aednc

无处不在的边缘人工智能

基于机器学习的边缘视觉处理正变得无处不在。硬件成本正在下降，计算能力正在显著增强，新的方法使训练和部署模型变得更加容易。所有这些都减少了采用的障碍，并增加了计算机视觉AI在边缘的使用。p8aednc

即使微型边缘人工智能变得越来越普遍，我们仍然还有很多工作要做。为了使环境计算成为现实，我们需要为许多细分市场的长尾用例提供服务，这可能会带来可扩展性挑战。在消费品、工厂、农业、零售等领域，每项新任务都需要不同的算法和独特的数据集进行训练。解决每个用例所需的研发投资和技能组合，仍然是当今的主要障碍。p8aednc

人工智能公司可以通过开发丰富的模型示例(“模型动物园”)和应用程序参考代码来围绕其NPU产品升级软件，从而最好地填补这一空白。在此过程中，它们可以实现更广泛的长尾应用，同时通过针对目标硬件优化正确的算法来确保设计成功，以在规定的成本、尺寸和功耗限制内解决特定的业务需求。p8aednc

参考文献

Krizhevsky A, Sutskever I, Hinton GE (2012) ImageNet Classification with Deep Convolutional Neural Networks. NIPS’12 Proc 25th Int Conf Neural Inf Process Syst 1:1097–1105p8aednc

MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications https://arxiv.org/pdf/1704.04861.pdfp8aednc

Elad Baram是Synaptics公司低功耗人工智能总监。他于2023年随着Synaptics收购Emza Products加入该公司。Baram此前曾在SanDisk担任产品管理职务。他拥有以色列本古里安大学通信系统工程学士学位。p8aednc

（原文刊登于EDN姊妹网站Embedded，参考链接：TinyML computer vision is turning into reality with microNPUs (µNPUs)，由Franklin Zhao编译。）p8aednc

责编：Franklin

本文为电子技术设计原创文章，未经授权禁止转载。请尊重知识产权，违者本司保留追究责任的权利。

阅读全文，请先

处理器/DSP 人工智能技术实例 EDN原创

上一篇： 传感器与人工智能融合改变智能制造时代 下一篇： 最大限度地降低无源PWM纹波滤波器输出阻抗：能降到多低？

微信扫一扫
一键转发
最前沿的电子设计资讯
请关注“电子技术设计微信公众号”

康佳特SMARC模块更新: 全新英特尔酷睿3处理器低功耗 SMARC 模块AI 加速和图形处理性能再次提升···
康佳特针对要求苛刻的实时应用推出新型高性能COM-HPC 基于英特尔酷睿 Bartlett Lake S处理器的模块性能全面提升···
兆易创新推出EtherCAT®从站控制芯片，工业自动化的卓越业界领先的半导体器件供应商兆易创新GigaDevice（股票代码 603986）宣布，正式推出EtherCAT®从站控制芯片···
瑞萨率先推出采用车规3nm制程的多域融合SoC 第五代R-Car SoC为集中式E/E架构，带来面向未来的多域融合解决方案，并支持Chiplet扩展···
艾迈斯欧司朗Belago红外LED，助力Supernode打造高精度避 Supernode与艾迈斯欧司朗携手，通过Belago红外LED实现精准扫地机器人避障；得益于Belago出色的红外补光功能，使扫地机器人能够大大提升其识别物体的能力，实现精准避障；Belago点阵照明器采用迷你封装，兼容标准无铅回流工艺，适用于各种3D传感平台，包括移动设备、物联网设备和机器人。
Nordic Semiconductor推出nRF54L15、nRF54L10 和 n 新型先进低功耗蓝牙SoC 带来更高效率和超强处理能力，为广泛物联网应用提高性能和灵活性···
AMD 宣布推出第二代 Versal Premium 系列，实现全新以业界首款采用 CXL 3.1 及 PCIe Gen6 并支持 LPDDR5 的 FPGA 器件扩展第二代 Versal 产品组合，助力快速连接、更高效数据迁移并释放更多内存···
英特尔加码“分散式 GPU 架构” 本月初，英特尔终于获得了其分散式GPU架构的专利，这很可能是第一个带有逻辑芯片的商用 GPU 架构，同时还允许对未用于处理工作负载的芯片进行电源门控。
AMD 以全球极快的纤薄尺寸电子交易加速卡扩展 Alveo AMD Alveo UL3422 加速卡为高频交易员在争夺最快交易执行的竞争中提供了优势，同时降低了进入门槛···
瑞萨推出高能效第四代R-Car车用SoC引领ADAS产品创新全新的R-Car V4M和R-Car V4H SoC产品面向大规模L2及L2+ADAS市场，同时保持现有R-Car产品的可扩展性与软件复用性···
Nordic Semiconductor 即将推出的 nRF54 系列 So 随着蓝牙技术联盟（Bluetooth SIG）将信道探测技术作为蓝牙 6.0 的一部分，Nordic 即将发布的 nRF54 系列中将采用该技术。
借助 AMD Kria SOM 通过混合方式实现分布式计算分布式计算的混合方法可以通过在边缘端使用可扩展、高效且低功耗的自适应计算平台来实现，这种平台可以无缝连接到云端以传输双向数据···

机器人所需要的传感器有哪些？随着机器人技术的迭代升级，传感器的重要性将持续提升，其功能性、精度和适配性也将得到显著改进，作为机器人不可
2024年墨西哥市场分析，中国品牌崛起 2024年，墨西哥汽车市场以近10%的增长率展现了强劲的复苏势头，中国品牌的崛起为市场注入了新活力，当然现在的政
2025，大众汽车集团在中国如何转型？ 2024 年，大众汽车集团（中国）在复杂多变的市场环境中成功达成销量目标，向客户交付超过 290 万辆汽车，新能源汽车领
国产射频芯片公司汇总对于射频芯片这项卡脖子技术，国内很多公司在这方面努力，而且也做出了不错的成绩。一些射频芯片公司无论从研发
拆解报告：松下电器1200W电吹风松下EH-NW90电吹风内置10万转高速无刷电机，并具备三档风速和四档风温可选。电吹风内置纳诺怡技术，为秀发提供
拆解报告：白牌电动工具电池多功能放电转换器这款白牌多功能放电转换器适配得伟电动工具电池使用，将电动工具电池和放电转换器组装起来，即可组成移动电源和
拆解报告：MOMA猛玛LARK M2无线麦克风 MOMA猛玛LARK M2无线麦克风在外观方面，采用了极富创新的设计，提供了轻盈舒适的佩戴使用体验。发射器采用了夹
阿根廷2024年：销量下滑，北汽增长240.1%。 2024年阿根廷汽车市场在整体销量下滑的背景下，依然展现出多元化的发展趋势···
2025年第3周：全球最快四足机器人发布 2025年将成为机器人产业的关键时间点，业内预期27年人形机器人出货量可达50~100万台。从技术进步到供应链成熟
欧洲2024年汽车市场：微弱复苏和电动化加速并存 2024年，欧盟新车注册量小幅增长0.8%，达到约1060万辆，欧盟+英国+北欧国家的销量为1296.4万台，同比增长0.9%，整个欧
射频微波领域有哪些高质量期刊？今天我们结合网络上的资料一起整理一份射频微波领域的期刊列表，以便同学们投稿时可以选择···
拆解报告：Portal智能屏幕24W电源适配器 Portal智能屏幕电源适配器采用黑色直板机身，外观整洁，配有2米长黑色输出线。适配器采用美规固定插脚，支持100-2

性能飞跃！升级电流传感器NSM201x-P系列赋能汽车三电和光伏逆变器纳芯微推出全新车规级集成电流路径霍尔传感器NSM201x-P系列。该系列产品是对纳芯微已量产的NSM201x系列的完
意法半导体推出STSPIN32G0新列电机驱动器，满足工业自动化和家电市意法半导体STSPIN32系列集成化电机驱动器新增八款产品，满足电动工具、家用电器、工业自动化等应用的低成本、
Melexis推出性能先进的温度传感器，以红外技术创新实现电磁炉智能全球微电子工程公司Melexis宣布，推出专为电磁炉设计的非接触式红外温度传感器芯片MLX90617···
康佳特SMARC模块更新: 全新英特尔酷睿3处理器低功耗 SMARC 模块AI 加速和图形处理性能再次提升···
康佳特针对要求苛刻的实时应用推出新型高性能COM-HPC模块基于英特尔酷睿 Bartlett Lake S处理器的模块性能全面提升···
为汽车安全保驾护航，纳芯微推出基于AMR技术的ABS轮速传感器纳芯微宣布推出全新基于AMR（各向异性磁阻技术）的轮速传感器NSM41xx系列。该系列产品通过集成先进的磁性传感敏
Microchip推出全新Switchtec™ PCIe® 4.0 16通道交换机系列 PCI100x系列器件可为任何需要加速或专用计算的应用提供高性能和成本效益···
RK3576有多强？实测三屏八摄像头轻松搞定-米尔米尔基于他们推出的MYD-LR3576开发板开发了一个3屏异显，8路摄像头输入的DEMO，实测下来，RK3576轻松搞定了该任
SynQor®推荐先进的军用级三相输入UPS（UPS-1500-S-1U-T） SynQor的三相输入UPS电源能使单相负载在电源端呈现出符合MIL-STD-1399-300B标准的清洁、表现良好且几乎零反
村田开发超小尺寸、超低功耗的Type 2GQ GNSS模块，以匠心品质助在几年前，定位系统充斥于生活方方面面的情节还仅见于各式的科幻影片，而今具备这一功能的产品已经以各种形态步
瑞萨推出性能卓越的新型MOSFET 瑞萨全新晶圆技术可以帮助MOSFET实现导通电阻降低30%、栅漏电荷减少40%、封装尺寸缩小50%的目标···
加特兰集成 Cadence Tensilica ConnX 220 DSP 全面升级汽 ConnX 220 DSP 集成至基于下一代 Andes SoC 的加特兰雷达解决方案后，将带来显著优势，包括提高灵活性、

热门评论
最新评论

换一换

杂志声明

TinyML计算机视觉正在通过微型神经处理器(μNPU)变成现实