首页 / 资讯中心 / 文章详情

MLPerf Tiny v1.4:边缘AI能效基准的标准化与22.2微焦耳每推理的工程含义

MLPerf Tiny v1.4:边缘AI能效基准的标准化与22.2微焦耳每推理的工程含义 ★ FEATURED ARTICLE
摘要MLPerf Tiny v1.4的发布标志着边缘AI能效评估的标准化。ASYGN的ColibryNPU实现了22.2微焦耳每推理的能效记录STM32U3在关键词识别任务中实现每秒48次推理、功耗仅245mW。本文从基准设计、能效数据和芯片选型三个维度分析MLPerf Tiny对边缘AI工程的指导意义。一、MLPerf Tiny边缘AI的公平竞技场MLPerf Tiny是MLCommons Tiny工作组与EEMBC联合开发的行业标准基准套件用于评估超低功耗机器学习系统。核心挑战。2021年引入MLPerf Tiny的论文识别了四个挑战能量测量的公平性——不同设备测量不同的内容有些包括外设、固件启动或I/O活动有些只测量推理本身内存预算的严格约束——TinyML设备通常在千字节级别工作比智能手机ML严格约6个数量级软件和硬件的异质性——设备范围从60MHz微控制器到支持向量的RISC-V核心到专用NPU以及基准测试的可重复性。v1.4的更新。MLPerf Tiny v1.4将能量作为一级指标。基准测试覆盖四个任务关键词识别、视觉唤醒词、图像分类和异常检测。模型参数量通常低于200万运行在亚毫瓦到低毫瓦功耗的设备上。二、22.2微焦耳每推理能效记录背后的架构创新ASYGN的ColibryNPU在MLPerf Tiny v1.4基准测试中实现了22.2微焦耳每推理的能效记录。近内存计算架构。ColibryNPU采用Near-Memory Computing架构紧耦合内存和计算块集成了32位RISC-V微控制器和神经加速器。8个计算块每个时钟周期执行最多2个MAC操作峰值性能9.6 GOps/s。实际续航数据。一颗CR2032纽扣电池220mAh可以在视觉唤醒词用例中持续供电超过3年每秒执行一次推理。实时视频处理在1毫瓦以下运行可达每秒数帧。与同类方案的对比。在MLPerf Tiny v1.3的领先结果中Syntiant的NDP120实现了1.8ms的推理延迟每次关键词检测能耗为49.6微焦耳。ColibryNPU的22.2微焦耳每推理在能效上具有明显优势。三、STM32U3的MLPerf Tiny结果近阈值设计的能效突破STMicroelectronics的STM32U3系列在MLPerf Tiny v1.3轮次中提交了引人注目的结果。性能数据。NUCLEO-U385RG-Q开发板在关键词识别任务中实现了每秒超过48次推理同时功耗仅为245mW。STM32U3具有突破性的近阈值设计大幅降低了动态功耗。能效对比。与STM32L4相比STM32U3的能耗几乎降低了6倍与STM32U5相比能耗降低了2.5倍。对于电池供电的物联网设备这种高性能与超低功耗的结合打破了智能化与电池续航之间的传统权衡。软件生态的支撑。NanoEdge AI Studio支持时间序列数据的AutoML只需导入传感器数据几次点击之后就会自动生成一个专为目标STM32优化的定制AI库。STM32Cube AI Studio支持更复杂的模型部署。四、芯片选型的能效视角从MLPerf Tiny的结果出发嵌入式AI芯片的选型需要新的评估维度。第一实际工作负载下的能效。不要只看峰值算力要看实际工作负载下的能效。MLPerf Tiny提供了标准化的测试方法使不同芯片之间的能效对比成为可能。第二量化精度的支持。支持更低精度量化的芯片在电池供电场景中具有明显优势。支持混合精度配置的芯片在精度和能效之间提供了更好的平衡。第三近内存计算架构的价值。ColibryNPU的近内存计算架构通过紧耦合内存和计算块消除了数据搬运的开销。对于电池供电的设备这种架构的能效优势显著。第四近阈值设计的能效突破。STM32U3的近阈值设计大幅降低了动态功耗。嵌入式工程师在选型时需要关注芯片的工艺和架构创新对能效的实际影响。五、对嵌入式工程师的影响第一理解微焦耳每推理指标。微焦耳每推理是嵌入式AI能效的核心指标。理解这个指标的定义、测量方法和影响因素是嵌入式AI能效优化的基础。第二掌握MLPerf Tiny的测试方法。MLPerf Tiny提供了标准化的能效测试方法。嵌入式工程师需要理解基准测试的测试负载、测试条件和测试指标。第三优化推理调度策略。推理的触发条件、批处理策略和低功耗模式的使用直接影响实际能效。嵌入式工程师需要优化推理调度策略。第四关注近内存计算和近阈值设计。ColibryNPU的近内存计算架构和STM32U3的近阈值设计代表了嵌入式AI能效优化的两个方向。嵌入式工程师需要理解这些架构创新的工程价值。六、总结MLPerf Tiny v1.4的发布标志着边缘AI能效评估的标准化。22.2微焦耳每推理的能效记录和STM32U3的48次推理每秒、245mW功耗展示了嵌入式AI能效的最新进展。微焦耳每推理正在成为嵌入式AI芯片选型的核心指标。对于嵌入式工程师而言能效基准意味着新的技能需求能效测试方法、量化精度选择和推理调度优化。这些技能正在成为嵌入式AI开发的核心竞争力。
阅读完成 · 觉得有帮助?
咨询建站