首页 / 资讯中心 / 文章详情

RK3588跑ONNX推理延迟高?端侧AI低延迟部署完整实战

RK3588跑ONNX推理延迟高?端侧AI低延迟部署完整实战 ★ FEATURED ARTICLE
做工业物联网边缘智能的朋友,大概率都有过这种体验:想在端侧加AI检测,选了RK3588这类高性能边缘板,模型在电脑上跑的好好的,拷到板子上一跑,延迟直接翻好几倍,一帧要上百毫秒;多路摄像头一并发,直接卡成PPT。要么觉得板子性能不行,要么觉得ARM端跑AI就是噱头,其实大多是没做针对性优化,把x86那套思路直接搬到ARM上,性能自然打折扣。去年做厂区周界智能感知项目,一共12个边缘节点,每个节点用一块RK3588边缘板,接4路200万像素摄像头,做人员入侵、异物遗留、设备冒烟检测。最开始图省事,把x86上的YOLOv5s ONNX模型直接拷过去,用.NET ONNX Runtime跑,结果单帧推理就要118ms,四路并发直接掉到每秒不到5帧,延迟波动还特别大,根本没法用。后来沉下心来全链路优化,从模型量化、预处理加速、推理调度、核心绑定到NPU加速,一步步调,最后单帧推理稳定在14ms左右,四路并发满帧25fps,CPU占用控制在30%以内,连续跑了八个多月,没因为推理出过故障。今天就把RK3588部署ONNX模型的完整流程、性能优化技巧、踩坑避坑指南全部分享出来,都是边缘项目实打实跑出来的实战经验。一、先捋痛点:边缘端AI部署最容易踩的6个坑很多人觉得边缘AI性能差是硬件不行,其实80%的问题都是部署和优化没做到位,坑全在适配细节里。模型不做轻量化,直接照搬x86浮点模型F
阅读完成 · 觉得有帮助?
咨询建站