人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载导读本文以 PP-TinyPose 人体关键点检测模型PaddleDetection 官方轻量级实时姿态估计模型为核心围绕其配套部署文档 fastdeploy_en.md 展开完整介绍基于 FastDeploy 的 3 步部署流程安装 SDK、下载示例并实现部署代码、执行推理。读者完成阅读后可以在一行命令内在 X86 CPU 与 NVIDIA GPU 上运行 PP-TinyPose 的图片关键点推理并可自由切换推理后端含 TensorRT 加速。本文还结合仓库内的模型信息、基准数据与应用代码补充模型特性、精度/速度指标、参数说明及源码级原理帮助读者理解 FastDeploy 背后的部署架构。一、为什么选择 FastDeploy 部署 PP-TinyPose1.1 PP-TinyPose 模型简介PP-TinyPose 是 PaddleDetection 面向移动端设备优化的实时关键点检测模型可流畅地在移动端设备上执行多人姿态估计任务。根据 info.yaml 的模型信息其所属任务为 Computer Vision 下的 Object Detection 与 Keypoints Detection数据来源为 COCO train2017、AI Challenger trainset、COCO person keypoints val2017 与 COCO instances val2017License 为 Apache 2.0。从 introduction_cn.ipynb 可以看出PP-TinyPose 借助 PaddleDetection 自研的优秀轻量级检测模型 PicoDet同时提供了特色的轻量级垂类行人检测模型。因此完整的 PP-TinyPose 部署通常采用检测PicoDet 行人检测 关键点TinyPose的串联管线如下图所示PP-TinyPose 的模型特性来自 download_cn.md 与 benchmark_cn.md输入尺寸AP业务数据集APCOCO Val参数量FLOPS单人推理耗时FP32单人推理耗时FP16128×9684.358.41.32M81.56M4.57ms3.27ms256×19291.068.31.32M326.24M14.07ms8.33ms说明关键点检测模型与行人检测模型均使用 COCO train2017、AI Challenger trainset 以及采集的多姿态场景数据集作为训练集关键点检测模型使用多姿态场景数据集作为测试集关键点检测模型的精度指标所依赖的检测框由 ground truth 标注得到移动端推理速度测试环境为 Qualcomm Snapdragon 865采用 arm8 下 4 线程推理。1.2 FastDeploy 的部署能力与适用场景FastDeploy 是一款全场景、易用灵活、极致高效的 AI 推理部署工具提供开箱即用的云边端部署体验支持超过 150 Text、Vision、Speech 和跨模态模型实现了 AI 模型端到端的优化加速。目前支持的硬件包括 X86 CPU、NVIDIA GPU、ARM CPU、XPU、NPU、IPU 等通过一行代码即可切换不同推理后端和硬件fastdeploy_cn.md。FastDeploy 部署 AI 模型只需 3 步安装 FastDeploy 预编译 SDK调用 FastDeploy 的 API 实现部署代码推理部署。前置说明本文档演示的部署流程下载 FastDeploy 示例来完成高性能部署体验仅展示 X86 CPU、NVIDIA GPU 的推理且默认已经准备好 GPU 环境如 CUDA 11.2 等。如需部署到其他硬件或完整了解 FastDeploy 部署能力请参考 FastDeploy 官方仓库。二、第一步安装 FastDeploy SDK根据 fastdeploy_en.md安装 FastDeploy GPU 版 Python 预编译包的命令如下pip install fastdeploy-gpu-python0.0.0 -f https://www.paddlepaddle.org.cn/whl/fastdeploy_nightly_build.html命令要点说明fastdeploy-gpu-python为包含 GPU 推理后端含 TensorRT 等的 Python wheel 包-f--find-links指定额外的 wheel 索引页面即飞桨官方的 FastDeploy nightly build 轮子下载页该命令适用于已具备 GPU 环境CUDA 11.2 等的机器若仅需 CPU 部署可安装对应的 CPU 版本包。安装完成后可通过python -c import fastdeploy; print(fastdeploy.__version__)验证 SDK 是否导入成功。三、第二步下载部署示例与模型文件3.1 获取 FastDeploy 示例代码# 下载部署示例代码 git clone https://github.com/PaddlePaddle/FastDeploy.git cd FastDeploy/examples/vision/keypointdetection/tiny_pose/python示例目录中包含pptinypose_infer.py推理脚本其核心逻辑为加载 PP-TinyPose 推理模型 → 读取输入图片 → 调用 FastDeploy API 完成关键点推理 → 输出可视化结果。3.2 下载 PP-TinyPose 模型与测试图片# 下载 PP-TinyPose 模型文件和测试图片 wget https://bj.bcebos.com/paddlehub/fastdeploy/PP_TinyPose_256x192_infer.tgz tar -xvf PP_TinyPose_256x192_infer.tgz wget https://bj.bcebos.com/paddlehub/fastdeploy/hrnet_demo.jpg解压后的PP_TinyPose_256x192_infer目录即推理部署模型包含 FastDeploy 推理所需的模型结构与参数文件hrnet_demo.jpg为官方提供的测试图片。提示模型输入尺寸为 256×192。若希望使用更轻量的 128×96 版本可参考 download_cn.md 中的模型下载链接自行替换部署模型。四、第三步运行推理4.1 CPU 推理python pptinypose_infer.py --tinypose_model_dir PP_TinyPose_256x192_infer --image hrnet_demo.jpg --device cpu4.2 GPU 推理python pptinypose_infer.py --tinypose_model_dir PP_TinyPose_256x192_infer --image hrnet_demo.jpg --device gpu4.3 GPU TensorRT 推理python pptinypose_infer.py --tinypose_model_dir PP_TinyPose_256x192_infer --image hrnet_demo.jpg --device gpu --use_trt True注意TensorRT 推理第一次运行时会对模型进行序列化构建 TensorRT engine有一定耗时需要耐心等待序列化完成后后续推理会显著加速。运行完成后的可视化结果人体关键点骨骼绘制在原始图片上如下4.4 脚本参数说明以示例脚本为基础FastDeploy 示例脚本pptinypose_infer.py的核心参数如下参数取值示例说明--tinypose_model_dirPP_TinyPose_256x192_inferPP-TinyPose 推理模型目录--imagehrnet_demo.jpg输入图片路径--devicecpu/gpu指定推理设备可一行切换硬件--use_trtTrue/False是否在 GPU 上启用 TensorRT 后端通过一行--device参数即可在不同硬件与推理后端之间切换这正是 FastDeploy 统一部署体验的核心体现。五、仓库内 PP-TinyPose 部署实践参考5.1 基于 PaddleDetection 的检测 关键点串联推理仓库中 APP/det_keypoint_unite_infer.py 提供了完整的行人检测 关键点检测串联推理实现其调用链为加载 PicoDet 行人检测器与 TinyPose 关键点检测器对图片先做检测detector.predict_image置信度阈值det_threshold默认 0.5对检测到的行人框裁切get_person_from_rect后送入关键点检测器keypoint_detector.predict_image将关键点坐标映射回原图translate_to_ori_images并可视化visualize_pose。对应命令行推理示例如下来自 introduction_cn.ipynbpython deploy/python/det_keypoint_unite_infer.py --det_model_diroutput_inference/picodet_v2_s_320_pedestrian --keypoint_model_diroutput_inference/tinypose_128x96 --image_filedemo_input/000000568213.jpg --deviceGPU --output_dirdemo_output视频推理同理python deploy/python/det_keypoint_unite_infer.py --det_model_diroutput_inference/picodet_v2_s_320_pedestrian --keypoint_model_diroutput_inference/tinypose_128x96 --video_filedemo_input/demo_PP-TinyPose.mp4 --deviceGPU --output_dirdemo_output5.2 关键推理参数来自 det_keypoint_unite_utils.py参数默认值说明--keypoint_batch_size8关键点推理 batch 大小检测 batch 为 1检测结果收集后按此 batch 送入关键点推理--det_threshold0.5行人检测置信度阈值--keypoint_threshold0.5关键点可视化置信度阈值--output_diroutput可视化结果输出目录--devicecpuCPU/GPU/XPU 设备选择--run_modepaddle运行模式支持paddle/trt_fp32/trt_fp16/trt_int8--enable_mkldnnFalseCPU 上是否启用 MKLDNN 加速--cpu_threads1CPU 推理线程数--use_darkTrue是否使用 DARK 后处理以提升关键点位置精度--smoothFalse是否对关键点做时序平滑视频推理更稳定--filter_typeOneEuro平滑滤波器类型可选OneEuro或EMA5.3 在线体验应用Gradio仓库 APP/app.py 提供了一个基于 Gradio 的在线体验应用配置见 APP/app.yml支持图片与视频输入仅支持 .mp4/.avi通过def_keypoint(input_date)完成推理输出可视化结果与 JSON 结构化结果关键点坐标、置信度、检测框。六、性能参考与部署注意事项6.1 服务端推理基准来自 benchmark_cn.mdPython 部署NVIDIA T4 / CUDA 10.1 / CUDNN 7 / Python 3.7 / TensorRT 6batch size8仅推理时间模型CPUMKLDNN (1线程)CPUMKLDNN (4线程)GPUTensorRT (FP32)TensorRT (FP16)PP-TinyPose-128x9625.2ms14.1ms2.7ms0.9ms0.8msPP-TinyPose-256x19282.4ms36.1ms3.0ms1.5ms1.1msC 部署软硬件环境同上模型CPUMKLDNN (1线程)CPUMKLDNN (4线程)GPUTensorRT (FP32)TensorRT (FP16)PP-TinyPose-128x9624.06ms13.05ms2.43ms0.75ms0.72msPP-TinyPose-256x19282.73ms36.25ms2.57ms1.38ms1.15ms6.2 移动端推理基准Paddle Lite版本 v2.10-rc仅推理时间模型麒麟 980 (1线程)麒麟 980 (4线程)骁龙 845 (1线程)骁龙 845 (4线程)骁龙 660 (1线程)骁龙 660 (4线程)PicoDet-s-192x192 (det)14.85ms5.45ms17.50ms7.56ms80.08ms27.36msPicoDet-s-320x320 (det)38.09ms12.00ms45.26ms17.07ms232.81ms58.68msPP-TinyPose-128x96 (pose)12.03ms5.09ms13.14ms6.73ms71.87ms20.04ms6.3 部署注意事项GPU 环境要求FastDeploy GPU 版需要 CUDA 11.2 等就绪环境TensorRT 首次序列化首次运行 TensorRT 推理时需构建 engine耗时较长属正常现象模型文件完整性PP_TinyPose_256x192_infer目录需完整解压后再运行推理脚本否则加载模型会失败输入尺寸一致性若替换为 128×96 版本的部署模型需确认推理脚本或预处理与模型输入尺寸匹配。七、总结本文完整复现了基于 FastDeploy 的 PP-TinyPose 3 步部署流程安装 SDK → 下载示例与模型 → 一行命令切换 CPU/GPU/TensorRT 完成推理。同时结合仓库内的 fastdeploy_en.md、download_cn.md、benchmark_cn.md 以及 APP 下的推理源码对 PP-TinyPose 的模型特性、性能基准、串联推理管线与关键参数做了纵深补充。通过本文读者不仅可以照单操作完成一次 PP-TinyPose 的高性能推理体验还能理解 FastDeploy 统一部署抽象背后的关键点一份部署代码、一行设备参数即可在 X86 CPU、NVIDIA GPU含 TensorRT 加速等多种硬件上运行。若需将 PP-TinyPose 部署到 ARM、XPU、NPU、IPU 等其他硬件可进一步探索 FastDeploy 官方仓库的完整能力矩阵。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐PP-TinyPose 高性能部署实战基于 FastDeploy 三步完成云边端人体姿态估计推理PP TinyPose 高性能部署实战基于 FastDeploy 三步完成云边端人体姿态估计推理 本文以 PaddleDetection 推出的轻量级人体姿态人工智能深度学习计算机视觉NLP语音ComfyUI 报 No HIP GPUsROCm 下四步修好 AMD GPU 识别ComfyUI 报 No HIP GPUsROCm 下四步修好 AMD GPU 识别 Ubuntu 24.04 下 ComfyUI 报 RuntimeErro人工智能深度学习计算机视觉NLP语音PP-LCNetV2 全场景高性能部署指南基于 FastDeploy 的云边端推理实践PP LCNetV2 全场景高性能部署指南基于 FastDeploy 的云边端推理实践 导读 本文以 modelcenter/PP LCNetV2/fastd人工智能深度学习计算机视觉NLP语音上一篇终极WeMod增强工具指南如何免费解锁远程控制和AI功能下一篇WarcraftHelper彻底解决魔兽争霸3现代化兼容问题的终极方案创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?