ILImitation Learning具身模仿学习完整工程链路动捕 / 遥操作数采 → 训练 → 仿真 → 真机部署主线大方向是数据采集 → 策略训练 → 仿真验证 → 真机部署推理。但这是简化版。工业 / 实验室完整闭环是迭代循环中间还有大量容易被忽略的环节而且真机部署后还有评估、安全调优、数据回流。下面把全链路按顺序拆成【主流程 配套环节 迭代闭环】区分离线阶段、仿真阶段、真机阶段、数据回流同时标注哪些是必选、哪些是可选以及对应的动作主干MLP/TCN/LSTM/Transformer/Mamba。前置说明这里是动捕采集人类示教数据的模仿学习流程BVH 人体动捕、全身 / 灵巧手动作捕捉不是纯遥操作手柄采集。一、完整全流程阶段 1示教数据采集与数据治理动捕 - 数采【离线】「动捕 - 数采」就在这一步不只是录 BVH场景标定 软硬件标定动捕相机标定、相机内参 / 外参、手眼标定、机器人 URDF 标定、坐标系对齐标定传感器延迟、关节零位。人类示教采集光学动捕 / 惯性动捕采集人体 / 人手轨迹输出 BVH同步录制机器人本体观测RGB、深度图、关节角度、力矩同步录制指令文本 / 目标图片VLA 任务。可选混合采集动捕 遥操作手柄补充困难样本。原始数据清洗、过滤剔除跳点、Marker 丢失、采集卡顿、无效 demo滤波卡尔曼 / 指数滤波去除动捕抖动剔除碰撞超限、奇异位姿样本。轨迹重投影 运动学映射人体动捕是人体骨骼不能直接喂给机器人需要逆运动学 IK 映射把人体骨骼姿态映射成机器人关节目标轨迹做运动学裁剪、关节限位检查、自碰撞检测把人体动作适配机器人形态。数据集构建、格式转换、数据增强转 HDF5/Zarr/ LeRobot 格式时序切片、窗口采样、动作下采样图像增强、时序噪声注入、时间轴扰动划分训练集 / 验证集。数据集质量评估统计 demo 成功率、轨迹分布、动作多样性检查动作多模态是否充足避免全部是单一轨迹造成策略均值坍缩。产出清洗对齐后的示教数据集阶段 2策略训练与模型调优【离线】策略选型 模型搭建选择主干网络MLP /1D-TCN / LSTM / Transformer (ACT/DiT) / Mamba定义观测空间、动作空间、预测 horizon、动作 chunk 长度。训练配置优化器、学习率调度、损失函数动作归一化、观测归一化CVAE / 扩散模型的噪声调度等。离线训练 验证集评估在 GPU 集群训练每轮在验证集计算损失、动作预测误差、时序轨迹可视化做早停防止过拟合。离线仿真前的模型静态评估可视化预测动作序列看预测轨迹是否平滑、是否超出关节限位分析分布偏移预测动作和示教动作的分布差异。产出训练好的策略权重文件.pt/.pth到此离线训练完成但模型只见过历史 demo没有和环境交互。阶段 3仿真环境测试 域随机化仿真不是只跑一遍看能不能动是一套闭环验证仿真环境搭建MuJoCo / Gazebo / IsaacSim导入机器人 URDF/SDF重建任务场景、物体模型物理参数质量、摩擦、阻尼配置。策略仿真部署开环测试把训练权重加载进仿真输入仿真虚拟传感器输出动作跑 demo 任务开环验证轨迹形态。闭环仿真评估 大规模批量评测滚动时域推理Receding HorizonACT/Diffusion/Mamba 都要用多次随机种子跑大量 episode统计成功率、轨迹误差、碰撞次数、完成时长。域随机化 Domain Randomization非常关键随机化物体质量、摩擦、相机噪声、光照、关节噪声、传感器延迟测试策略鲁棒性缩小「仿真 - 真机」的域差距Sim2Real。仿真故障挖掘 策略迭代收集仿真失败案例卡住、碰撞、目标偏移分析失败原因数据不足、过拟合、动作分布问题回到阶段 1 补充困难样本重新训练。可选仿真世界模型预评估Mamba/Transformer 世界模型预测未来状态产出仿真验证通过的模型失败样本集阶段 4真机安全预测试独立环节很多工程方案会单独拎出来不能直接上全闭环⚠️ 仿真没问题 ≠ 真机能跑。真机有硬件安全这一步是仿真到真机之间的过渡容易被忽略安全限位配置软件关节限位、力矩阈值、碰撞检测急停、速度限幅安全监控线程独立于 AI 策略硬安全AI 崩溃也能触发急停。真机开环回放测试固定机器人只执行预测轨迹不做视觉闭环回放整条动作序列看关节运动、奇异位姿、力矩是否超限不做环境交互。低速度、简化场景小范围闭环测试降低运动速度简化场景少量 episode 小批量测试人工全程监护。产出安全校验通过的策略确认不会损坏硬件阶段 5真机部署推理 真机在线评估模型部署优化模型量化、ONNX 导出、TensorRT / TorchRT、算子适配Mamba 还要特殊 CUDA 算子搭建推理服务ROS2/FastAPI构建观测推理流水线相机采集→图像编码→时序观测缓存→策略推理→动作输出给控制器。真机闭环推理实验滚动时域执行策略机器人和真实环境交互执行任务。真机指标评估任务成功率、动作完成度、轨迹平滑度、接触力矩、推理延迟、抖动情况记录各类真机失败案例物体滑动、相机反光、动捕 / 视觉噪声带来的域偏移。产出真机实验日志、视频、失败样本阶段 6在线数据回流 迭代闭环长期持续具身项目核心模仿学习不是一次性训练完就结束是持续自迭代闭环真机失败案例采集采集真机上策略失败的轨迹视觉、本体、动作也可以用自助示教、干预学习Human-in-the-loop策略快要失败时人介入遥控修正动作保存修正后的轨迹。新增样本合并进数据集把真机新采集样本合并到原始数据集再次回到【阶段 1 数据清洗】重新训练模型。经典范式Dataset → Train → Sim → Real → Collect new demo → Dataset二、可选的高级环节视项目目标选择不是必选离线 RL 微调 / 对抗模仿GAIL/AMP只用 BC 容易分布偏移可以在 BC 预训练之后在仿真中做 AMP/GAIL/PPO 微调进一步优化策略适配物理交互。世界模型预训练用 Mamba/Transformer 预先学习环境动力学在想象世界里做预训练减少真机试错。A/B 消融实验对比不同主干网络、不同 horizon、不同数据增强方案的性能差异论文 / 投标项目常用。策略蒸馏大模型Transformer/Mamba蒸馏成轻量 MLP / 小 TCN降低推理延迟用于硬件。鲁棒性压力测试主动加入传感器噪声、遮挡、物体位置扰动做边界 case 测试。三、极简主线 vs 完整闭环总结最简学术小 demo 链路你说的那条动捕数采 → 数据集处理 → 策略训练 → 仿真测试 → 真机部署推理适合快速验证 idea不考虑硬件安全、迭代。工程落地完整闭环链路产品级标定 → 动捕示教采集 → 数据清洗 IK 映射 → 数据集构建增强 → 策略训练 离线评估 → 仿真测试 域随机化 → 真机安全预测试 → 真机部署推理 评估 → 失败样本回流循环迭代四、常见坑点动捕数据IK 映射和坐标系对齐是第一位很多项目训练 loss 很低、仿真正常真机完全跑偏仿真和真机存在 Sim2Real gap仿真完美真机容易失败时序缓存管理LSTM/Transformer/Mamba 都要维护时序窗口 / 隐状态真机推理时序管理 bug 非常多安全层必须独立AI 策略不能负责硬件安全。
阅读完成 · 觉得有帮助?