首页 / 资讯中心 / 文章详情

EWAM:没有逐层监督,统一具身模型自己学会了“先看懂、再想象、后动手“

EWAM:没有逐层监督,统一具身模型自己学会了“先看懂、再想象、后动手“ ★ FEATURED ARTICLE
题目EWAM: Emergent Depth-Wise Specialization in a Unified Embodied Model – From Semantic Understanding through Visual Foresight to Action论文https://arxiv.org/abs/2609.39973项目主页https://wanghao00pro.github.io/EWAM-project/代码https://github.com/Wanghao00pro/EWAM模型权重https://huggingface.co/HaoWang00/EWAM一句话总结EWAM 是一个以动作为中心的统一具身模型。我们让动作 token 在每一层都能同时读取语义、当前画面、预测的未来画面和动作自身的信息没有给任何逐层监督。训练后模型自发形成了一个按深度展开的分工浅层主要读视觉-语言特征理解中层转向预测的未来帧预演深层以动作自注意力为主动作形成。因果干预实验表明动作生成确实依赖这个分工。一、问题两类信息模型往往只关注一类当前机器人策略大致有两条路线VLA视觉-语言-动作模型继承 VLM 的语义理解能力擅长理解指令和场景WAM世界-动作模型通过预测未来画面学习环境动态擅长预判接下来会发生什么。很自然的想法是把两者接到一起。但我们分析动作 query 的注意力分配后发现很多系统即使同时接入了语义和预测两种来源动作计算仍然集中在单一专家上VLA 主要看 VLMWAM 主要看视频多专家模型也常常由一个来源主导图 1 的 a–c。于是我们想问一个更根本的问题当语义理解、视觉预测和动作生成真正被统一在一个网络里时它们会在整个网络中互相竞争还是会自己组织出某种分工二、方法动作为中心的非对称联合注意力EWAM 由三个专家组成在同一个 flow-matching Diffusion Transformer 中联合去噪视觉-语言专家基于 Qwen3-VL-2B-Instruct把指令和当前图像编码成与 Transformer 各层对齐的语义表示视频专家基于 Wan2.2-TI2V-5B把带噪的未来视频 latent 去噪成预测性视觉上下文动作专家轻量 Transformer对带噪动作块action chunk去噪。关键设计是非对称注意力掩码动作 query 在每一层都能读取 VL、视频当前帧 预测未来帧和动作的 key/value而 VL 和视频 query 只在各自的流内做自注意力。这样感知专家保留各自的职责动作流则可以在任意深度自由选择从哪里取信息。注意这个掩码只决定哪些信息可以被读到并不规定哪一层应该读什么。此外动作和状态统一到 16 维 padding 空间一个模型可以覆盖不同机器人本体。后训练阶段可以选择性加上子任务预测和阶段进度两个轻量头用于长程任务。预训练分两种独立设置跨本体机器人数据从约 3,250 小时开源机器人数据GM-100、RoboCOIN、RoboMIND、RoboChallenge、RDT 及仿真数据中筛出约 1,800 小时、30 万条轨迹人类第一视角视频约 2,084 小时VITRA-1M、EgoDex、Xperience把手腕运动表示为相对相机的末端位移让人手和机器人末端共享同一套任务空间表示。三、核心发现逐层分工是自发涌现的统计动作 query 在每一层对不同信息源的注意力占比可以看到清晰的三段式结构浅层第 0–9 层VL token 获得 75.4% 的动作注意力用于把指令落到当前场景上中层第 10–19 层大约从第 13 层开始对预测未来帧的注意力超过对当前 VL 图像的注意力预测成为主要的视觉来源深层第 20–29 层动作自注意力占 59.5%同时保留少量语义和预测上下文用于精修动作轨迹。这个结构不是个例跨任务复现RoboTwin 全部 50 个任务都表现出浅层 VL 主导跨去噪步稳定不同去噪步之间注意力分布的平均两两相关系数为 0.998。四、它是学出来的而且动作真的依赖它1. 训练过程中逐步形成跟踪一个不做机器人预训练的训练过程第 50 步时几乎每一层都是 VL 图像领先还没有分工第 150 步时从第 8 层起未来帧开始领先到第 40,000 步浅层重新回到看当前图像未来帧从第 13 层起领先。分工在训练早期的几百步内就开始出现之后逐步调整。2. 按层屏蔽模型预测是否真的依赖注意力表现的层级分工在一个固定的机器人预训练 checkpoint 上推理时按来源和深度屏蔽动作注意力的 key不重新训练表 1 右半部分RoboTwin Randomized50 任务 × 100 episode浅层缺 VL 损失明显缺视频几乎没影响中层一旦拿不到预测的未来帧成功率从 92.8% 掉到 3.55%。这与注意力统计看到的分工一致。3. 反事实注入换一个未来想象动作就跟着变把另一条成功轨迹的中层未来帧特征注入到目标轨迹中只替换第 10–19 层的未来帧 key/value其余表示保持不变。五个任务上成功率从 25/25 降到 4/25。在 Adjust Bottle 任务中模型甚至会按照被注入的未来去用另一只手臂。这说明中层读取的预测内容在实际引导动作而不只是相关性。五、实验结果仿真RoboTwin 2.0 clean-to-random只用干净场景的示范做适配再在随机化场景上测试。EWAM 的 C2C 为 82.2%C2R 为 72.1%平均 77.2%。仿真RoboTwin 2.0 in-domain干净和随机化示范都参与适配EWAM 在干净场景 93.0%、随机化场景 92.8%平均 92.9%。仿真LIBERO四个套件平均 98.8%Spatial 98.6 / Object 99.8 / Goal 98.6 / Long 98.2。真机三种本体、七个任务我们在 Franka 单臂、Dobot 双臂和 Unitree G1-D 人形上评测了叠碗、物体入盒、倒水、整理桌面、叠毛巾、提壶倒水、倒豆子七个任务。六、人类第一视角数据低成本地帮机器人迁移和变稳路线一用人类视频预训练提升跨本体迁移在 RoboTwin 的四个机器人上训练在没见过的 Aloha-Agilex-2 上测试两组策略唯一的区别是是否从人类视频预训练开始。在相同的 12 万步机器人训练预算下成功率从 36.2% 提升到 66.9%比较各自最好的 checkpoint是 40.1% 对 66.9%。在 G1-D 真机倒水任务上用同样的 60 条机器人 30 条人类示范混合数据后训练人类预训练初始化把成功率从 40% 提升到 60%。路线二自采人类示范做协同训练提升真机鲁棒性我们用 Lumos Ego 头显记录鱼眼 RGB、ToF 深度和 SLAM 相机位姿加两个 Vive Tracker 3.0 手腕追踪器测量真实尺度的 6 自由度手腕运动采集任务示范再通过手部重建、工具对齐和抓取状态估计转成机器人可用的观测-动作轨迹并用仿真和真机回放进行验证。在换桌布、换杯子的测试中不使用任何 EWAM 预训练60 条机器人示范只有 10%加上 30 条人类示范就达到 20%与 90 条纯机器人示范持平但采集成本低得多继续把人类示范加到 1,000 条成功率升到 60%而且还没有饱和。七、长程任务让模型知道做到哪一步了后训练时在动作流上加一个轻量解码器预测当前子任务再加一个 MLP 回归阶段进度不需要外部规划器。在 200 episode 的仿真积木任务上排序83.5% → 91.0%堆叠44.5% → 58.5%排序 堆叠1.5% → 16.0%在 G1-D 真机双篮分拣任务上平均放对的物体数从 1.0/4 提升到 2.2/4。没有子任务监督时模型抓取失败后会反复重试同一个物体有监督后它会切换到下一个物体。八、展望1. 从固定分工到自适应计算逐层分工说明语义理解、视觉预演和动作精修不必遵循一个固定的全局顺序。不同任务和执行阶段需要的计算量可能不同指令含糊时需要更长的语义理解交互不确定时需要更多预测动作明确时可以更早进入动作精修。未来的模型可以根据任务和当前状态动态调整各专家之间的切换时机。2. 从视觉预演到反事实规划反事实注入实验表明中层的未来表示携带了真正影响控制的信息会改变抓取目标和手臂选择。一个自然的延伸是针对不同候选动作生成多个未来先评估各自的后果再决定执行哪一个。这会让统一的世界-动作模型从单一预测轨迹走向反事实规划同时保留视觉-语言专家提供的语义理解。3. 更深入地理解模型内部在信息路由的基础上可以进一步用表示探针、激活修补、跨层因果中介分析等方法检验每一层的语义和预测内容是否随路由一起变化更完整地揭示模型内部的计算过程。4. 按专家 × 深度做结构化加速三个大专家并存的计算开销不小而逐层分工正好提供了一条结构化优化的思路不必对三个专家做统一压缩而是根据每个专家在不同深度的实际贡献分配模型容量对贡献持续偏低的区域做结构化剪枝或参数共享在保持功能分工的同时降低计算开销。九、开源代码、四个 checkpoint跨本体预训练、RoboTwin clean-to-random、RoboTwin in-domain、LIBERO都已开源训练和评测流程完整可复现论文https://arxiv.org/abs/2609.39973项目主页https://wanghao00pro.github.io/EWAM-project/代码https://github.com/Wanghao00pro/EWAM模型https://huggingface.co/HaoWang00/EWAM欢迎大家试用、交流和指正。
阅读完成 · 觉得有帮助?
咨询建站