CVPR 2026 的 Workshop 征稿名单里这个主题一放出来我朋友圈里就好几个人在转“多智能体具身智能的协同进化”。说实话圈内人看到这个标题第一反应基本是“果然来了”。近几年具身智能在 CVPR 上的戏份越来越重从早几年的抓取、导航到后来的 VLA、操作大模型几乎每年都有爆款工作而多智能体这边MARL 已经深耕多年但从仿真博弈向物理世界迁移一直差临门一脚。这两个方向往一起凑是迟早的事。真正有意思的是“协同进化”这后半句——它把叙事从“怎么把一个任务做好”拉到了“一个多智能体系统怎么在互动中持续变好”的尺度上这个野心比一般的 multi-agent collaboration 大得多。这篇文章主要写给三类人看想投这个 Workshop 的研究生和青年学者、在机器人和具身智能方向找落地场景的工程师、以及单纯想搞清楚这个方向在热什么的读者。我会把这个征稿通知拆开揉碎讲清楚主题背后三个关键词的技术脉络、近几年真正值得关注的研究问题、投稿时可以切入的具体赛道还有我在类似投稿和评审过程中踩过的坑和总结出来的经验。信息量比较大建议收藏了慢慢看。1. 征稿主题拆解三个关键词背后的研究脉络1.1 多智能体老问题在具身场景下的新挑战多智能体研究并不是新鲜事。早在上世纪八九十年代分布式人工智能里就有大量关于智能体协商、任务分配、组织建模的讨论后来强化学习兴起MARL多智能体强化学习从粒子环境、棋类博弈一路做到了《星际争霸》、Dota 这种大规模决策场景。QMIX、MADDPG、MAPPO 这些算法名字做过相关方向的人应该都不陌生。但这些方法直接迁移到具身智能上会遇到几个很现实的新问题。第一是部分可观测性被大幅放大一个智能体在物理世界里看到的只是自己视野内的局部信息其他智能体在哪、在做什么、遮挡物后面是什么全靠推断。第二是动作空间从离散动作变成高维连续控制两个机械臂要在同一张桌上协同搬一个易碎物体动作时序稍有偏差任务就崩了。第三是非平稳性问题在物理世界里更加尖锐每个智能体的策略变化都会改变其他智能体的观测分布这在棋盘环境里还能靠大规模采样硬扛在真实机器人上几乎没这个条件。所以当你看到这个 Workshop 主题里出现“多智能体”时它指的不是过去那种“很多 agent 在同一个 gym 环境里跑”的简单叠加而是“多个物理实体在共享的真实/仿真空间里完成需要互相配合的任务”。这个转变本身就是很大的研究空间。1.2 具身智能从“看懂”到“做出来”的范式转变具身智能的核心主张一句话就能说清楚智能不能脱离身体和环境独立存在。过去几十年 CV 的主流叙事是“给一张图告诉我里面有什么”再往后变成“给一段视频理解里面发生了什么”但具身智能要求的是“给我一个任务描述我控制一个物理实体在环境里把它完成”。对 CVPR 这个以视觉为核心的顶会来说这意味着很多经典假设需要重构——输入不再是静态的、完整的、高质量的图像而是连续的、局部的、带噪声的传感器流输出也不再是标签或框而是电机指令序列。这一点从近几年 CVPR 上的工作分布也能看出来机械臂是最典型的载体之一抓取、插孔、折叠衣物、开冰箱这类操作任务越来越常见室内导航、移动操作也是大户。以 VLAVision-Language-Action为代表的一类模型把预训练语言模型、视觉编码器和动作解码器拼在一起实现了“自然语言指令直接映射到机器人动作”的闭环OpenVLA、π0 这些工作让很多人第一次意识到原来大模型的能力真的能落到物理世界里。但说实话这些工作绝大多数集中在单智能体场景。一个机器人、一个任务、一个环境。多智能体具身不是把单机模型复制几份就能解决的因为共享空間、竞争资源、信息交换、角色分工这些维度在单机设定里根本不存在这也正是这个 Workshop 存在的理由。1.3 协同进化真正值得反复琢磨的那个题眼“协同进化”原本是生物学概念指不同物种在长期相互作用中互为选择压力最终驱动彼此演化。放在这个 Workshop 的语境里我理解至少有三个层次的含义可以展开。第一层是智能体之间的协同进化。多个智能体在持续互动中互相适应我的策略是你的环境你的策略也是我的环境双方在竞争与合作中共同演化出复杂的群体行为。第二层是智能体与环境的协同进化。智能体通过改造环境比如搬运物体、开关门、整理桌面减少自身完成任务的难度环境反过来又对它的策略提出新的约束这种双向塑造在具身场景里特别明显。第三层是知识与技能的跨代累积。新一代智能体是否能继承上一代学到的表示、技能、世界模型而不是每次从头再来这已经接近“文化演化”的概念了。这三种解读对应了完全不同的投稿路线。想做算法的可以从第一层切入研究多智能体策略的共同演化机制与收敛性问题想做仿真和基准的可以围绕第二层来设计动态环境想做系统和框架的则在第三层更有施展空间。这也是我建议投稿人在读这个征稿通知时首先要做的功课——想清楚“协同进化”这个词在你的工作里到底指什么因为审稿人一定会问这个问题。2. 技术赛道拆解哪些方向容易出文章2.1 通信机制与涌现语言不是聊得越多越好多智能体系统里最绕不开的问题就是通信。很多人上手就默认智能体之间应该共享全部信息但实际部署时你很快会发现通信带宽、延迟、可靠性都是硬约束。两个机器人协作搬箱子如果每秒需要交换几百个浮点数的位姿数据才能对齐动作那这套系统在实验室里能跑通到了 WiFi 不稳的现场就直接崩了。所以一个有价值的投稿方向是设计高效、稳健、可学习的通信协议。这里可以做的文章很多——离散消息而非连续向量、带宽自适应的信息压缩、面向任务的关键信息筛选、通信时机与动作决策的联合学习都在范围内。另一个更有意思的子问题是涌现语言允许智能体自由发展出一套内部交流符号但这种符号不能是捷径式的“对暗号”必须能被人类理解、能被新智能体快速习得、能泛化到未见过的任务上。这个方向需要度量方法目前大家的共识是光看任务成功率远远不够还要看通信协议的简洁性、可迁移性和零样本协作效果。实操心得如果你要往这个方向投请一定在实验里设置一个“无通信”基线和“完全通信”基线把通信成本曲线画出来。审稿人非常在意“通信带来的收益是否值得额外的带宽开销”这个朴素问题。2.2 共享世界模型与协同感知拼图式地理解环境多智能体具身系统里每个机器人只能看到自己那一亩三分地但很多任务需要全局理解。比如两个机器人在一个大房间里找一个目标物体各找各的未必效率最高如果有人先把房间布局和已搜索区域共享出来另一个人就能直奔没有搜过的区域。这个场景让我一下子想到车路协同、多机 SLAM 的思路——本质上是把局部观测拼成全局模型但在通用具身场景里做这件事还非常不成熟。这里有几个很硬的技术难点。第一个是位姿不确定性的传播每个机器人自己的定位本身就有噪声交换地图信息时怎么处理坐标系对齐和误差累积是工程上的大头。第二个是信息表征的选择大家共享的应该是一张占据栅格地图、一个语义场景图还是一个隐空间的神经表征不同表征的通信效率、可解释性和任务覆盖度差异巨大。第三是共识维护当两个智能体对同一区域的信息不一致时怎么判断谁的信息更可信怎么融合而不引入冲突。我觉得这个方向是工作量适中但收益不错的一个选题视觉部分用现成的 detection、segmentation 模型就能搭起来重点是把“多智能体信息融合”这个系统层面的问题做扎实再配合一到两个有说服力的协作任务场景就很有机会被 Workshop 收录。2.3 异构、分工与群体进化从同质到异质的跨越现在绝大多数多智能体强化学习工作都假设智能体是同质的——结构相同、能力相同、奖励相同。但真实任务里一个团队往往由不同形态和能力的机器人组成有会飞的巡检无人机、有会跑的轮式底盘、有带机械臂的操作机器人。它们传感器配置不同、动作空间不同、擅长做的事情也不同。在这种异构设定下“分工”不再是一个可以人为预设的规则而应该是在策略演化过程中自发涌现的结果。从协同进化的视角看这个方向特别有意思。驱动机器人群体自然分化的选择压力来自哪里是任务本身的异构性还是个体能力差异还是资源约束如果一群机器人能在没有任何中心化调度的情况下自己演化出“你负责搜索、我负责搬运、它负责操作”的角色分配那这个系统就具备了很强的可扩展性。技术路线上进化计算比如基于种群的策略优化和 MARL 的结合是一个被讨论了很久但始终没被做透的方向群体智能领域的 flocking、schooling 模型也可以提供灵感。实操心得做这个方向最容易翻车的点是信用分配——任务成功了功劳到底归谁我建议实验设计时引入角色熵作为分析指标如果训练后的团队里每个智能体的行为模式高度趋同说明没有形成真正的分工这比单纯报一个成功率有说服力得多。2.4 仿真到现实的协同迁移难上加难的 Sim2RealSim2Real 在单智能体机器人上已经有大量研究domain randomization、system identification、sim-to-real transfer 这些方法论都相对成熟。但多智能体场景下的 Sim2Real 难度是成倍上升的因为多个智能体的领域随机化会引入组合爆炸每个智能体的动力学参数有不确定性它们之间的交互又让误差互相放大。想象一下两个机械臂协作搬运模拟环境里设定好的摩擦系数如果和现实差一点单臂任务可能还能扛住双臂协作里的力反馈就完全对不上了。另外还有一个现实约束实体机器人的数量通常远小于仿真里能跑的数量。你在仿真里训练了八个机器人协作但实验室里只有两台实体怎么把多人协作策略迁移到少人场景这本质上是一个策略泛化问题。反过来能否从少量实体的经验出发在仿真中生成可扩展的群体策略这些问题在学术上都还很开放。我一直觉得Sim2Real 方向是最容易产出“投主会被拒、但投 Workshop 反而会很出彩”工作的地方——因为主会往往追求完整的算法闭环和惊艳的实验结果而 Workshop 更愿意接受有明确问题意识、能引起深度讨论的工作。如果你所在的实验室有真实机器人平台这个方向值得认真考虑。2.5 评估基准与安全边界基础设施型贡献一个领域要正规化必须有公认的 benchmark。现在多智能体具身智能最大的问题之一是大家各做各的很难横向比较——有人用 Habitat 做导航有人用 MuJoCo 做操作有人用 Isaac Lab 做并行训练平台不统一指标更是五花八门。如果你能提出一个覆盖面广、难度合理、有充分分析的多智能体具身基准这个贡献本身的价值可能超过一篇普通的算法改进。指标设计也值得单独研究。成功率当然是基本指标但对于一个“协同进化”的系统你还需要看更长期的东西这个系统面对环境变化时能否快速适应策略多样性是否在维持还是一开始就塌缩到了单一行为模式如果一个智能体突然离线团队整体性能会退化多少这些指标能回答“系统是否真的在进化”这个核心问题而不只是“系统是否完成了任务”。安全边界在多智能体场景里也格外棘手。多个智能体叠加错误时责任怎么追溯两个机器人的运动轨迹冲突时谁让谁它们的联合安全约束不能碰撞、不能超限位如何分布式地保证这些都是部署前必须回答的问题论文学术价值和工程价值都不低。方向核心问题代表性技术/工具体系投稿难度评估通信机制与涌现语言带宽约束下的高效协作通信协议的可解释性离散通信、消息瓶颈、 emergent communication中容易出分析型工作共享世界模型与协同感知局部观测如何融合为全局理解多机 SLAM、场景图、占据栅格融合中低工程量可控异构与分工进化角色分化如何自组织涌现种群策略优化、MARL进化计算、角色熵分析高算法理论要求高Sim2Real 协同迁移多智能体误差耦合下的真实部署domain randomization、策略泛化偏高需要实体平台或强仿真环境评估基准与安全边界统一评测指标、联合安全约束benchmark 设计、鲁棒性分析中适合组队或系统型工作3. 投稿实操从选题到成稿的完整建议3.1 先搞清楚 Workshop 论文和主会论文的游戏规则很多第一次投 Workshop 的人最容易犯的一个错误就是用主会的标准来要求 Workshop 投稿结果把自己的工作压缩得不成样子。其实 Workshop 的定位和主会有明显的差异主会更看重工作的完整性要方法、要大量实验、要和 SOTA 仔细对比而 Workshop 的目的在于“召集对这个方向感兴趣的人碰撞出新的想法”。所以它的接纳标准更倾向于想法的锐度、问题定义的价值、以及对社区讨论的贡献。这意味着什么一篇 position paper 只要论点清晰、有充分的论据支撑完全可以在 Workshop 获得很好的反馈一个分析型工作哪怕只是系统性地揭示现有方法的失败模式但只要分析扎实也能被录用甚至一个负结果——我们尝试了某某方法发现在多智能体具身场景下就是不如简单基线我们分析了原因——这种工作在 Workshop 里远比在主会有价值。社区需要知道哪些路走不通这能帮大家省下大量的时间。我的建议是投稿前先问自己三个问题我这个工作能不能让读者在读完之后产生一个“原来是这样”的顿悟能不能让至少一波人觉得“这个问题我也想搞”能不能引起一场有价值的争论如果至少能答上一个这个稿子就有投 Workshop 的价值。3.2 选题的三个切入策略基于我对这个领域现状的观察拿到这个征稿通知之后选题可以从三个方向切入。第一个是垂直场景优先。不要做“通用的多智能体具身框架”这种大而全的东西学术红利期已经过了现在这种题目只有大组大厂能接下来。真正有机会的是垂直场景里的深挖多机器人厨房协作一个洗菜一个炒菜一个装盘、家居服务收拾餐桌、叠衣服、分类收纳、仓储物流货架搬运、分拣协同、搜索救援分散搜索、信息回传、关键位置集结、农业采摘多臂协同避开枝叶等等。场景越具体你能观察到的协作模式就越丰富越容易找到别人没注意到的问题。第二个是反向找问题。与其做一个新方法不如认真研究现有方法为什么在某些情况下会失效。比如 MAPPO 在通信受限的多机器人导航里为什么不如简单的优先级规划VLA 模型在需要双机配合的任务里为什么会出现动作冲突这类工作是典型的“以分析带贡献”工作量不一定小但学术影响往往比中等效果的算法更大而且适合 Workshop 的讨论氛围。第三个是跨界迁移。仿生学里大量群体行为模型——蚁群的任务分工、鸟群的编队飞行、鱼群的避障聚集——虽然已经被研究了几十年但把它们用现代学习框架重新实现并放到具身智能场景里验证的尝试并不多。这其实是“协同进化”这个主题最容易产出的方向因为生物学里本来就充满了协同进化的经典案例。如果你有相应的跨学科知识背景这个方向大有可为。3.3 实验设计与平台选型把说服力拉满选题定了之后实验设计就是决定论文命运的关键一环。多智能体具身的工作仿真平台选型直接决定了你实验的上限和可信度这里我按场景给大家一个参考平台适合场景关键优势主要限制Habitat 3.0多机器人导航、协作操作原生支持多智能体视觉逼真度高物理引擎相对简单操作精度一般MuJoCo / MJX机械臂控制、连续动作、密集交互物理精度高GPU 并行快视觉渲染较弱场景复杂度有限Isaac Lab / Isaac Sim大规模并行训练、多种机器人形态并行效率极高支持仿真到实体的迁移上手成本高对显卡要求高SAPIEN / BEHAVIOR-1K精细操作、长时间任务物体交互质量好任务库丰富多智能体支持弱需要自己扩展基线的设置是另一个大坑。多智能体具身领域还没有公认的 benchmark所以你必须自己把对比做完整。我的建议至少包含四条线单智能体方法把多智能体任务强行拆成多个独立单机任务无通信的 MARL 基线证明通信是必要的全通信的 MARL 基线证明高效通信是必要的你的方法。只有这四条线都齐了审稿人才能看出你的增益到底来自什么地方。消融实验更要做细。多智能体系统的模块耦合度很高你至少要拆掉这几个维度来消融通信模块有/无、共享记忆或世界模型有/无、通信范围限制局部/全局、训练时的对手数量固定/变化。每拆一个维度你都要能在性能曲线上解释为什么掉了多少。这里记住一句话多智能体论文的实验分析其实不给审稿人看“你的方法有多强”而是给审稿人看“你对这个系统的理解有多深”。重要提醒不要只报成功率的均值。多智能体系统的训练方差通常很大一定要给出多次随机种子的标准差最好把训练曲线也放出来。审稿人最怕看到一个点估计没有区间的多智能体实验——因为这类系统跑一次一个样没有方差信息的实验结果几乎没有参考价值。3.4 写作结构与篇幅分配在前两页抓住读者Workshop 论文的页数限制通常是 4 到 8 页以具体征稿通知为准但不论页数多少你在前两页要做的事情是一样的把问题讲清楚、让读者产生兴趣、给出贡献点的预览。我见过太多的稿子前面铺垫写了快两页还没有进入核心方法等到真正有意思的内容出来的时候审稿人的耐心已经被耗光了。我建议的结构是这样的摘要直接点出场景、gap、核心贡献不要铺垫太多背景引言前两段讲这个任务为什么重要其中至少用一段篇幅说清楚“为什么现有的单智能体方案和传统多智能体方案都不够”第三段引出你的方法思路最后一段列出贡献点方法部分不要事无巨细地写突出关键设计决策尤其是那些对比现有工作有本质不同的设计实验部分除了主结果务必留出足够篇幅给深入分析——你分析了 bondwidth 的影响、智能体数量的可扩展性、失败模式的分解这部分才是 Workshop 读者最想看的内容。另外一个经常被忽视的点开源代码和演示视频是 Workshop 论文被社区讨论的重要介质。Workshop 的很多交流发生在线下 Poster 环节和线上的讨论群里如果你的视频做得清楚、代码整理得整齐大家就是会多看一眼、多讨论几句。视频里最好直接展示“无通信 vs 有通信”“个体 vs 团队”的对比片段这种视觉冲击力比在论文里写十行文字都管用。4. 常见问题与避坑投稿前最好想清楚这些事4.1 高频雷区一览我把自己在投稿和评审过程中见过的典型问题整理成一个表你在最终提交之前不妨对照自查一遍常见问题具体表现应对建议把 Workshop 当主会投方法堆得特别多实验铺得很广但每个部分都浅尝辄止收敛到一个核心 idea把深度做出来过拟合单一环境只在一个仿真环境里做实验换个房间/布局性能就崩至少引入 2 到 3 种环境变体和随机种子忽视通信约束假设智能体之间可以无限带宽、零延迟地共享信息实验里加入带宽限制、丢包率、延迟时间等真实约束只报均值不报方差实验结论建立在没有统计意义的性能差异上补全多次运行的标准差必要时做显著性检验没有失败案例分析只说系统成功时多强不说失败时多惨烈专门用一节展示典型失败模式并给出解释相关工作和自己的贡献边界不清审稿人分不清你比前人到底多了什么在 related work 里用表格或段落明确划清差异4.2 审稿人视角的逆向思考做了几次 Workshop 评审之后我越来越确信一件事大部分 Workshop 审稿人其实是在很有限的时间里做出判断的一篇稿子前两页决定生死并不夸张。所以与其祈祷遇到耐心的审稿人不如从审稿人的视角把自己的论文审视一遍。我问自己这几个问题这篇摘要能不能让一个只懂大方向的读者在 30 秒内知道你要干什么第一个图片能不能一眼看出系统的架构和输入输出贡献点是不是真的能数出来而不是泛泛的“我们提出了一种新颖的框架”实验部分的第一个图表是不是最核心的那个结果而不是最不重要的消融。如果你的论文都能答上来那大概率是一篇合格的投稿。有一点可能很多人没有意识到Workshop 的审稿意见往往比主会更有价值。因为 Workshop 的审稿人通常就是这个细分领域里的人他们对你工作的批评和建议往往非常具体——“你应该试试加入某某机制”“你引用的某某工作其实已经解决了部分问题”这种意见哪怕是拒稿对你的帮助也非常大。所以建议你不要因为 Workshop 被拒就气馁把意见消化吸收这本身就是一次成长。4.3 时间规划与团队分工现在就开始倒排按 CVPR Workshop 的常规节奏征稿通知发出到截稿通常有 6 到 10 周时间再往前倒推你在看到这篇博文的当下就应该开始倒排你的时间表。第一周内确定选题和核心 idea第二到第三周跑通最小实验、确认方法的基本可行性第四到第六周大规模实验与消融同时确定视频素材第七周开始写作第八周留白用于补实验和修改。这只是一个典型排期具体要按你实验室的资源和团队速度调整。团队分工上一个理想配置至少要有三个人一个人管仿真环境和实验脚本这个人要对 MuJoCo 或 Habitat 非常熟一个人管算法和模型设计负责把 MARL 或相关方法的训练流程跑稳第三个人管视觉分析和论文写作——不是说写手而是负责把实验结果讲成一个有逻辑的故事。如果团队里有一个真正上手过真实机器人的人那就更好了他提供的实践经验往往是论文里最有价值的信息。组队的另一个建议是尽早整理代码仓库不要到 camera-ready 阶段才想起来开源。一方面整洁的仓库能帮你发现自己实验脚本里的 bug另一方面很多 Workshop 的讨论是围绕已有代码展开的早开源等于早宣传。另外在写论文之前就把视频的结构想好——问题演示、方法概览、基线对比、失败案例、定性分析这些素材是在做实验的过程中就需要刻意采集的而不是写完论文之后补录的。这个领域最好的消息是一切都刚刚开始。多智能体具身智能的协同进化无论从算法、系统、还是评估的角度都有大量未解问题而 CVPR 的 Workshop 恰好为一个新想法提供了低门槛的展示平台。我个人在实际操作中的体会是Workshop 投稿的压力其实比主会小很多你完全可以把一个更有风险、更大胆的想法拿到这里来试水哪怕被拒收获也比憋一个“安全但无聊”的主会投稿大得多。如果你看完这篇决定动手我的建议是从一件小事开始选一个具体的两到三智能体协作任务用你熟悉的仿真平台搭一个简单的 baseline先跑通一次完整的训练流程然后记录下它表现最好的场景和彻底崩溃的场景——前者是你的起点后者是你论文的种子。任何大文章都是从小实验开始的多智能体具身智能这个方向尤其如此。
阅读完成 · 觉得有帮助?