首页 / 资讯中心 / 文章详情

【ICLR 2026】GraphPlanner 论文解读:图记忆增强的多智能体 LLM 智能路由|从多智能体编排视角

【ICLR 2026】GraphPlanner 论文解读:图记忆增强的多智能体 LLM 智能路由|从多智能体编排视角 ★ FEATURED ARTICLE
摘要本文解读 ICLR 2026 论文《GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs》。该论文提出GraphPlanner——面向多智能体 LLM 的异构图记忆增强 agentic 路由器通过把路由决策建模为马尔可夫决策过程MDP上的图生成、用异构图GARNet同时融合历史交互记忆与当前工作流记忆并在每一步联合选择智能体角色Planner / Executor / Summarizer与LLM 骨干把挑一个模型升级成生成一张协作工作流图。实验表明GraphPlanner 在 14 个任务、6 个领域上平均准确率比最强基线提升 9.3%同时把训练 GPU 开销从 186.26 GiB 降至 1.04 GiB并在未见任务、未见 LLM、未见角色三个维度上具备零样本能力为多智能体系统的编排与成本控制提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQGraphPlanner 和普通 LLM 路由器有什么本质区别GraphPlanner 需要多大的算力换一批没见过的模型还能用吗历史记忆到底起了多大作用它的代码开源了吗参考链接论文基本信息项目内容标题英文GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs标题中文图记忆增强的多智能体 LLM 智能路由作者Tao Feng, Haozhen Zhang, Zijie Lei, Peixuan Han, Jiaxuan You机构University of Illinois Urbana-Champaign (UIUC) · U Lab会议ICLR 2026arXivhttps://arxiv.org/abs/2604.23626项目网站https://github.com/ulab-uiuc/GraphPlanner背景与动机LLM 路由要回答一个很实际的问题面对同一个查询从一堆规模和价格都不同的模型里挑哪个现有方法大致分两类。单轮路由器RouterKNN、RouterMLP、RouterSVM、RouterDC、GraphRouter用查询的嵌入或分类器一次性给出分配结果简单高效但既不能多步推理也不会协调多个模型多轮路由器Prompt LLM、Router-KNN-MR、R2-Reasoner、Router-R1把推理与路由交替进行可它把每次调用当作独立动作没有显式建模模型之间的协作于是容易出现冗余调用、上下文语义冲突以及无法利用不同模型的互补长处。论文把视角切到更现实的agentic LLM 场景任务需要规划、需要多轮协作、还需要记忆。作者指出这里有三个硬约束。第一查询、响应与候选 LLM 之间的关系高度异构且复杂——查询会分叉响应会互相影响同一批模型可能给出互补也可能互相矛盾的信息。第二agentic 路由的奖励是延迟的一个早期误分配会级联成多余的调用和更差的下游推理形成典型的信用分配难题。第三如何充分利用历史交互记忆仍是开放问题过去的工作流轨迹里藏着成功的协作模式、错误模式与高效分工但现有路由器很少系统性地使用它们。在相关工作层面自动化工作流生成ADAS、AFlow、AgentSquare已经能自动搜索协作流程但它们大多假设各个智能体能力同质而图结构记忆的代表工作 G-Memory 则把多智能体历史组织成层次图并按角色检索。GraphPlanner 的定位正是这两条线的合流点把异构性、协作结构与记忆放进同一张图里用同一个策略做联合决策。研究主线从问题到结论图 9研究主线——从只选模型的路由范式到 MDP 图生成、GARNet 双层异构图与 PPO 联合优化。基准/方法设计论文先把路由范式摊开对比单轮只根据查询选一个模型多轮把历史上下文串起来顺序选模型而agentic 路由维护一张工作流图每个节点同时绑定「角色 模型」因此能显式表达任务分解、并行执行与结果汇总。这个差别不在模型池大小而在于路由器是否把协作结构本身当作决策对象。GraphPlanner 的设计可以拆成三层。第一层是问题形式化把工作流生成写成 MDP第 $t$ 步的动作是 $a_t (\alpha_t, m_t)$其中 $\alpha_t$ 是角色、$m_t$ 是 LLM 骨干因此动作空间大小为 $|\mathcal{A}| 3K$。第二层是状态表示用异构图 GARNet 同时承载工作流记忆与历史记忆。第三层是优化目标奖励在终局才计入任务效用中间步只扣成本形式为 $r_t U(\hat{y}, y^*) - \alpha C(a_t)$。图 1三种路由范式对比。单轮路由器只根据查询选模型多轮路由器顺序选模型agentic 路由器在工作流图上同时决定角色与模型本文属于第三类。分类全景图 10分类全景——单轮 / 多轮 / agentic 三类路由范式以及 GraphPlanner 的角色、记忆、优化三个设计维度。方法细节MDP 四要素。状态被定义为当前正在求解的子查询转移由角色决定planner 把查询拆成子查询并把下一个状态设为第一个子查询executor 直接作答并推进到下一个待解查询summarizer 汇总已完成的多路响应。为了保证生成的工作流语义合法策略每步都受动态掩码约束第一步不允许选 summarizer最后一步只允许 executor并且 planner 的出现次数受超参数 $P_{\max}$ 限制。GARNet 的共享 role hub。每个「LLM 角色」的组合对应一个固定节点这些节点被工作流记忆图与历史记忆图共同使用成为两张图之间的结构锚点。因此新产生的子查询与响应只需挂到同一批 hub 上多轮之间通过共享邻居间接相连不需要显式的时序边就能复用累积经验。编码是嵌套的先编码历史图得到角色嵌入再以它为条件编码工作流图最后把当前查询表示与候选动作节点做匹配得到动作概率分布。训练与实现细节。策略与价值函数都由 GARNet 参数化使用 PPO 优化图消息传递借助 torch_scatter 做高效稀疏聚合每个 episode 结束后把整段轨迹沉淀进历史图。这里有一个值得注意的设计取向GraphPlanner 是轻量路由头参数量远小于路由器自身也要微调 LLM 的方案这也是它训练开销极低的直接原因。图 2GraphPlanner 总览。GARNet 融合工作流记忆图与历史记忆图输出「LLM 角色」动作轨迹回填工作流图整段 episode 再沉淀进历史图。实验设计与结果评测覆盖14 个任务、6 个领域域内有数学GSM8K、MATH、代码MBPP、HumanEval、常识推理CommonsenseQA、ARC、OpenBookQA、世界知识NaturalQuestions、TriviaQA与综合知识MMLU、GPQA共 11 个任务域外有 LogicGrid、MGSM、CommonGen 三个只用于评测的任务另有 AIME 2016–2025 作为额外的竞赛级数学测试。骨干池为 12 个 7B 到 176B 的开源 LLM其中 Mistral-Nemo-12B 与两个 Mixtral只在评测阶段加入用于检验对未见模型的泛化。指标为任务准确率 Acc 与按 token 计价的成本 Cost基线包含五个单轮路由器与四个多轮路由器。Phase-2路由器自行生成工作流的主结果如下路由器类型平均 Acc平均 CostΔAcc (%)Router-KNN单轮49.7%169.29.3RouterDC单轮54.3%138.713.9Router-R1多轮51.8%76.311.4R2-Reasoner多轮50.1%643.69.8GraphPlanner多智能体63.6%605.023.2Phase-1工作流由用户给定路由器只为每个节点挑 LLM的两种设置设置GraphPlanner 平均 Acc最强基线平均 AccΔAccDepth 1, Width 358.60%54.80%12.00Depth 2, Width 260.40%56.20%11.69零样本外推与效率数据维度GraphPlanner对照未见任务平均 Acc78%GraphRouter 46% / RouterDC 58% / Router-R1 38%AIME零样本14.7%最强基线 7.56%训练 GPU 开销1.04 GiBRouter-R1 186.26 GiB训练总时长120 min300–360 min推理耗时1.2 s/query基线 2.1–10.5 s/query图 3Phase-1 评测示意。工作流拓扑由用户给定Depth 为 planner 层数Width 为每个 planner 的子查询上限路由器只负责为每个节点挑 LLM 骨干。图 4调整奖励中的成本系数 $\alpha \in {0.0, 0.1, 0.3, 0.5, 0.9}$GraphPlanner 始终构成 Pareto 前沿。附录的四组补充实验同样支撑结论加入 Thinker 与 Verifier 两个新角色后数学准确率从 67.0% 升到 70.5%而不做角色专项训练的 zero-shot 也能达到 68.5%、few-shot 达到 69.6%把 GARNet 换成 GAT 或 GraphTransformer 后数学分数降到 0.643 / 0.647均低于 GARNet 的 0.670用 LLM 直接摘要或检索历史History-summary / History-retrieval也只到 0.51 / 0.46。此外附录给出了数学、代码、简单问答三类 Phase-2 工作流实例数学题走「分解 → 并行执行 → 汇总 → 再执行」的多阶段路径代码题触发嵌套规划而蒙娜丽莎的作者是谁这类问题直接走单步 executor。图 5把训练期未出现的 Mistral-Nemo 与两个 Mixtral 加入骨干池GraphPlanner 在五个方向仍全面领先 GraphRouter 与 Router-R1。图 6历史记忆消融。w/o History 明显掉点Homo-Graph 只恢复一部分Hetero-Graph 更好完整 GARNet 最优。图 7inductive 与 transductive 推理对照。直推式复用训练期历史、精度更高归纳式更轻量且仍优于最强多轮基线 Router-R1。图 8Phase-2 生成的三类工作流——数学分解/执行/汇总/再执行、代码嵌套规划、简单问答单步直出。结果对比总结图 11结果对比——GraphPlanner 以 63.6% 平均准确率、1.04 GiB 训练开销与 78% 未见任务准确率同时领先。关键发现路由从分类问题变成序列决策问题GraphPlanner 每步联合选择角色与骨干动作空间为 $3K$在 Phase-2 把平均准确率推到 63.6%比最强基线高 9.3%。图结构是性能来源而不是装饰换 GAT、GraphTransformer、同构图或直接去掉历史记忆性能都会下降Hetero-Graph 优于 Homo-Graph完整 GARNet 最好。效率与精度可以同时改善训练 GPU 开销 1.04 GiB对比 Router-R1 的 186.26 GiB训练总时长 120 min对比 300–360 min推理 1.2 s/query对比 2.1–10.5 s。零样本外推覆盖三个维度未见任务平均 78%基线 38%–58%未见 LLM 无需微调即可加入未见角色 zero-shot 68.5% / few-shot 69.6%都高于原设定 67.0%。成本权衡可调通过奖励里的成本系数 $\alpha$模型可在高精度高成本与低成本轻量模式之间连续切换始终保持 Pareto 前沿。历史信息必须用结构化方式处理让 LLM 直接摘要或检索历史History-summary 0.51 / History-retrieval 0.46远不如把历史组织成图0.67。局限性角色集合固定主实验只定义 Planner / Executor / Summarizer 三种角色更丰富的角色画像需要重新训练或外推——这也正是作者给出的未来方向。直推式推理有存储代价transductive 模式需要保留训练期交互历史来换取精度inductive 模式更轻量但精度略低。成本为估算口径$C(a_t)$ 由 GPT-2 tokenizer 计数乘以价目表折算并未直接测量真实时延或能耗。骨干池与任务有限12 个开源 LLM、14 个文本任务多模态输入与闭源 API 模型未纳入评测。常见问题FAQGraphPlanner 和普通 LLM 路由器有什么本质区别普通路由器回答这个查询该交给哪个模型GraphPlanner 回答这个查询该由哪些角色、用哪些模型、按什么结构协作完成。它把工作流生成写成 MDP每步动作是「角色 LLM 骨干」的组合因此能表达分解、并行执行与汇总而不仅仅是选一个模型。GraphPlanner 需要多大的算力很小。Phase-2 训练只消耗 1.04 GiB 的 GPU 显存而多轮路由器 Router-R1 需要 186.26 GiB训练总时长 120 分钟推理平均 1.2 秒每查询。它是轻量路由头不需要对每个骨干 LLM 做微调。换一批没见过的模型还能用吗可以。评测时把训练期未出现的 Mistral-Nemo-12B 与两个 Mixtral 加入骨干池GraphPlanner 在数学、代码、常识、世界知识与综合知识五个方向仍全面领先同类路由器新角色Thinker / Verifier也能零样本接入。历史记忆到底起了多大作用很大但前提是用对形式。去掉历史记忆会明显掉点把历史交给 LLM 做摘要或检索0.51 / 0.46也远不如把历史组织成异构图0.67。原因是交互历史异构且噪声大图结构才能把角色特异的信息与质量信号分离出来。它的代码开源了吗论文摘要在发布时就写明代码地址为 github.com/ulab-uiuc/GraphPlanner但同一份稿件里的 Reproducibility Statement 仍写着发表后发布两处口径不一致实际使用前建议以仓库现状为准。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2604.23626官方代码仓库ulab-uiuc/GraphPlannerhttps://github.com/ulab-uiuc/GraphPlannerGraphRouterA Graph-based Router for LLM SelectionsICLR 2025https://arxiv.org/abs/2410.03834Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learninghttps://arxiv.org/abs/2506.09033Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Routerhttps://arxiv.org/abs/2506.05901Proximal Policy Optimization AlgorithmsPPOhttps://arxiv.org/abs/1707.06347GPTSwarm: Language Agents as Optimizable Graphshttps://arxiv.org/abs/2402.16823AFlow: Automating Agentic Workflow Generationhttps://arxiv.org/abs/2410.10762G-Memory多智能体历史组织为层次图并按角色检索https://arxiv.org/abs/2506.07398给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
阅读完成 · 觉得有帮助?
咨询建站