工业AI这几年一个很明显的变化是它终于开始往车间的中控室、往产线主控逻辑里走了。过去我们聊工业AI说来说去都是视觉质检、设备预测性维护、能耗优化这些外围场景AI像一个旁站观察员发现问题之后还是要靠人来拍板。而这一轮以大模型和智能体Agent为代表的技术正在把AI的位置从旁观者推向操盘手——中工互联在探索的工业智能体协同就是这一波变化里相当有代表性的方向。这篇文章不打算讲概念 PPT我想结合自己在一线看到的场景、踩过的坑把AI为什么能从外围走向核心工业智能体到底和普通AI应用有什么区别多智能体协同在车间里怎么落这几件事拆开说清楚。不管你是做工业软件、做企业数字化还是想给工厂引入AI能力这篇应该都能给你一些能直接拿去用的判断标准。1. 从旁站观察员到产线操盘手工业AI的位置之变1.1 先说说过去十年AI在工业里到底干了什么很多人一提工业AI脑子里浮现的是摄像头检测缺陷、听声音判断设备故障、用历史数据预测零件寿命。这些应用没错而且确实产生了价值但它们有一个共同特点全部工作在决策链条的下游属于发现问题之后通知人的定位。举几个典型的例子视觉质检相机拍图模型判断有没有划痕、脏污、焊点缺陷输出NG/OK信号最终由人工复判或机械臂剔除。预测性维护采集振动、温度、电流信号模型预测设备剩余寿命或故障概率推送给维修工单系统维修策略还是人来定。能耗优化统计各产线用能数据找到异常跑冒滴漏给出节能建议落地执行要靠能源管理员去现场操作。这个阶段我习惯叫它工业AI 1.0。它的核心价值是感知增强——用模型替换掉人眼、人耳的部分重复性劳动但决策和执行的闭环仍然捏在人手里。原因也很直接模型能力不够不敢让它碰生产核心数据孤岛严重模型拿不到全流程信息实时性跟不上等模型算完现场工况早就变了。1.2 走向核心到底意味着什么AI从工业外围走向核心这句话很多人理解成AI模型变强了所以能用在新场景。但实际上位置变了整套技术逻辑都得跟着变。从外围走向核心最本质的变化是三个第一从建议型变成控制型。外围AI的产出物是报告和建议人读了之后再做动作。核心AI的产出物是指令和动作——直接调节工艺参数、下发调度指令、修改产线节拍。这意味着AI的每一个输出都会变成物理世界的实际动作错误代价从浪费一张纸的报告变成废掉一批料甚至停机。第二从单点优化变成全局优化。外围AI只看局部比如一台设备、一条产线。核心AI要面对的是多个环节耦合在一起的复杂系统接了急单排产要变物料要跟着调设备负荷要重新分配质量风险要重新评估。任何一个环节的决策都会传导到其他地方。第三从离线计算变成实时在线。现场决策往往只有几十秒甚至几秒钟的窗口期AI不再是算完传给平台就行而是要嵌入到产线的控制回路里与PLC、DCS、MES这些既有系统直接交互。这三个变化叠加起来传统训练一个模型再部署的玩法就不够用了。模型不再是唯一的智能载体而是需要一组能互相通信、分工协作的智能体每个人负责一个专业域合起来面对整个生产系统。1.3 什么在推动这次位移每次技术范式的转移都不是单一因素驱动的。工业AI能从外围走向核心我看到的推力至少有三个大模型的泛化与推理能力。过去做工业模型一个场景一个模型换个产品规格就要重新标数据训练。大模型让用一套底座适配多种业务成为可能知识可以通过提示词和检索去灵活调度边际成本大幅下降。边云算力下沉。现在边缘盒子可以轻松跑百亿级模型GPU和NPU的价格也在持续下探。把推理放到车间、放到控制柜旁边几十毫秒的延迟不再是问题。工业互联网平台把数据底座补齐了。过去OT数据、IT数据各玩各的现在设备数据、工艺数据、订单数据、质量数据能在一个平台上打通智能体才有全局视野可用。这三股力量是相互咬合的没有数据底座智能体就是无米之炊没有大模型有了数据也只能做传统小模型能做的那点事没有边缘算力核心控制所需的实时性根本达不到。中工互联探索的工业智能体协同模式本质上就是把这三件事拧成一个整体来设计。2. 工业智能体不是能聊天的机器人先把概念掰清楚现在智能体这个词被用得太滥了聊天机器人也叫Agent自动化脚本也叫Agent。但在工业场景里我们必须把边界划清楚——工业智能体和普通AI应用之间差着好几个维度。2.1 智能体与大模型应用的本质差异我见过很多企业在汇报里说我们接入了大模型所以有了智能能力。但接入大模型做一个问答机器人和做一个能干活、能决策、能担责的工业智能体完全是两码事。差异可以用这张表说清楚维度传统大模型应用工业智能体交互方式你问我答一次性生成内容接受任务目标自主规划执行路径记忆能力单轮对话无状态多轮记忆维护任务上下文和业务状态工具调用不调用或只调简单检索能调用工业API、查询实时数据、下发指令输出形态文本/代码结构化指令、参数值、动作序列、告警事件容错要求答错可以重来关键决策必须有规则校验和兜底责任边界内容提供者参与生产闭环的虚拟岗位关键区别在于智能体有目标任务、有记忆、能主动调用工具、能对自己的行动负责。它不是问一句答一句而是给定一个目标自己去拆解步骤、调工具、做判断、推进闭环。2.2 工业智能体的最小闭环要成为一个合格的工业智能体至少得跑通这个四步回路感知 → 决策 → 执行 → 学习反馈。拿一个很常见的场景——工艺参数调节——来说感知智能体从史中读取当前温度、压力、转速这些实时数据同时拿到当前的订单要求的质量标准。决策基于工艺知识库和历史最优参数组合算出当前批次应该调整的目标值。这里的大模型负责理解复杂工艺描述和推理而具体的数值校验交给规则引擎和优化算法防止模型胡算。执行把调整指令通过OPC UA/Modbus等工业协议写入PLC或者生成一条操作建议推到操作员终端上由人来确认执行。学习反馈执行完一段时间后智能体把实际质量数据、设备反馈吸收回来更新自己的经验记忆下次决策会参考这次的结果。这个闭环和传统AI的本质区别是传统AI到输出预测结果就结束了智能体一定要把手伸到执行端并且从执行结果里学习。所以判断一个系统是不是真正的工业智能体就看它有没有闭环而不是看它用了多大的模型。2.3 工业场景给智能体加了什么约束通用领域的智能体可以放飞一点但是在工业现场规则完全不一样。我给读者三个必须记住的约束确定性优先。工业生产讲究可重复、可追溯。智能体的决策不能每次都不一样。同一个工况昨天给出方案A今天给出方案B这在通用场景可能叫多样性在工厂里就叫不稳定。所以工业智能体的输出一定要经过规则校验把异常区间圈住。可解释性和审计。现场出了质量问题、设备事故要能说清楚当时AI为什么这么决定。智能体的推理链路要全部留痕关键决策要能回溯到依据的哪条规则、哪段历史数据。人的兜底授权。再成熟的智能体系统初期也一定要设计人工确认机制。把智能体看作专家助手而不是无人驾驶让人的审批权逐步下放而不是一天之内甩手。3. 多智能体协同为什么单点智能推不动工业核心其实把单个智能体做得再强放到真实工厂里也远远不够——这一点是我在中工互联的方案讨论里感受最深的。3.1 工业问题的复杂网络性工厂里的生产问题从来不是单因果的。一个典型例子某条产线要临时插一个急单。排产必须重排牵动的是各工位的加工顺序物料库存可能不够需要调用库存数据确认并触发采购或调拨某些设备可能要超负荷运行设备的健康状态成了约束条件新规格产品没有历史质量参数质检规则也要临时调整。如果是传统单点AI每个环节都能单独做一个模型排产优化模型、库存预测模型、设备故障模型、质量检测模型。但它们是各自为政的——排产模型不会主动问设备模型连续超负荷三天这台机床扛得住吗库存模型也不会知道排产计划变了之后哪些物料突然变成瓶颈。这就是工业核心场景对协同的硬需求决策之间强耦合不能靠单点智能各自输出。3.2 协同的三个技术层次多智能体协同听着玄乎但拆开之后其实是有清晰的工程手段的。我认为至少要解决三个层面任务分解层怎么分工。一个复杂目标进来由编排器Orchestrator拆成子任务分给对应的专业智能体。比如优化本周生产计划这个目标被拆成产能评估子任务、物料齐套子任务、设备约束子任务、交付优先级子任务。每个任务有明确负责人——这就是Agentic Workflow里的任务编排。协商编排层怎么定顺序和解决冲突。各智能体做完自己的分析后结果之间可能打架。排产Agent说要优先跑A订单设备Agent说A订单需要的机器正在大修。系统必须有一套协商机制比如让各智能体把自己的约束条件、可接受范围、优先级提出来由协调Agent统一求解或者引入投标-评标式的机制。这在计算机领域有成熟的MAS多智能体系统理论但工业场景的难点在于协商过程有时间限制必须快速收敛。共享上下文层怎么对齐信息。所有智能体必须看到一致的世界状态。这个状态包括设备实时状态、物料库存、订单变更、质量异常等。工业场景建议的做法是引入一个轻量级的数字孪生空间或统一的实时状态库所有智能体对状态库进行读写而不是互相直接传消息——这能避免信息不一致带来的连锁误判。三个层次缺一不可。任务分解解决的是谁干什么协商编排解决的是意见冲突怎么处理共享上下文解决的是大家看到的世界是不是一个世界。3.3 和软件世界Agent的区别在哪这两年IT领域的AutoGPT、各种Agent框架很火很多人以为把那一套搬到工业来就行。我明确说不能直接搬。IT领域的Agent跑的是代码和API出错了重试一次就行数据都是0和1没有任何物理代价。工业Agent每一步动作都可能影响真实的设备、物料和人员安全所以它必须额外具备时间确定性一个Agent算10分钟没问题在排产里可能都来不及了。与物理系统的实时握手要监听PLC的实时心跳不能只看历史数据库。安全护栏动作指令要经过专门的规则引擎校验越权操作直接拦截。故障接管Agent系统宕机时必须能平滑退回到人工/原有控制系统不能造成产线停摆。理解了这些区别再去看工业智能体协同这个模式的优势和难点就有谱了。4. 中工互联的探索实践工业智能体协同怎么落到车间中工互联这几年的探索我关注到一条主线很清晰不满足于做单点AI工具而是想搭建一个能让多个智能体在工业现场协作的体系。下面我把这个方向背后的工程逻辑拆开讲。4.1 从可复用的生产环节切入任何新架构落地都建议从高频、可复制、好评估的场景切入而不是一上来就挑战整个黑灯工厂。在工业智能体协同的探索里几类场景我认为生命周期和复用性都很好智能调度排产多个Agent分别代表设备、物料、订单、人员协同排产这在多个工厂之间可以复制方法。设备健康与维修协同诊断Agent发现异常备件Agent确认库存维修计划Agent安排窗口作业指导Agent生成维修工单。质量异常追溯与分析质量Agent发现异常工艺Agent回溯参数设备Agent查状态联动定位根因。能源与生产的协同优化生产计划Agent、设备Agent、能源Agent之间互动避开峰电时段高耗能工序。这类场景的共同特征是决策链条横跨多个专业域数据和责任天然需要分工非常适合多智能体协同的架构。4.2 一个典型的多智能体协同流程拆解拿紧急插单后的生产重排来举个例子这是工厂里最能体现多智能体价值的经典场景之一。参与角色大致是这样分的智能体职责订单Agent评估新订单的交付时间、优先级、余量空间设备Agent上报各产线设备当前负荷、可用产能、保养窗口物料Agent核对关键物料齐套状态给出缺料预警工艺Agent评估新订单工艺路线检查参数包是否就绪调度Agent汇总各Agent输入输出重排方案流程大致是新订单进入订单Agent做初步评估输出需要调整的优先级关系。调度Agent把它转换为一次重排请求广播给设备、物料、工艺三个Agent。各Agent并行执行自己的分析设备Agent查负荷并返回产能约束物料Agent查库存并返回缺料风险工艺Agent查BOM和工艺路线。四份结果回到调度Agent调度Agent综合约束条件用优化引擎跑一遍排产求解生成新的计划草案。草案推送给生产计划员做人工确认确认后才写入MES系统同时把变更通知推送给相关工位终端。这套流程里最有价值的不是某一个Agent的模型有多强而是整个链条能在几分钟内完成且每一步都可解释、可追溯。如果让传统方式来做排产工程师要挨个找设备员、物料员、工艺员开会一个急单可能耗掉半天。4.3 平台化的技术底座要让这套协同体系稳定跑起来底座设计是关键。中工互联的探索方向里我看到几个必要的构件工业大模型底座。不需要追求模型参数最大而是要能在垂直领域可靠地完成信息抽取、知识问答、方案生成。核心是挂上企业自己的知识库设备手册、工艺文件、历史案例用RAG方式做检索增强让模型基于企业事实说话。统一状态中枢。所有Agent共享的实时状态库接进设备数据、MES工单、WMS库存、质量检测数据。状态中枢要做时序对齐和主数据治理否则各Agent拿到的是互相矛盾的数据。安全沙箱与规则引擎。智能体输出的任何指令都需先过规则校验层。比如温度调到85度这个指令规则引擎会检查是否在工艺允许区间内超出直接拦截并告警。人机协同界面。不只是给操作员一个聊天框而是要给任务、状态、依据、确认四要素的完整工作台。所以智能体的建议、推理依据、风险提示都要在同一屏展示方便人快速判断。边云两级部署。云端负责知识更新、模型训练、全局优化边缘端负责实时感知、局部决策和快速执行。两边通过可靠的消息通道同步状态保证即使在边缘断网的情况下现场兜底逻辑也能运行。这套底座真正难的不是某一个模块而是把大模型的非确定性约束在工业的确定性框架之内。模型负责提出可能性规则负责筛选可行性人负责最终授权三者形成互补结构。5. 把智能体推进车间我踩过的坑和看到的坎技术架构讲得再顺落地的时候一定会遇到各种各样的现实问题。我自己参与和观察过的项目里有一批问题是共通的提前知道能省很多时间。5.1 模型幻觉在工业里不是bug是事故这是所有工业AI项目绕不开的第一座大山。大模型天生有概率性它可能一本正经地编造不存在的设备参数、编一个不存在的工艺步骤。在办公场景这种幻觉最多让文档多返工一次在工业场景可能直接导致设备损毁或质量事故。我的应对经验是三层拦截第一层RAG限定生成范围。所有关键数值尽量从知识库里检索而不是让模型回忆。模型生成的内容里凡是涉及设备型号、工艺参数、物料编码的字段必须带出处。第二层规则引擎硬校验。数值类输出一律走区间检查逻辑类输出走专家规则校验。校验不过的就拦截并提示重生成。第三层人工确认兜底。系统上线初期保持建议模式所有产生实际动作的指令必须由人确认执行等积累足够多的置信数据后再逐步放开权限。一个现象供参考AI在工业场景的可用性不是看它的准确率有多高而是看它的错误是否闭环控制在安全边界内。准确率99%和99.9%在办公室差别不大在工厂里可能就是一个月的损失和一年的损失。5.2 数据打通比想象中难难点不在技术而在治理很多项目一上来的规划都是我们有工业互联网平台数据都有了。但真到做智能体协同的时候会发现数据有和可用是两码事。实际踩过的坑包括时序不同步设备数据是秒级采集MES工单是分钟级更新两者对齐时经常错位导致某个Agent读到的是上一单的状态。主数据混乱同一台设备设备管理系统里叫PUMP-01MES里叫1号循环泵DCS里叫P-101A三个Agent读到不同编码互相沟通时根本对不上号。数据质量无治理很多点位长期存在丢包、跳变模型拿这种数据训练还好在线推理时就容易产生瞬间突变的错误判断。这个问题的解决没有捷径必须在智能体上线前做一次集中的主数据清洗和时序对齐。我见过有项目为了省这一步结果后期花了三倍时间在排查为什么两个Agent结论矛盾最后发现是同一台设备用了三个编码。5.3 老师傅的信任和组织适配比技术更难车间里的工艺员、老师傅见得多了对AI系统的态度普遍是你来试试但我信不过。这很正常毕竟他们要为产量、质量、安全负责凭什么让一个聊天框来指挥生产信任建立靠两件事一是透明可见。让老师傅能看到AI的每一步推演依据看到它是怎么从工艺手册和历史数据里得出方案的。我在推进项目时常说AI能不能说服人不在于答案多完美而在于理由多扎实。二是渐进授权。从AI提建议、人做决定开始跑两三个月让老师傅积累对系统的判断再逐步开放到AI做常规决定、人处理异常。这里切忌节奏过快——某个环节出一次明显失误前期建立的信任就全崩了再修复要花上双倍时间。5.4 技术选型的务实建议很多团队一上来就问用哪个大模型好我的建议是把精力分到更重要的地方通用大模型 专用小模型 规则引擎的混合架构在当前阶段最务实。大模型处理理解和泛化任务小模型处理高精度预测任务规则引擎处理确定性校验。单靠任何一种都撑不起完整的工业智能体。不要追求完全自主决策。工业场景的人机协同在很长一段时间内都优于全自动驾驶设计系统时留好人工接口比模型调参重要得多。先横向打通再纵向加深。先把排产、物料、设备这几个最核心的Agent协同跑通再逐步加工艺优化、能耗管理这些新Agent避免一上来就铺开造成难以驾驭。6. 往远看工业智能体协同的演进方向沿着这个方向继续往前走能看到的趋势其实已经比较清晰了。6.1 从协同执行到自组织优化现在的多智能体协同还是编排器主导、各Agent按指令办事一定程度上还是中心化的。随着系统磨合成熟会走向更加自组织的形态智能体之间根据现场实时状态动态调整协作关系。设备Agent发现异常后不是等调度Agent发指令而是主动向维修Agent发出协同请求同时通知生产Agent调整节拍。这种点对点的协商能力会把系统响应速度再提升一个量级。6.2 工业软件形态的变化传统的工业软件以流程固化为设计思想ERP、MES、WMS各管一段数据跟着流程走。工业智能体协同起来之后软件的逻辑会更接近目标驱动——你要什么结果系统自动组织数据、算法、流程来完成。这会让工业软件从操作型系统逐步进化成协作型系统接口和交互方式都会发生根本变化。6.3 对从业者的启示这个方向对一线从业者的能力要求也在变。过去做工业AI核心能力是建模和调参现在更重要的能力变成了理解业务链条、拆解任务边界、设计Agent之间的交互逻辑。这其实是对懂行业、懂系统、懂新技术的复合型人才的需求而不是单纯找几个算法工程师就能撑起来的。我还想说AI走向工业核心不是某个模型突然突破实现的而是一整套系统工程——数据、算力、协议、安全、组织、人的信任——协同推进的结果。中工互联在这个方向上做的探索本质上也是在回答一个问题当AI真正开始参与工厂的日常决策它应该以什么样的组织形态存在多智能体协同给出的答案是不是让一个超级AI接管一切而是让一群专业AI像车间里的老师傅们那样分工、商量、配合着把事情干成。我自己在这个领域看过太多次模型很强、落地很难的局面也越来越认同一个判断下一阶段工业AI的胜负手可能不在谁的模型参数多而在谁能先把多智能体协同这套生产关系理顺。把任务分清楚、把数据对齐、把安全兜住、把人机信任建起来——这些事看着不起眼却决定了大模型能不能真正在车间里站稳脚跟。如果这篇对你有一点帮助我的建议是不用急着追最新的Agent框架先回自己工厂里找一条流程画一画如果让三个智能体来干它们分别负责什么、怎么商量、怎么交接、谁来兜底把这个逻辑理通了再动手试。这条路需要很多细节上的打磨但方向我认为是对的。
阅读完成 · 觉得有帮助?