我最近在看到NVIDIA GB200 NVL72这款产品资料时反复在琢磨一个问题72个GPU加36个CPU直接塞进一个机柜还要保持大模型训练时那种动辄满负载跑上几周的状态这玩意儿到底是怎么散热的要知道传统风冷服务器机柜的散热能力也就十几千瓦而NVL72这个级别的设备整柜功率算下来直接奔着一百多千瓦去了中间差了差不多一个数量级。这种情况下液冷就不再是选配而是唯一的出路。这篇文章我打算把GB200 NVL72从架构到散热再到部署从头到尾拆一遍。重点回答“为什么72个GPU36个CPU必须靠液冷”这个核心问题同时把液冷系统在数据中心真实落地时那些容易被忽略的细节也一并展开。不管你是做数据中心基础设施的还是搞AI集群运维的这篇文章应该都能给你一些能直接用上的参考。1. 这次升级不是“多插几张卡”1.1 机柜级Scale-UpNVL72的真实定位很多不熟悉AI基础设施的朋友一听“服务器”就会想到我们机房角落里那种1U或2U的机架式设备两个CPU插槽后面再挂几张GPU卡。但GB200 NVL72完全不是这个套路它是一个机柜级的系统英文里叫“rack-scale system”。什么意思呢整个机柜被当作一个超大号的“单节点”来设计计算、交换、供电、散热全部集成在一个标准机柜里对外提供的是类似“一台巨型GPU”的能力。这种设计思路在AI大模型训练场景里非常重要。大模型尤其是指数级参数规模的那种MoE模型需要在海量GPU上做并行训练。传统方案是堆8卡服务器再用高速交换机把几十甚至几百台服务器连成一个集群。问题是跨节点的通信延迟和带宽瓶颈会越来越明显模型越到后面大部分时间都耗在等待数据同步上。NVL72的做法是在一个机柜里把72个GPU用NVLink全互联起来形成一个高带宽、低延迟的“GPU域”GPU之间通信带宽可以达到每秒上百TB的级别。对训练大模型来说这是一个根本性的效率提升。所以NVL72不是简单地把GPU数量从8张变成72张它是把“集群”的语义从“一堆服务器交换机”压缩成了一个“机柜”。这种超级密度带来的直接后果就是功耗和热密度的爆炸式增长。1.2 72个GPU与36个CPU从哪来的要理解NVL72的名字得先理解它的基本计算单元GB200超级芯片。一个GB200超级芯片由1个Grace CPU加2个Blackwell架构的B200 GPU组成CPU和GPU之间用NVLink-C2C高速互连形成一个紧耦合的计算节点。NVL72机柜里放了36个这样的GB200超级芯片所以算下来就是36个Grace CPU加72个Blackwell GPU。每个GB200超级芯片被封装在一个计算托盘Compute Tray上类似一个抽屉可以通过导轨插拔维护。这36个计算托盘分布在机柜中搭配若干NVSwitch交换托盘把72个GPU连成一张完整的NVLink fabric。这里有个很多人容易忽略的点NVL72内部的GPU互联是NVLink域内的全互联而不是传统的网卡加交换机的模式。每个GPU都有多个NVLink端口直连到NVSwitch形成一个无阻塞或接近无阻塞的高带宽交换网络。这也是为什么它能在单个机柜内支撑万亿参数级别的模型训练。1.3 算力做大了散热就成了“第一工程问题”如果我们把NVL72看作一个超级计算节点那么它的功耗密度和热密度是传统服务器完全无法比拟的。传统8卡GPU服务器整机功耗大约3kW到10kW靠暴力风扇还能勉强压住。NVL72这种级别的机柜如果还用风冷那已经不是风扇噪音的问题了而是风道根本吹不透、热量根本带不出去的问题。我经常跟团队里的年轻人打比方你用电风扇吹一块刚烧红的铁风吹够了表面温度能降一点但如果铁块已经烧到内部通红单纯吹表面是没用的。芯片发热的物理过程也是如此。当单位面积的发热量达到一定程度空气这种“传热介质”的对流换热能力就到天花板了。这时候必须换一种更高效率的介质来搬运热量那就是液体。散热不再是一个“选配功能”而是决定整个系统能否稳定运行的“第一工程问题”。这也是为什么NVL72的设计理念里液冷从一开始就是顶层设计的一部分而不是后期加装的补救措施。2. 风冷为什么扛不住先算清楚功率账2.1 一台NVL72的整机功耗大概在什么量级要讨论散热我们先用数学把账算清楚。根据公开资料单个GB200超级芯片1个Grace CPU加2个B200 GPU的TDP大致在2700瓦左右。这个数值是什么概念呢一台普通家用电脑整机功耗也就两三百瓦一个GB200等于十几台家用电脑同时满载的发热量。NVL72机柜里装了36个GB200超级芯片单算这部分就是36×2700瓦约等于97.2千瓦。再加上机柜内的NVSwitch交换芯片、管理模块、电源转换损耗、网络模块等等整柜功耗做到120千瓦左右是一个很合理的估算。一些资料里甚至提到如果配置拉满功耗还可以更高。120千瓦放在数据中心是什么水平普通风冷机柜的散热能力大约是10到20千瓦即便做得很激进的风冷方案单柜也很难稳定超过30千瓦。NVL72一柜120千瓦等于说用传统风冷的思路得用6到8个标准机柜的风量才能把这一个柜子的热量带走。这在机房物理空间、风道设计、噪音控制上都是不可接受的。2.2 风冷的散热天花板在哪里我们再用传热学的基本公式来量化一下风冷的能力。一台标准42U机柜假设能保证2到3立方米每秒的风量实际上这是非常大的风量噪音会非常吓人进风温度和出风温度的差假设能拉到15℃空气比热容约为1005焦每千克开尔文密度约为1.2千克每立方米。把数值带进去算一下散热功率质量流量×比热容×温升也就是2.5×1.2×1005×15大约等于45千瓦。而且这是在风量拉到极限、温差拉到15℃的理想情况下。实际机房环境里为了控制服务器进风温度能允许的温升远没有15℃这么大而且过高的出风温度会让相邻机柜设备全部“中暑”。现实中的风冷机柜能稳定做到的散热能力往往就在10到20千瓦之间。更麻烦的是风冷散热能力还与空气的换热系数有关。就算风量再大空气在芯片表面的对流换热系数也很有限尤其是当芯片的热流密度单位面积发热量很高的时候风冷很难把芯片内核的温度压在安全范围内。Blackwell这颗B200的面积虽然不小但整个模块的热流密度已经达到了风冷几乎无法处理的程度。这就像消防员用高压水枪能扑灭大火但让你用一台家用电风扇去吹一个1000度的电炉效果可想而知。2.3 和液冷做一个量化对照我们拿水和空气做一个直观对比。同样是流过单位体积水的热容量是空气的几千倍。空气的密度约为1.2千克每立方米水的密度约为1000千克每立方米空气的比热容约为1005焦每千克开尔文水的比热容约为4186焦每千克开尔文。这样算下来同样体积的水流经一个散热通道能带走的热量大约是空气的1000/1.2×4186/1005倍差不多3400倍。这意味着液冷系统可以用非常小的管路截面积和流量搬运走风冷需要极其庞大的风道才能带走的热量。这也是为什么NVL72内部走液冷管路而不是在机柜后面装一排工业风扇的原因。风冷和液冷的对比回头我们可以用一个表格来整理这样项目讨论时给别人讲也更直观。项目风冷方案液冷方案典型单机柜散热能力10-30千瓦100千瓦以上冷却介质空气水/乙二醇混合液相同体积下的热搬运能力基准约为空气的3000倍以上芯片表面换热系数低受边界层限制高可有效带走热流密度占用空间风道、风扇占大量机柜空间管路占用小冷板贴片式噪音满载时噪音极高几乎无风扇噪音3. 液冷为什么“管用”传热物理学里的几个关键常数3.1 水的热搬运能力为什么会远超空气前面提到水的热容量是空气的几千倍这只是介质层面的优势。液冷系统真正“管用”还有另一个关键因素——对流换热系数。传热学里有个概念叫“强制对流换热”流体流过一个固体表面时流体和固体之间的热量交换强度用换热系数来衡量。水的强制对流换热系数通常可以达到几百到上万瓦每平方米开尔文而空气的自然或强制对流换热系数通常只有几十瓦每平方米开尔文两者差了差不多一到两个数量级。打个比方你用手摸一块60℃的金属板会觉得烫因为空气在皮肤表面的换热能力差热量传递不畅但如果把这块金属板伸进60℃的热水里你的手会更快地感觉到“烫”因为水把热量传给皮肤的效率高得多。液体和固体之间的这种高效换热正是芯片冷板散热能有效工作的重要原因。另外液体的导热系数也比空气高得多。水的导热系数约为0.6瓦每米开尔文空气只有0.026瓦每米开尔文。简单说热量在液体里传导要比在空气里容易二十多倍这保证了热量从芯片表面进入冷却液后能迅速被液体带走不会在界面附近堆积成“热岛”。3.2 冷板式液冷的核心机制NVL72采用的是目前数据中心大规模部署最成熟的一种液冷形式——冷板式液冷Cold Plate Cooling。很多人对液冷的第一印象可能是把服务器泡在油里或者氟化液里那种叫浸没式液冷确实存在但部署复杂度高。冷板式液冷则完全不同它的原理是在芯片表面贴一块带内部微通道的金属冷板通过导热界面材料TIM把芯片的热量传导到冷板再通过冷板内流动的冷却液带走。整个热量传递路径是这样的GPU/CPU内核产生热量先通过芯片封装导热到外壳再通过导热硅脂或相变材料传到冷板底面冷板内部的冷却液快速流过微通道带走热量。这个过程中液体并不直接接触电子元件所以IT设备不需要做绝缘处理维护方式也跟普通服务器差不太多。冷板式液冷最大的优势是“局部精准冷却”。风冷需要吹整个服务器很多热量会散到机柜环境里造成机房热点液冷则直接锁定发热源把90%以上的热量通过循环液带走。NVL72的机柜设计里GPU和CPU都贴装了定制冷板冷板形状与芯片封装精确匹配就是为了最大化换热面积和换热效率。3.3 液冷不只是“降温”还能降功耗很多人忽略了一个点液冷系统不仅仅是在“散热”它还在帮整个机柜省电。风冷要靠高转速工业风扇一个风扇满载可能就要几百瓦一个机柜几十个风扇就是好几千瓦的耗电。这些风扇还只是把热量吹到机房里机房还要靠空调系统CRAC/CRAH把热量排到室外去空调压缩机的功耗往往比IT设备风扇还要高。液冷系统里小泵循环的功率远低于工业风扇阵列的功率而且热量通过一次侧冷却水直接被带到室外冷却塔或干冷器不需要经过机房空调的二次压缩制冷。从PUE的角度来看液冷可以让数据中心的PUE从常规风冷的1.3到1.5降低到1.1甚至更低。也就是说同样的IT负载液冷机柜的电费账单会显著低于风冷机柜。这一块节省下来的运行成本往往是客户决定上液冷的重要驱动因素。所以NVL72选择液冷不单纯是“风冷压不住”更是站在整机效率、运营成本、机房PUE这几个维度通盘考虑后的结果。4. NVL72机柜里的液冷回路到底怎么走4.1 从芯片到冷板热量第一次转移看懂NVL72的液冷方案可以先从单个计算托盘开始。每个计算托盘上有一颗GB200超级芯片也就是1个Grace CPU加2个B200 GPU。这三个高功耗芯片表面都安装了定制的金属冷板。设计上的要点是冷板的接触面弧度、尺寸和CPU/GPU芯片的金属顶盖精确配合中间填充高性能导热材料保证接触热阻尽量小。安装冷板时有一个细节很关键紧固压力要均匀。如果冷板四角的螺丝拧紧力矩不一致会导致芯片表面受力不均导热界面材料厚度不一致局部热阻变大芯片温度就会不均匀。我自己在实验室安装冷板时都用扭矩螺丝刀按固定的顺序和力矩逐个拧紧这一步看着不起眼却直接影响散热效果。冷板内部的结构通常是密密麻麻的微通道有些甚至做成微翅片阵列目的就是大幅增加液体和金属的接触面积。冷却液从冷板一端的入口流入在微通道里高速流动然后从另一端流出这样就把芯片表面的热量源源不断地带走了。4.2 从冷板到CDU一二次侧是怎么分工的NVL72这么大的热负载需要把每一个计算托盘的冷却液汇总起来统一管理。这里就轮到CDUCoolant Distribution Unit冷却液分配单元出场。CDU相当于整个机柜液冷系统的“中枢”它内部有循环泵、板式换热器、过滤器和各种传感器。在液冷系统里我们通常把回路分成一次侧和二次侧。一次侧接的是数据中心的外部冷源比如冷水机组或者冷却塔提供的冷冻水二次侧接的是机柜内部的冷却液循环。二次侧的冷却液经过板式换热器把热量交给一次侧的水然后继续回到机柜里循环。为什么非要这样隔离因为数据中心外部的水质未必干净可能有杂质、微生物、甚至腐蚀性离子直接进入冷板的微通道会造成堵塞和腐蚀。二次侧用高品质冷却液则能保证冷板管路长期稳定运行。CDU还负责温度控制。比如二次侧进水温度需要维持在一定范围不能太低否则冷板表面温度低于空气露点就会结露水滴落到电路板上可能造成短路也不能太高否则无法有效带走芯片热量。CDU通过调节一次侧水流量或者二次侧循环泵转速来精确控制这个温度。4.3 冷却液选型和水质管控说到冷却液我多聊几句。很多人觉得液冷里走的就是“水”其实没那么简单。NVL72这类高功率密度设备二次侧冷却液通常是去离子水加上一定比例的乙二醇或丙二醇再加缓蚀剂。乙二醇用来防冻和防腐缓蚀剂用来保护管路里的铜、铝、不锈钢等金属材料。水质管理是液冷运维里最容易被忽视又最要命的一环。我见过一个项目因为图省事直接用了自来水运行了几个月后冷板微通道里长满了水垢和微生物流量骤降GPU温度直接飙红。所以CDU里通常都配了去离子罐和过滤器运维人员要定期检测冷却液的电导率、pH值和颗粒度。电导率最好控制在1微西门子每厘米以下pH值维持在弱碱性到中性范围大概在6.5到8之间。这些参数看起来枯燥但都是液冷长期稳定运行的关键指标。5. 部署液冷机柜的实操经验与避坑清单5.1 机房承重、管路与空间规划先说一个很多人容易忽视的点NVL72整机柜加上液冷系统之后会非常重。单看72个GPU加36个CPU的硬件密度就知道这个机柜的重量是普通机柜的好几倍再加上冷却液重量、CDU重量折算下来对楼板的承重提出了明确要求。部署之前一定要做结构评估和载荷计算特别是高层机房看看楼板能不能扛得住。然后是管路规划。液冷系统需要从CDU到机柜之间走管如果是多台机柜部署还要考虑主干管道的管径、流量分配和冗余路径。我个人的经验是管路设计要预留检修阀门和旁路这样某一段管路出了问题可以孤立出来检修不必把整个集群停下来。还有一个细节是管路要做好保温防止在温差大的环境出现冷凝水。部署时还有一点容易被忽略就是空间布局。液冷机柜不需要像风冷机柜那样留大量的冷热通道和送风距离但CDU和外部一次侧管道还是要占一定的空间。设计初期最好把CDU的位置、管路走向、维护通道都画清楚别等设备到了现场再临时找地方放CDU那样很容易造成管路过度弯曲增加泵的阻力影响流量。5.2 漏液防护与接头管理液冷系统最怕的是漏液。电子设备一旦碰到水或冷却液轻则单板损坏重则整个机柜断电。所以现阶段的液冷系统在接口和密封上做了很多设计比如无滴漏快速接头拔开的时候两端会自动封闭不会喷液。但即使这样也不能对漏液风险完全掉以轻心。部署时我建议在冷板接头、软管接口、CDU进出液口这些关键位置都布置漏液检测线缆。漏液检测线缆一接触到液体就会报警配合机柜底部的接液盘能第一时间发现问题。管路接头尽量选用带锁止功能的快接头避免振动或误触导致接头松脱。这里还要提一个容易出错的地方不要在设备运行期间随意去旋转或拧紧快接头尤其是有些质量不好的接头在带压状态下操作反而容易破坏密封。维护时如果要拔接头先确保该路循环泵已停机管路泄压再操作不然高温高压的冷却液喷出来既不安全又会造成损失。5.3 日常巡检和长期维护液冷机柜的日常巡检和普通服务器不一样要看的点更多。先看视觉部分管路有无明显的渗漏痕迹接头处有没有水珠冷却液颜色是否正常。再看数据部分CDU控制面板上的一次侧流量、二次侧流量、压力、温度这些参数有没有偏离正常范围。长期维护的节奏也很有讲究。冷却液最好每半年到一年进行一次取样检测检查电导率、pH值和缓蚀剂浓度。即便系统一切正常也不能跳过这个步骤因为冷却液中的添加剂会慢慢消耗水质也会因为微量杂质累积而逐渐变化。冷板这个部件虽然不常坏但过了几年有必要检查一下冷板与芯片之间的接触是否仍然紧密必要时更换导热界面材料。这一块成本不高但能避免后续不必要的性能衰减。6. 常见问题与排查技巧实录6.1 温度突高的排查顺序NVL72这类液冷系统如果某个GPU温度突然飙高第一件事是不要慌也别急着拆服务器。按顺序排查先看CDU的二次侧流量是否降低流量下降往往意味着某个支路出了问题。再看CDU二次侧进水温度是不是升高了如果一次侧冷源温度上升整体散热效率就会下降。如果流量和进水温度都正常那就需要把范围缩小到单条支路检查该GPU对应的冷板管路有没有堵塞、快接头有没有异常。实际排查中还见过一种情况就是冷却液漏得比较多CDU液位下降到一定程度系统会自动补液但如果补液不及时管路里就会混入空气形成气阻导致局部没有液体流过。这种时候温度报警往往是随机偶发的排查起来比较费劲。日常巡检时注意到CDU的补水频率增加就说明系统可能存在缓慢漏液要及早处理。6.2 流量不均与气泡问题流量不均是一个很典型的液冷问题。多个冷板支路是并联关系如果各支路的流阻不一致或者接头接口不匹配冷却液就喜欢走阻力小的路径而阻力大的支路流量就会变小对应的节点温度自然就偏高。解决方法是安装手动平衡阀通过温度监测数据反复调节各支路的流量分配。气泡问题则是另一种隐蔽故障源。冷却液在循环过程中如果系统密封不严或者液位不足会混入微小气泡。气泡进入冷板微通道后会显著降低换热效率因为空气是很好的“热绝缘体”。管路里如果有大团气泡甚至会造成气堵使液体完全无法流通。处理办法是系统初次注入冷却液后要“排气”运行几天后再检查一次CDU的液位把混进去的空气排掉。6.3 冷却液损耗如何定位冷却液损耗分两种明显漏液和慢渗漏。明显漏液比较容易发现机柜底部或者CDU周围会有积液甚至可以直接看到液滴。慢渗漏就比较难处理了通常看不到积水但在快接头密封处、软管弯曲处、焊点处冷却液会以极慢的速度渗出来挥发掉表面看起来像没漏一样。定位慢渗漏除了用漏液检测线缆还可以用干净的白纸巾在各个接头处擦拭观察纸巾上有没有液渍。更专业的做法是用压力保压测试把二次侧管路加压到工作压力的一个较高值静置一段时间看压力有没有下降。如果压力缓慢往下掉基本可以确定系统存在微小漏点再分段隔离排查是哪一段管路的问题。另外要留意那些长时间高温运行后材质老化的软管橡胶密封圈使用年限到了就要成批更换别等出问题再处理。最后分享一点个人体会NVL72这类设备大规模落地最有挑战的不是硬件本身而是整个数据中心基础设施从“风冷时代”向“液冷时代”切换的观念转变。很多时候大家觉得液冷很神秘、很难维护其实它只是把“散热”这件事换了一种更高效的方式来做。真正做过液冷项目的人都清楚前期规划设计比后期运行维护重要得多管路怎么走、CDU放哪里、水质怎么管这些问题想的越细后面吃得亏就越少。我自己的经验是上手液冷之前先把传热的账算明白再把运维的流程定好设备进场之后反而比一堆风扇的老机柜安静省心得多。后面我还会继续聊聊冷板液冷的精细调节和多机柜集群的液冷系统设计有兴趣的朋友可以先按这篇文章里的思路把自己的机柜散热需求盘一盘。
阅读完成 · 觉得有帮助?