首页 / 资讯中心 / 文章详情

中国数据中心90%用博通交换机?拆解AI集群背后的芯片真相

中国数据中心90%用博通交换机?拆解AI集群背后的芯片真相 ★ FEATURED ARTICLE
1. 这个说法到底从哪来的“中国数据中心90%用博通交换机”这句话我第一次听到是在一次饭局上一个做IDC运维的老哥半开玩笑地说的。当时桌上还有个人接了句“那华为星脉算什么”场面一度有点尴尬。后来这句话越传越广版本也越来越多有说90%的有说80%的还有说“高端交换机全是博通芯片”的。作为一个在数据中心网络这块摸爬滚打十来年的人我觉得有必要把这件事掰开揉碎讲清楚。先说结论这个“90%”不是一个严谨的统计数据它更像是一个行业内的粗略体感。但这个体感之所以能流传开背后确实有它的道理。要理解这件事得从三个层面拆交换机芯片的市场格局、数据中心网络的分层结构、以及AI训练集群对网络提出的新要求。这三件事串起来才能看清“博通”这两个字在数据中心里到底意味着什么。这篇文章适合谁看如果你是刚入行的网络工程师想搞清楚数据中心里那些“黑盒子”里面装的是什么如果你是做AI基础设施的想弄明白为什么GPU集群的网络方案总是绕不开那几家芯片厂商或者你只是个对技术八卦感兴趣的爱好者想知道这句流传甚广的话有几分真几分假——那这篇内容应该能给你一个比较完整的图景。我会从芯片和整机的关系讲起把“博通交换机”这个说法拆解清楚然后聊数据中心网络的分层再深入到AI集群为什么把博通推到了聚光灯下最后给一些实际选型和排查的经验。全程尽量说人话该上表格上表格该讲原理讲原理。1.1 先搞清楚一个基本概念交换机不等于交换机芯片很多人说“博通交换机”的时候其实混淆了两个东西交换机整机和交换机芯片。这两者的关系有点像“手机”和“手机SoC”的关系。你买一台小米手机里面装的是高通骁龙的芯片但你不会说“我买了一台高通手机”。同样的道理一台数据中心交换机里面可能用的是博通的Tomahawk或Trident系列芯片但整机品牌可能是锐捷、新华三、星网锐捷甚至是白牌厂商。那为什么大家会把“博通”和“交换机”直接画等号呢因为在数据中心这个场景里芯片的权重实在太高了。一台交换机好不好用端口密度、转发时延、缓冲深度、功耗这些核心指标几乎全由芯片决定。整机厂商做的事情更多是围绕芯片做板卡设计、散热、电源、软件系统比如SONiC或厂商自研NOS。所以当大家讨论“数据中心用什么交换机”的时候本质上讨论的是“用什么芯片方案”。博通在这个领域的地位用一个不太精确但很直观的比喻它在数据中心交换芯片市场的位置有点像几年前高通在安卓旗舰手机SoC市场的位置。不是没有对手但对手能拿出的对位产品确实不多。根据行业里公开的拆解报告和券商研报在25.6Tbps及以上的数据中心交换芯片市场博通的Tomahawk系列占据了绝对主导地位。这个“绝对主导”具体是多少不同口径有差异但说它在高端市场占七八成以上行业内基本没有太大争议。1.2 “90%”这个数字是怎么被感知到的那“90%”是怎么来的呢我个人的观察是这个数字来自几个不同维度的叠加感知。第一个维度是新建大型数据中心。如果你去看这两年国内新建的、面向AI训练的大规模集群尤其是那些采购了英伟达GPU的智算中心网络方案里博通芯片的出现频率确实非常高。原因后面会详细讲简单说就是AI训练对网络的要求和传统云计算不一样而博通在这个新需求上卡位很早。第二个维度是白牌交换机市场。白牌交换机也叫开放网络交换机这几年在互联网大厂里渗透率很高而白牌交换机的主流芯片方案基本就是博通。互联网公司的采购量又大一出手就是几千台这种量级带来的“存在感”是很强的。第三个维度是高端口速率市场。如果你把范围缩小到100G、200G、400G、800G这些高速端口博通的份额比它在整体交换机市场里的份额还要高。而数据中心恰恰是高速端口最集中的地方。所以在一个“高端口密度”的场景里讨论问题博通的出镜率自然就被放大了。但这三个维度叠加起来也不等于“90%的数据中心都用博通交换机”。因为中国有大量中小型数据中心、企业自建机房、边缘节点这些地方用的交换机很多是千兆、万兆的芯片方案五花八门国产芯片、美满电子、瑞昱都有。所以准确的说法应该是在中国大型数据中心的高速交换领域博通芯片方案占据了非常高的份额尤其在AI相关的新建集群中这个比例可能更高。2. 数据中心网络的分层与芯片分布要理解博通为什么这么强势得先知道数据中心网络是怎么分层的。不是所有交换机都用同一类芯片不同层级对芯片的要求完全不同。2.1 三层网络架构下的芯片分工传统数据中心网络通常分为三层接入层、汇聚层、核心层。后来随着叶脊架构Spine-Leaf的普及分层变得更扁平但逻辑上还是可以分成两类叶交换机和脊交换机。叶交换机负责连接服务器端口速率通常和服务器网卡匹配比如25G、100G。脊交换机负责叶交换机之间的互联端口速率更高比如100G、400G。这两类交换机对芯片的要求不一样叶交换机更看重端口密度和成本脊交换机更看重交换容量和低时延。博通的产品线恰好覆盖了这两个场景。Trident系列主要面向叶交换机和园区网强调功能丰富和灵活性Tomahawk系列面向脊交换机和AI集群强调高带宽和低时延。这种“双线布局”让博通在数据中心的不同位置都能插上旗。芯片系列典型定位端口速率典型应用场景Tomahawk脊交换机/AI集群400G/800G大型数据中心核心、GPU互联Trident叶交换机/园区25G/100G服务器接入、企业网Jericho广域/路由100G/400G数据中心互联、运营商这张表是简化版但能看出博通的产品覆盖了从接入到核心、从数据中心内部到互联的几乎所有场景。这种全覆盖能力是它能形成“默认选项”效应的关键。2.2 为什么叶脊架构放大了博通的存在感叶脊架构的普及对博通来说是一个巨大的利好。传统三层架构里汇聚层和核心层的交换机数量相对少接入层数量多但速率低。叶脊架构把网络拍扁之后脊交换机的数量大幅增加而且每一台都是高速交换机。举个例子一个中等规模的叶脊架构数据中心可能有几百台叶交换机和几十台脊交换机。脊交换机虽然数量少但单价高、芯片高端是“秀肌肉”的地方。而叶交换机数量多如果都用博通Trident方案那博通的总出货量就非常可观了。更重要的是叶脊架构让网络变成了“等价多路径”转发对芯片的ECMP等价多路径能力和缓冲调度能力要求更高。博通在这块积累很深这也是它被广泛采用的技术原因之一。2.3 国产芯片和美满电子的位置说到这儿必须提一下其他玩家不然容易造成“博通垄断一切”的误解。实际上在数据中心交换芯片领域美满电子Marvell的Teralynx系列是有竞争力的尤其在特定速率段和特定客户群里。国产芯片方面盛科通信、云合智网等厂商也在推进在一些政企和运营商场景里已经有落地。但客观讲在最高速的那一档比如51.2Tbps交换容量、800G端口这个级别目前能大规模量产出货的主要还是博通。美满电子有产品但市场份额和生态成熟度还有差距。国产芯片在快速追赶但在AI训练集群这种对时延和稳定性要求极高的场景里客户切换的动力还不是很足。这就引出了下一个问题AI到底改变了什么3. AI训练集群为什么把博通推到了C位如果说传统云计算是博通的基本盘那AI训练集群就是它的增量引擎。而且这个引擎的马力比很多人想象的要大。3.1 AI训练的网络需求和传统云计算有什么不同传统云计算的数据中心网络流量模式是“南北向为主东西向为辅”。也就是说大量流量是从服务器到外部用户服务器之间的横向流量相对可控。网络设计追求的是收敛比允许一定程度的超售。AI训练完全不是这个逻辑。以大规模GPU集群为例一次训练任务可能涉及几千张GPU这些GPU之间需要频繁同步梯度、交换参数。这个通信过程是“东西向为主”而且是全互联式的突发流量。如果网络跟不上GPU就会空转等数据昂贵的算力就被浪费了。这就对网络提出了几个硬要求超低时延、零丢包、高带宽、可预测的转发行为。传统数据中心网络那套“超售缓冲”的思路在AI场景里直接失效。3.2 博通在AI网络里的两张牌博通在AI网络里主要打两张牌Tomahawk系列的高带宽能力和拥塞控制相关的技术积累。Tomahawk 4做到25.6TbpsTomahawk 5做到51.2Tbps这个交换容量意味着单芯片可以支持64个800G端口或者128个400G端口。对于GPU集群来说这意味着可以用更少的交换机搭建更大的无阻塞网络。交换机数量少跳数就少时延就低故障点也少。另一张牌是拥塞控制。AI训练流量是典型的“incast”模式多个发送方同时向一个接收方发数据容易造成网络拥塞。博通芯片里集成了一些硬件级的拥塞管理功能配合RDMA over Converged EthernetRoCE使用可以在一定程度上缓解这个问题。当然拥塞控制是一个系统工程芯片只是其中一环但芯片原生支持这些功能确实降低了方案落地的门槛。3.3 一个具体的场景GPU集群的组网选择假设你要建一个128张GPU的训练集群每张GPU配一个400G网卡。你怎么组网一种方案是用一台大交换机128个400G端口单跳互联。这需要交换芯片支持51.2Tbps的容量目前能选的方案不多博通Tomahawk 5是其中之一。另一种方案是两层叶脊叶交换机用400G下行连GPU脊交换机用400G上行互联。这个方案里叶交换机和脊交换机都可以用博通的芯片方案形成一个端到端的博通生态。无论哪种方案博通都是绕不开的选项。这不是因为别的芯片不能用而是因为在“大规模、高带宽、低时延”这个三角约束下能同时满足条件的芯片方案确实有限。AI把这三个约束推到了极致也就把博通推到了C位。4. 实际选型和运维中的经验聊完宏观格局说点实在的。如果你真的要在项目里做交换机选型或者手里已经有一堆博通芯片的交换机要运维下面这些经验可能对你有用。4.1 选型时不要只看芯片型号我见过不少项目选型的时候只盯着“是不是Tomahawk 5”觉得芯片对了就万事大吉。实际用起来才发现整机厂商的板卡设计、散热方案、软件成熟度这些都会直接影响使用体验。同样一颗Tomahawk 5芯片不同厂商做出来的交换机功耗可能差好几十瓦转发时延可能差几百纳秒软件功能的完备程度更是千差万别。所以选型的时候芯片型号是入场券不是终点。要重点看几个东西时延实测数据、缓冲区的实际可用大小、软件对RoCEv2和ECN的支持程度、厂商的售后响应能力。提示时延数据一定要看“加载时延”不要只看“空载时延”。空载时延大家都好看加载之后才能看出芯片和整机设计的真实水平。4.2 运维排查的一个实用思路博通芯片的交换机在运维上和普通交换机没有本质区别但有几个地方容易踩坑。一个是缓冲区的监控。AI场景下缓冲区被打满是很常见的事但很多监控工具默认不显示缓冲区的实时占用。你需要手动配置一些计数器或者用厂商提供的专用命令来查看。缓冲区一旦持续打满丢包就不可避免训练任务就会变慢。另一个是ECN和PFC的配置。这两个东西是RoCE网络里做拥塞控制的关键但配置起来比较微妙。ECN的阈值设高了起不到拥塞通知的作用设低了又会过度标记导致发送方降速太频繁。PFC更危险配置不当可能引发死锁。我的经验是ECN阈值从低往高调边调边观察训练任务的吞吐变化PFC能不用就不用优先靠ECN和端侧拥塞控制来解决问题。排查项常见现象排查思路缓冲区打满训练任务周期性变慢查看缓冲区水位计数器调整ECN阈值PFC风暴网络大面积卡顿检查PFC配置确认是否有死锁风险链路误码偶发丢包、重传查光模块光衰、更换光纤或模块转发表溢出部分路由丢失检查ARP/ND表项数量调整老化时间4.3 关于“国产替代”的一点观察这两年国产交换芯片的进步是实实在在的。在一些中低速场景国产芯片已经可以满足需求而且性价比有优势。但在AI训练集群这种高端场景国产芯片的生态成熟度还需要时间。我个人的判断是国产芯片会从边缘向核心逐步渗透先从管理网、存储网这些对时延不那么敏感的场景切入再慢慢往计算网走。这个过程不会一蹴而就但方向是明确的。对于做基础设施的人来说保持对国产方案的关注和测试是有必要的。5. 回到那个问题90%到底怎么回事现在可以回答开头那个问题了。“中国数据中心90%用博通交换机”这个说法如果限定在“大型数据中心的高速交换场景”尤其是“AI训练集群”那它反映的是一种真实的行业体感。博通在这个细分市场的份额确实非常高高到很多人觉得“除了它没别的选”。但如果把这个说法扩大到“所有数据中心”那就不准确了。中国有大量中小型数据中心、企业机房、边缘节点这些地方的交换机芯片方案非常多样。国产芯片、美满电子、瑞昱等厂商在这些场景里都有不小的出货量。所以更准确的理解是博通在中国数据中心的高端交换领域占据主导地位AI的爆发进一步强化了这种主导地位但“90%”是一个被特定场景放大的感知数字不是全局统计。至于AI和这件事的关系简单说就是AI训练对网络提出了传统数据中心从未有过的要求而博通恰好在这个要求上卡住了位置。这不是偶然是博通在高速交换芯片上持续投入的结果。但技术格局从来不是一成不变的国产芯片在追美满电子在追未来的事情谁也说不准。我个人的经验是做技术选型的时候不要被“某某品牌占90%”这种说法带着走。要回到自己的实际需求你的端口速率是多少时延要求是多少预算有多少运维能力怎么样。把这些想清楚再去匹配芯片和整机方案比盲目跟风靠谱得多。
阅读完成 · 觉得有帮助?
咨询建站