简介《CPO热潮下的技术思考》是腾讯胡胜磊撰写的PDF聚焦数据中心与高性能计算场景的光互连技术适合光通信、网络架构及数据中心运维人员阅读。资源仅含1个PDF大小1.49MB内容紧凑。目前已有164人学习适合正在关注CPO产业化路径或需要做技术选型评估的读者。文档以“追光者众”梳理CPO从交换设备间连接到芯片封装的演进路径分析“曲径通幽”的光引擎尺寸、局部大芯片封装、热管理、光纤管理与可靠性挑战。“另辟蹊径”对比VCSEL直驱、LPO线性模块与“one half”架构给出功耗、成本、复杂度与互通性的量化对比如功耗从8W到4.5W、BER和延迟变化。还延伸至双碳绿色数据中心指标、200G/λ测试趋势、全光交换缓解Spine瓶颈以及机器学习预测光模块激光器故障。整体上这份资料能帮助读者快速建立从系统级需求到器件级方案的完整认知。1. CPO为什么突然成为数据中心互连的焦点从交换设备到封装内芯片CPOCo-Packaged Optics共封装光学在今年被反复提及热度甚至盖过了可插拔光模块的常规迭代节奏。核心逻辑并不复杂当交换芯片容量走到 51.2T、102.4T 的量级面板空间和功耗预算已经很难让可插拔光模块继续“体面”地活下去于是把光引擎搬到交换芯片封装内缩短 SerDes 走线距离成了业界普遍认可的下一步。这份来自腾讯专家的分享脉络很清晰CPO 从交换设备之间互联起步逐渐延伸到封装内的芯片到芯片互联但产品级批量应用还面临热管理、端面耦合、可制造性和可维护性等一堆工程问题。与此同时VCSEL 直驱方案和 LPO线性可插拔光学也在“另辟蹊径”——它们不换封装只改电芯片的架构就拿到了接近 CPO 的功耗收益。这篇文章不是讲 PPT 里的概念图而是把这几种路线放到同一张比较表上讲清楚为什么说“one half”折中方案以及你在选型时真正要卡的参数和会踩的坑。2. 追光者众CPO 的两种应用场景与产品化瓶颈2.1 设备间光互联与芯片间互联两条路径的演进逻辑CPO 的第一类场景是设备到设备的互联。交换机的面板光口被取消或大幅缩减光引擎直接贴在交换芯片封装基板substrate边缘SERDES 走线从“芯片出封装 → PCB 走线 → 连接器 → 光模块 PCB → 光引擎”这条长链路缩短为“交换芯片 → 封装内走线 → 光引擎”链路损耗和功耗明显下降。第二类场景更激进芯片与芯片之间的光互联也就是把光 I/O 做进封装内连接 ASIC、HBM、GPU、FPGA 等不同 die。这本质上是把传统电互连的瓶颈用光来打破硬件资源池化的前提也在这里——如果 GPU 和 HBM 之间的带宽墙能被光打穿算力资源就能跨机柜调度。不过这个场景的问题也很明显封装内光引擎意味着重做整个封装流程涉及 Interposer、EIC电 IC、PIC光子 IC、PCB 的联合设计介入门槛非常高目前只有少数头部玩家在推进。工程上要区分这两种场景因为它们的良率目标和测试策略完全不同。设备间互联的光引擎坏了至少还能设计成模块化更换而封装内光互联一旦出问题动的是整块基板维修边界只有一个字拆。所以从产品化难易度看第一条路走得更快第二条路是中长期方向。2.2 光引擎尺寸、封装热设计与端面耦合从 Cisco 数据看制造边界这份资料引用了一张很关键的数据图对比了 4xOSFP 800G 可插拔模块和 3.2T CPO 光引擎的尺寸。结论是从 400G 到 800G 再到 3.2T、6.4T容量在翻倍增长但光引擎局部尺寸增幅远小于容量增幅——这正是“共封装”的意义所在把光引擎塞进封装后容量翻倍不再需要面板面积同步翻倍。但这也带来一个反直觉的问题硅面积没有同步变大功耗密度却上去了。光引擎本身含激光器、调制器驱动、TIA、CDR 等多个发热源全部集中在一个小封装区域里散热路径相比可插拔模块反而更难受。可插拔模块至少有完整的散热器和面板风道而 CPO 光引擎要和交换芯片抢同一块散热空间。端面耦合是另一个隐藏瓶颈。光引擎边缘耦合要保证激光器到波导的对准精度封装后的耦合良率直接决定成本。这个问题在实验室做样品不是问题但在量产线上基板翘曲、热膨胀、贴片偏移都会让耦合效率波动。可靠性的担忧也集中在“耦合点会不会在长期热循环后慢慢偏移”一旦偏移光功率掉下来链路的预 FEC BER 就会恶化。2.3 容量翻倍不等于集成度翻倍PIC 尺寸与工作速率的联动约束资料里有一条明确的曲线PIC 尺寸和容量/DIE 的关系。从 400G 到 800G 再到 3.2T、6.4TPIC 尺寸从 11.8 增长到 22.5再到按线性外推的 3 倍左右。换句话说容量增长 8 倍PIC 尺寸只涨了约 3 倍——好的一面是集成度在提升坏的一面是单位面积功耗密度、良率压力、封装应力都在同步上升。这里有一个设计上的联动约束链条光芯片尺寸决定工作速率的下限工作速率决定 SerDes 接口速率而接口速率又反过来影响电芯片的封装复杂度。当前工艺下光芯片的高速调制器要同时满足带宽、插损和驱动电压尺寸缩不下来速率提不上去那么封装内走线再短也白搭。所以整个 CPO 系统实际上是“光芯片 → 封装 → 电芯片”三者的联合优化任何一环单独激进都会成为木桶短板。这也解释了为什么业界一致认为 CPO 产品级批量应用还早结构创新和封装创新虽然已经跑在前面但可制造性能否在产线上稳定量产、可维护性坏了能不能修、光纤管理光纤怎么在整机柜里走出来不折断这三个问题没解决PPT 上的功耗优势就落不了地。3. 曲径通幽VCSEL 直驱与 LPO 如何绕开 CPO 的落地难题3.1 VCSEL based CPO直驱、Bias-t 与 2~3 pj/bit 的功耗账如果觉得硅光 CPO 的门槛太高VCSEL 路线提供了另一种“便宜”的切入方式。VCSEL 的优势是天然支持垂直方向出光可以做并行光学耦合不需要端面耦合那种精密对准。最关键的是VCSEL 可以直接用 SerDes 信号驱动不需要额外加昂贵的调制器驱动芯片。资料中提到 IBM 和 HPE 都在推这个方向。具体说VCSEL based CPO 适合对功耗和成本要求苛刻、连接距离比较短的场景比如机柜内交换机和服务器之间的互联。它可以用直驱方案SerDes 出来的信号经过简单的 Bias-t 电路直接给到 VCSEL 激光器省掉一级驱动芯片。功耗效率大约在 2~3 pj/bit相比传统可插拔方案优势明显。VCSEL 激光器的等效阻抗 Rs 约 80 欧姆和传输线阻抗匹配相对容易配合 DC-DC 多通道串联 Bias 供电可以进一步降低电源转换损耗。直驱结构里DSP 和 DAC 负责信号整形200G/400G 速率下用 SR4 并行方式每个通道承担 50G 或 100G 速率。但 VCSEL 路线的物理边界也很明显多模光纤的传输距离天花板就在几十米内出了机柜就玩不转。也就是说VCSEL CPO 适合“最后一跳”替代不了硅光方案在长距离互联中的地位。3.2 LPO 可插拔去掉 oDSP 后链路余量怎么补LPO 的思路更“取巧”不换封装把光模块里的 oDSP 拿掉用线性驱动器和线性 TIA 直接把信号从主机 SerDes 传给光芯片。这样做的好处是功耗和成本直接被打下来——DSP 是模块里最耗电最贵的芯片。代价是链路均衡的重担全部压到主机 SerDes 上。现在的 112G SerDes 一般都带 FFE/DFE/CDR配合线性的驱动器和 TIA理论上能在一定链路损耗范围内工作。资料里给的架构是Host SerDes LRLong Reach模式带 FFE/DFE/CDR经过 CTLE 补偿后驱动 EML 或硅光调制器接收端 TIA 后面直接接回主机 SerDes 的均衡器。这里有一个关键认知LPO 不是简单拆掉 DSP而是把 DSP 的均衡能力“搬”到主机 SerDes 里。如果交换芯片的 SerDes 能力不够强LPO 链路就会在长走线、插损大的场景下翻车。所以 LPO 的成功前提是交换机 ASIC 和光模块联合设计这也解释了为什么 Arista 要做 OFC 演示、Nvidia 要公开发布结果——这种深度协同本来就是系统厂商的强项。3.3 Arista 和 Nvidia 公开结果VCSEL LPO 到硅光 LPO 的演进边界资料里引用了 Arista 在 OFC 2023 上的演示结果VCSEL B2B 预 FEC BER 在过扣板时能做到 1E-6MAC 板测试到 1E-7使用硅光 LPO 方案的 112G 光模块也表现出一定的应用前景。从数字看VCSEL LPO 在 112G AOC 上有可行性硅光 LPO 在模块上也具备竞争力。这些结果的另一个价值是告诉大家“模块和交换机参数双向调参能实现较优性能”。也就是说LPO 不是把模块装上就能跑而是要对主机 SerDes 的均衡系数、CTLE 增益、输出摆幅做一轮联合调优。这个过程有点像 RF 链路的调优思路而不是传统数字模块“即插即用”的习惯。Nvidia 公开的结果也印证了一个趋势行业头部厂商在做 LPO 时已经把协同设计做成了一个标准动作。简化调参流程下VCSEL LPO 的可量产性已经比较明确硅光 LPO 则需要更多扩展场景边界去验证。4. 各抒己见One Half 架构如何平衡性能、成本与风险4.1 One half 可插拔方案TX-XSR / RX-MR 接口设计与 Retimer 位置在纯 DSP 和全线性方案之间还有一条中间路线资料里叫 “One half” 架构源自 OIF Co-Packaging 的讨论文档。它的思路是把光引擎的 e-gress出口侧放置一颗 Retimer 芯片光模块内部保留一半的 DSP 功能但不做传统的完整 oDSP。接口设计上是这样定ASIC 侧使用 TX-XSReXtreme Short Reach接口发送信号到模块模块内部通过 Retimer 整形后再驱动光芯片接收端使用 RX-MRMedium Reach接口从光芯片的 TIA 出来经过模块内的 CDR/均衡再回传给 ASIC。这样做的好处是ASIC 的 SerDes 不需要工作在满负荷的 LR 模式。传统上网络设备 ASIC 的 SerDes 能力要设计在 LR 上保证性能裕量这占用了大量芯片面积和功耗。One half 方案下ASIC 发端只需要出 XSR 信号跑很短一段模块内的 Retimer 承担后续的驱动和均衡整个链路的信号完整性压力被分散了。实际的产品形态会分化成几种一种叫“半线性、半 DSP”发送端用线性驱动器接收端用 oDSP 的 RX 数字均衡另一种是发送端用 One half oDSP 带 TX FIR3.3Vpp 驱动接收端用线性 TIA。两端组合起来在链路里就能形成 DSP-DSP、Linear-DSP、DSP-Linear 等多种连接组合不一定要求两端模块同构。4.2 四种模块架构对比功耗、EIC 成本、BER 与延迟的取舍资料里有一个很实用的对比表把四种光模块架构放在一起比。我按参数整理成表架构功耗EIC 成本BER典型延迟通用标准 PAM4 模块5nm oDSP8 W1DSPTIA1E-9100 ns“半线性” “半 DSP”RX 数字均衡5.5 W0.681/2 DSPTIADRV1E-850 ns“半线性” “半 DSP”TX FIR5 W0.561/2 DSPTIA1E-850 ns线性光模块DRVTIA4.5 W0.25DRVTIA1E-7 至 1E-6 或更差10 ns这个表的阅读方法很直接越往右下方走功耗越低、成本越低、延迟越小但 BER 性能越差、成熟度越低。One half 架构恰好站在中间——它比全线性方案多了 DSP 的均衡能力保证 BER 在 1E-8 量级比全 DSP 方案节省约 30% 功耗和约 30%~40% 的 EIC 成本。需要特别注意的是延迟指标。全线性方案能做到 10ns 的极低延迟这对高性能计算和 AI 集群有一定吸引力但 BER 掉到 1E-6 甚至更差对 FEC 的依赖就大大增加。One half 把延迟控制在 50ns 级别BER 却保持在 1E-8是个比较稳的折中档位。还有一个容易被忽略的维度互通性。资料明确说 One half 架构支持与通用标准 PAM4 模块互通。这很重要因为这意味着在 CPO 和 LPO 还没有统一标准之前One half 模块可以插在现网交换机上和传统 PAM4 模块混用不要求整网同步升级。4.3 One half 有源铜缆小裕量低代价与极限性能的博弈One half 架构不仅用在光模块上还延伸到了有源铜缆AEC。资料里展示了两种 AEC 类型和一个关键对比在同样的 112G 铜缆链路上发射端用提升摆幅的方式做预加重接收端用 FFE7 tap / 5 tap和 22 tap FFE 的均衡组合。这里有一个很有意思的设计语言光模块提升电压摆幅可以等效成一种预加重方法而铜缆发射端提升摆幅本质上在做同一件事——用更大的驱动电压来对抗链路损耗。参数上发射端可以提供 0~1.2V 或 0~3V 的不同差分摆幅接收端使用 CTLE 两级每级提供 10~15dB 增益不需要 pre-distortion也不用做 SNR/FEC monitoring。从覆盖距离看One half Retimer 方案在 DAC直连铜缆和 2 米 ACC有源铜缆场景下覆盖大约 3.5m 和 4.5m而 One one LR Retimer 方案可以延伸到 6m接近 IEEE 112G 铜缆方案的极限。但 LR Retimer 的功耗显著更高属于“大裕量、大代价”。One half 的定位很明确小裕量、小代价靠牺牲一点距离换来功耗和成本的平衡给中等长度链路一个不“豪华”但能用的选项。5. CPO 与 LPO 方案选型避坑五个常见翻车点与排查思路5.1 翻车点一光引擎尺寸缩小后局部热密度反而升高现象样品测试时光引擎区域温度超标激光器波长漂移BER 恶化到无法收敛。原因只看光引擎总功耗下降了没算封装内的热密度。CPO 把光引擎塞到交换芯片旁边散热面积被压缩热源集中在一个很小区域。可插拔模块时代散热器和风道是独立设计的共封装后光引擎和交换芯片共享散热路径相互加热。解决选型时不要只对比“模块功耗”这一项。要看封装内热源的分布、光引擎和交换芯片之间的热耦合系数。设计阶段用热仿真跑几种布局优先把激光器放在靠近基板散热通孔的位置。如果空间允许考虑在封装内加微尺度热管或热电制冷器但每加一样都要重新做可靠性评估。5.2 翻车点二端面耦合良率与测试成本的黑匣子现象小批量做出来的光引擎耦合插损飘得厉害同一个批次里有的 -1.5dB、有的 -4dB无法批量发货。原因端面耦合的精度要求极高基板翘曲、贴片应力和温度变化都会造成光斑偏移。实验室里的耦合对准是人工微调的到产线上要靠自动封装设备保证实时对准精度产线设备能力和工艺窗口不匹配就会出现这种波动。解决第一步先建立耦合损耗的统计分布不要只看单颗最佳值。第二步加一道“预筛选测试”在光引擎贴片完成后、封装灌胶前做一次主动对准优化把损耗超标的筛选掉。第三步倒逼封装工艺用翘曲度检测控制基板来料质量这会直接决定耦合一致性。5.3 翻车点三LPO 只是去掉 DSP链路均衡被严重低估现象LPO 模块在实验室 B2B 场景测试通过部署到机柜后发现前 FEC BER 在 1E-5 到 1E-6 之间波动换不同交换机端口表现还不一样。原因LPO 去掉 DSP 后均衡重任全压在主机 SerDes 上。不同交换机 ASIC 的 SerDes 均衡器能力差异很大有的 FFE 只有 5 tap有的带 MLSE性能不在一个水平。实验室的 B2B 测试链路短、插损低掩盖了这个问题。解决LPO 选型之前先拿到交换机 ASIC 的 SerDes 规格书确认支持多少 tap FFE、有没有 DFE 和 CDR、均衡范围是多少。部署前做一轮模块和 ASIC 的双向联调用链路仿真把插损边界跑一遍看到最差端口能跑到什么 BER 再定方案。最忌讳的事就是只凭“LPO 功耗低”就拍板最后发现现有交换芯片的 SerDes 根本带不动。5.4 翻车点四One half 模块与现有 PAM4 模块互通的隐性问题现象One half 模块插入交换机和传统 DSP 模块对传时 BER 正常但和另一品牌 One half 模块对传时出现偶发误码。原因One half 架构的特殊性在于 TX 和 RX 接口能力不对称TX 出 XSR、RX 收 MR。不同厂商对 XSR 配置和 Retimer 均衡参数理解不同导致端到端链路的整体均衡分配出现偏差。资料里明确说了不存在“弱-弱”对传链路——两个低能力端对传必然出问题。解决One half 部署前先做矩阵互通测试至少验证“One half 与 DSP 模块”和“One half 与 One half”两种组合记录每组组合的预 FEC BER。运维上设定一个原则One half 模块尽量和 DSP 模块或同一厂商的 One half 模块配对避免两弱对传。如果必须混插提前跑满 24 小时长期漂移测试别只看瞬时 BER。5.5 翻车点五可维护性被忽略——CPO 坏一个光引擎等于动整板现象CPO 设备在现网运行半年后一个光引擎的激光器衰减链路误码率超限。维护团队发现更换这个光引擎需要把整块主板拆下来返厂停机窗口从预期 2 小时变成 2 天。原因这是 CPO 形态天然带来的代价。光引擎和交换芯片封装在一起光纤管理、基板结构都是整体的不可能做到像可插拔模块那样轻松“拔下来换一个”。选购阶段如果只对标功耗指标忽视可维护性设计到了运维阶段就会体会到“无后悔药”的感觉。解决评估 CPO 产品时把可维护性纳入一票否决项。问供应商三个问题光引擎故障是整板返修还是板上更换返修时间窗是多少是否设计了独立供电和状态监控能在故障早期预警如果你的运维团队不具备返厂维修条件就优先考虑 LPO 或 One half 这类可插拔兼容形态至少还有“拔插换新”的后路。6. 验证方法落在实处从 B2B 预 FEC BER 到系统裕量的三级测试习惯6.1 第一级模块级 B2B 预 FEC BER 基线拿到任何一款 CPO、LPO 或 One half 模块我会先做的第一件事是在实验室跑背靠背Back-to-Back预 FEC BER 基线测试。背靠背链路没有任何连接器和长走线损耗测出来的是模块本身的性能天花板。以 LPO 为例VCSEL 方案的 B2B 预 FEC BER 通常能做到 1E-7 到 1E-8 量级硅光方案略好如果连背靠背都跑不到 1E-7 以上说明这个模块的光电协同设计本身就存在问题后面的系统级测试没有意义。6.2 第二级过扣板过连接器的系统级裕量测试B2B 测完只是第一步紧接着要加插损把模块接到真实交换机端口上让信号经过扣板、背板连接器、MAC 板走线看预 FEC BER 掉到多少。资料里 Arista 那个数据很典型VCSEL LPO 在过扣板场景测到 1E-6MAC 板测到 1E-7。这里要注意BER 从 1E-8 掉到 1E-6说明链路余量已经很紧张——不是不能跑而是你必须在正式部署前知道这个余量还有多少。如果系统级 BER 在 1E-6 附近徘徊建议做一轮“双向调参”调整主机 SerDes 均衡系数、TX 摆幅、CTLE 增益看 BER 能否收敛到 1E-7 以下。6.3 第三级生存性验证与部署计划第三级测试最容易被人跳过但我强烈建议做温度循环下 24 到 48 小时的长期 BER 漂移测试。光模块的 BER 会随温度变化漂移激光器波长跟着温度走模块内部均衡参数的温度补偿系数如果没调好稳态测试通过的产品在温度变化下会翻车。跑完生存性测试之后再把可维护性纳入部署计划——如果链路用的是一体化光引擎至少要在监控系统里加载激光器 Bias 电流和温度遥测提前发现衰减趋势。从那以后我经手每个 CPO/LPO 项目都强制走一遍这三步先 B2B 定基线、再过连接器看裕量、最后做温度生存性全部达标才敢上量。这套流程挡掉过至少三个看着实验室数据很好、实际现网撑不过一个夏天的方案。希望帮到你。本文还有配套的精品资源点击获取
阅读完成 · 觉得有帮助?