AI算力基础设施的热管理正在从机箱级问题,向模块、封装和局部器件级问题下沉。传输速率提高以后,光模块的功耗并不只是电口速率的线性放大;交换芯片、光引擎、激光器、驱动和接收链路被压缩到更近的空间里,热源之间的耦合也随之增强。解决方案因此从金属壳体、散热片和导热界面,逐步扩展到均热板、冷板、液路组件以及能够主动控制局部温度的微型热电制冷器。
这条路径不能只看某一种材料的名义导热率,也不能把单个产品的报价直接外推成行业空间。热设计的实际约束包括热流密度、接触热阻、可用面积、装配压力、平整度、可靠性、液路安全和终端验证周期。下文把这些因素放在同一条技术链上讨论,并将逐字稿中能够确认的数字保留为原口径估计;对于名称、单位或比较基数不清的内容,明确停止外推。
一、800G到1.6T:速率升级先改变热密度

800G向1.6T升级,最直接的变化是单位模块需要处理更多高速电信号和光电转换任务。逐字稿给出的原口径估计是:800G光模块功耗大约为10–25W,1.6T模块可能达到35W,甚至40W以上。这组数字描述的是特定方案下的模块功耗区间,不是所有产品的统一规格,也没有给出温度、散热条件、光电器件配置和测试方法。因此,它适合用来说明热设计压力的方向,不适合当作跨厂商的标准对照表。
从10–25W跨到35–40W以上,问题不只是总热量增加。模块的外形和接口尺寸受到系统规范约束,新增功耗往往集中在有限的器件区域,热流密度上升会让芯片到壳体、壳体到冷板之间的每一段热阻都更重要。原有的风冷方案如果依赖金属外壳、散热片和单一导热界面,可能还能覆盖较低速率阶段;当热点温度、邻近器件温度和环境温度同时抬升时,整个路径的裕量会快速收窄。
热路径可以拆成四层。第一层是芯片与封装内部的热扩散,包括激光器、驱动器、接收器和控制芯片各自的发热位置。第二层是封装表面与模块壳体之间的接触,需要处理界面粗糙度、压力分布和材料厚度。第三层是模块壳体或热扩散结构把热量送到系统冷板,涉及接触面积、弹片或压紧结构以及外部TIM。第四层是冷板、歧管和液路把热量带离机柜。任何一层成为瓶颈,前面更高导热率的材料都不能自动解决最终温度问题。
逐字稿把价值量变化描述为:800G模块散热部分大约10–20元,1.6T可能增加到约60元,具体取决于散热方案与材料。这仍然是原口径估计,既没有明确“散热部分”是否包含壳体、界面层、均热板和装配,也没有给出不同结构的拆分,因此只能作为价值量上移的方向性信号。一个合理的判断是,速率升级先推动热设计复杂度上升,随后才会推动材料、结构件和制造工艺的组合升级。
金属壳体并不会消失。铝合金、不锈钢等材料仍承担机械保护、屏蔽、装配和热扩散职能,但它们的价值不再仅由材料本身决定,而要看是否与均热板、冷板和界面材料共同形成低热阻路径。更高导热的方案也必须同时满足强度、加工、平整度、耐腐蚀和成本要求。对采购方而言,真正可验证的指标应是模块在规定环境和气流、液流条件下的热点温度、壳体温度、光学性能漂移和长期可靠性,而不是单独比较某种金属的导热率。
此外,功耗区间与散热价值量之间不是简单乘法关系。一个功耗不变的模块,如果从自然对流改为冷板接触,接触结构、装配公差和冷板端口都可能增加成本;一个功耗更高的模块,如果采用成熟的均热结构,也可能减少局部温差。因而,判断1.6T带来的增量,应将功耗、热阻网络、结构件用量和客户验证阶段一起看。
热阻网络还要区分稳态和瞬态。模块刚启动时,芯片、盖板和均热结构的热容会延迟壳体升温,短时测试可能看不到最坏热点;持续高负载后,冷板入口温度、机柜回水温度和相邻模块热量又会改变边界条件。工程验证应至少覆盖冷启动、持续满载、负载阶跃、环境温度变化和气流或流量偏差,并同步记录芯片热点、壳体、冷板入口出口与光学指标。只有把时间维度加进来,才能区分材料改善带来的真实热阻下降与热容造成的短暂缓冲。
模块升级也会改变散热器件的机械任务。壳体不只是把热量铺开,还要提供插拔定位、连接器保护、电磁屏蔽和与冷板的重复接触。若冷板侧采用弹片,弹力过小会增加接触热阻,过大则可能造成模块变形或封装受力;若采用外部TIM,厚度公差和压缩回弹会影响每次插入后的热性能。因而,结构件设计、装配工艺和维修方式会共同决定实际热阻,单独采购一块高导热材料无法保证升级成功。
二、NPO与CPO:热源靠近以后,隔离更难

NPO和CPO的共同方向,是让光电转换单元更靠近交换芯片或交换系统的高速通道,以缩短信号路径、降低互连损耗并提高带宽密度。逐字稿给出的结构判断是,后续交换芯片与光引擎的间距可能进入毫米级。间距缩短有利于电气性能和系统集成,却会让交换芯片的热量更容易影响光引擎,光引擎自身的发热也更难通过空间距离自然衰减。
光器件对温度变化的敏感性与普通结构件不同。激光器的波长、输出稳定性和封装应力都可能随温度改变。高功率交换芯片持续工作时,芯片侧的热量会通过基板、封装、连接结构和周围介质向光引擎传播;如果光引擎与激光器之间的热隔离不足,就可能出现局部温度上升、波长漂移、功率控制变差或误码裕量下降。这里的关键不是把整个系统降到越低越好,而是在不同器件之间建立可控、可重复的温度边界。
NPO/CPO的热路径通常包括两条相互影响的支路。一条从交换ASIC向封装载板、冷板或液冷结构传导,另一条从激光器、驱动和接收单元向光引擎的局部结构扩散。两条支路在毫米级间距下会形成热串扰。系统设计需要同时考虑总热量和温度梯度:总热量决定冷却能力,温度梯度决定光学器件、焊点、界面层及封装材料的应力和漂移。
这也是主动控温有潜在价值的原因。被动结构可以把热量导出,却不一定能把一个小型激光器稳定在合适的工作窗口。微型热电制冷器能够在局部提供加热或制冷调节,配合温度传感、控制回路和热扩散层,可把光源的温度波动限制在更窄范围。逐字稿提到毫秒级精确控温,但该说法没有给出测试条件、温度范围、负载变化和控制算法,不能直接理解为所有MicroTEC产品的已验证性能。
热串扰的解决不是在光引擎旁边简单加一块制冷片。制冷片的冷端在吸收热量的同时,会把热量和自身功耗送到热端;如果热端没有足够的导热与散热能力,局部制冷只会把问题转移到另一侧。因而,NPO/CPO热方案必须把主动器件、冷端扩散、热端冷板、供电、传感和控制一起设计。光引擎的封装空间越小,对器件厚度、陶瓷基板平整度、互连可靠性和装配压力的要求越高。
从系统侧看,NPO/CPO的价值并不只来自一块新材料。它来自高速交换芯片、光引擎、界面材料和液冷结构之间的重新分工。能够进入量产的供应商,需要证明在机械约束、光学指标、电气速率、冷热循环和长期运行条件下仍能保持一致性。只展示实验室导热率或短时间降温曲线,无法替代系统级验证。
架构选择还存在电热权衡。光电单元越靠近交换芯片,电连接可能更短,信号损耗和板级布线压力可能下降,但热隔离距离也变小;把光电单元移到更远位置有利于热分区,却可能增加电互连长度、功耗和系统复杂度。NPO/CPO并不是单一的散热升级,而是把高速链路、封装、供电和冷却边界一起重排。评估时需要把每比特传输能耗、光引擎温度窗口、交换芯片降频风险和冷却系统功耗放在同一方案比较中。
热串扰还需要空间测量而不是只看一个平均温度。光引擎中激光器、调制器、驱动和监测器件的热敏感度不同,热点可能出现在平均温度并不高的位置。工程样机应使用多个测点或热成像、光谱和误码测试相互校准,记录交换芯片负载变化时波长、输出功率、误码和局部温度的同步变化。只有建立热源到性能指标的因果链,局部控温才有明确的控制目标。
三、TIM1与TIM2:同属界面层,约束并不相同

热界面材料的任务,是填平两个固体表面的微观空隙,降低接触热阻。光模块、交换芯片、GPU或其他高功率封装中,界面材料并非一层到底,而是随着热路径分成不同位置。常见的区分是TIM1位于芯片或裸片与IHS、盖板之间,TIM2位于盖板或热扩散结构与外部冷板之间。具体封装可能不包含独立的TIM1,也可能采用裸片直接通过界面材料连接到冷板的方案,因此名称不能脱离封装结构使用。
TIM1面对的是芯片侧更高的局部热流密度。它距离发热源近,厚度通常更敏感,材料需要在很小的间隙中铺展并保持稳定接触,同时承受封装翘曲、热循环和机械应力。若TIM1过厚,热阻会增加;若过薄或填充不完整,空洞和局部干涸会造成热点。TIM1还可能受到芯片、封装盖板、焊料或底部填充材料之间的热膨胀差异影响,可靠性不能只用名义导热率判断。
TIM2的接触面积通常更大,承担的是把盖板或热扩散板的热量传给冷板。逐字稿强调了TIM1与TIM2热需求的差异:热源侧的热流密度和外部盖板侧的面积、压力分布并不相同。TIM2需要适配更大的平面、装配公差和可维护性要求,材料的泵出、沉降、压缩回弹、界面空洞以及多次拆装后的性能都可能成为问题。TIM2即使单位面积热流密度较低,也可能因面积大、厚度不均和接触压力不足形成系统瓶颈。
因此,TIM1和TIM2不应只用一个导热率排行榜比较。TIM1重点看薄层热阻、空洞率、润湿与铺展、封装可靠性和高温稳定性;TIM2还要看大面积覆盖、压缩后的厚度保持、界面贴合、返修与寿命。液冷系统中,TIM2还要与冷板表面处理、弹片或压紧机构、冷却液温度和流量协同。若冷板接触面不平整,材料再高导热也可能被局部空隙抵消。
原口径给出硅胶材料导热率约20W/mK,并出现“50–70”和“130–170”两个区间。前者同样只是逐字稿中的估计,未提供测试标准、填料比例、厚度或温度条件;后两个区间的材料名称、单位和数值顺序无法可靠确认,不能据此完成材料性能排序。文章不把这三组数字绘制成比例图,也不把原口径估计理解为第三方实验结果。实际比较时,应要求供应商提供在相同厚度、压力、温度、测试方法下的体积热阻、界面热阻、可靠性和批次一致性数据。
界面材料的价值量也存在类似边界。逐字稿出现过面积、片数以及每片美元价格的组合,但“60成”“70–80平方毫米”等识别结果无法确定其对应关系,单价对应的是何种材料或封装层也不清楚。因此,这组内容不作为正文的确定价格。对于材料厂商,真正重要的商业指标包括进入哪一级封装、每个模块的用量、涂覆或贴合良率、客户认证周期、返修策略和量产后的失效率,而不是把模糊单价乘以一个未经核实的出货量。
热界面升级通常有三条路线。第一条是提高材料本身的填料体系和导热能力,但要同时控制黏度、绝缘、可靠性和加工窗口。第二条是减少界面层数量或厚度,例如改善盖板、冷板和封装表面的平整度。第三条是重新设计压力与热扩散结构,让界面材料在可控压力下充分填充。高价值量往往来自三者的组合,而不是单一材料替换。
界面层的测量也有两个容易混淆的概念:材料本体的热导率和装配后的界面热阻。前者反映材料内部传热能力,后者还包含表面粗糙度、压力、厚度、空洞和接触面积。相同材料在不同压紧力下可能得到不同的热阻曲线;同一片材料在芯片侧和冷板侧也可能承担不同的应力与温度。供应商应提供随压力、厚度和温度变化的曲线,客户则要在真实封装表面复测,不能直接用宣传页中的单点热导率替代系统数据。
TIM的制造一致性同样会形成热性能离散。涂覆量不足会留下干区,涂覆量过大又会增加厚度;贴片偏移会让热点边缘缺少有效接触,固化条件变化则可能改变黏弹性和泵出行为。对量产线而言,自动点胶或贴合、在线厚度检测、空洞检查和追溯系统的重要性不低于配方升级。若客户每次维护都需要重新压合界面层,还应把拆装次数和返修后的热阻纳入验收,而不是只验证首次装配。
四、光模块散热:从被动结构走向均热板和冷板

当功耗仍处于较低水平时,散热片、金属壳体、导热垫和系统气流可以完成大部分任务。1.6T及更高速率下,热点扩散速度和模块平均温度同时成为约束,VC均热板的使用可能增加。均热板通过腔体内工质相变和毛细结构,把热量从局部热点快速铺开,再交给壳体、散热片或冷板处理。它解决的是面内扩散问题,不能替代最终的热量排出路径。
逐字稿将800G到1.6T的变化概括为VC使用增多:较低速率阶段,部分光模块采用散热片和导热界面即可;功耗提高后,原有组合接近热设计上限,需要加入VC来扩散热点。这一判断具有结构上的合理性,但VC是否必要仍取决于热源位置、壳体材料、冷却边界和模块内部空间。VC还需要关注厚度、封装密封、毛细结构一致性、姿态适应性、冷热循环和振动可靠性。
冷板提供的是更强的外部热沉。模块与冷板之间可以通过弹片维持接触,也可以增加外部TIM。弹片方案便于形成稳定压力,但要处理公差、疲劳和局部压强;TIM方案能填补表面间隙,却会增加材料老化、泵出和装配污染等问题。逐字稿提到部分交换机方案已使用外部界面材料,并给出每片“大几十元”的原口径估计,但材料名称、具体部件和计价口径没有被可靠识别,不能外推为统一市场价格。
冷板本身也不是孤立部件。风冷转液冷后,机柜内的增量通常更集中在冷板、歧管、管路、接头、泵和控制系统,而非简单替换一个金属框架。冷板需要在有限厚度内完成流道设计、热扩散、压降控制、密封和可制造性平衡。流量不足会造成局部温升,压降过大则提高泵功耗;流道和接头的可靠性还关系到泄漏风险和维护成本。
逐字稿还出现人民币50、200以及2000–2500等部件价值数字,但对应的部件名称、比较基数和单位关系存在明显识别疑点。这些数字不写成确定的冷板或液冷组件价格,也不放入信息图。能够进入商业判断的验证项应包括单板热阻、入口与出口温差、规定流量下的压降、泄漏测试、长期循环、批量良率以及在整机环境中与模块接触后的温度一致性。
散热结构的价值量提升还取决于客户采用的系统架构。若终端只允许传统风冷,供应商的机会主要在壳体、VC、散热片和TIM;若终端导入冷板,机会会扩展到冷板加工、表面处理、外部TIM、弹片、歧管和装配测试;若进入NPO/CPO,光引擎的局部热隔离和主动控温又会成为新的价值环节。不同方案的单机价值不能直接相加,否则会把替代关系误算为叠加关系。
均热板和冷板的共同目标是把热点送到更大的散热边界,但物理侧重点不同。VC优先解决模块内部的热扩散和温度均匀性,冷板优先解决系统级热量搬运。二者可能同时出现,也可能根据成本、空间、液冷条件和可靠性要求择一使用。判断升级节奏时,应沿着“热点是否被摊平—热量是否被带走—接口是否稳定—量产是否可制造”的顺序核验。
冷板的设计还要处理局部热流与整体压降的矛盾。流道更密可以提高换热面积,却可能增加压降和加工难度;流道更宽有利于流量,但热点区域未必得到足够的换热能力。不同模块并联时,歧管分配不均会让靠近入口的器件和远端器件处在不同边界条件下。实际验收应建立流量分配、入口温度、局部热阻、出口温度和泵功耗之间的对应关系,并对堵塞、气泡、停泵和异常流量保留保护策略。
VC的量产难点也不只在相变腔体。毛细结构、工作液、封装焊接和表面平整度共同决定热扩散能力,薄型化后更容易受到翘曲和机械冲击影响。模块内部空间有限时,VC的安装位置可能改变器件压合路径和电磁结构;如果VC与外部TIM接触不均,面内扩散的收益仍会被最后一个界面抵消。因此,应把VC放在完整热路径中测试,而不是只验证一块样品的表面温差。
五、MicroTEC:局部主动控温连接光模块与HBM

MicroTEC可理解为微型热电制冷器,利用热电效应在电流作用下把热量从一侧搬运到另一侧,并通过控制电流实现局部制冷或加热。逐字稿将其描述为具有精确控温能力的器件,当前在光模块中主要对应中长距离方案,原因是激光器和相关光器件对温度窗口更敏感。它的价值不在于替代所有散热器,而在于为小区域建立可调节的温度边界。
典型结构包括交错排列的N型、P型半导体热电偶阵列、导电互连以及上下两片陶瓷基板。陶瓷基板既承担绝缘与机械支撑,也参与热量传递;表面金属化、焊接或互连工艺会影响电阻、热阻和可靠性。对于光模块,MicroTEC的冷端可能靠近激光器或光引擎,热端仍需连接到更大的热扩散结构。制冷能力、功耗、厚度和热端温度必须一起评估。
速率从400G、800G继续向1.6T提高时,光模块内部的温度控制难度可能上升。逐字稿给出的方向是,单机搭载片数和整体面积都可能增加,封装空间越紧,单机价值和渗透率也存在提升机会。这不是自动兑现的增量:只有当被动散热无法维持光学性能,且系统能够提供供电、传感、控制和热端散热条件时,主动控温才有明确的导入理由。
在NPO/CPO中,MicroTEC的作用更偏向抑制热串扰。交换芯片与光引擎靠近后,芯片侧高功耗会通过封装和结构传到光源;光源自身的发热又可能叠加局部温升。主动控温可以在局部改善激光器波长稳定性,但它不能消除ASIC的总热量,也不能替代冷板。设计必须回答三个问题:冷端从哪里吸热,热端把热送到哪里,控制回路如何在负载变化时保持稳定。
上游材料和制造环节也会决定MicroTEC是否能量产。逐字稿将DPC陶瓷载板列为关键上游,并指出海外供应商目前占主要位置、国内处于逐步导入阶段。DPC相关的陶瓷、金属化、烧结、互连和检验工艺会影响尺寸精度、导热路径、绝缘性能和批量一致性。验证不能只看样品的制冷温差,还要看热循环、剪切强度、焊点寿命、绝缘耐压、漏电流、洁净度和与光模块封装的协同良率。
HBM是另一种潜在应用。逐字稿提到12层以上的多层堆叠,并将GPU侧向热量与堆叠内部热量聚集联系起来,给出局部温度达到85–95摄氏度以上的识别结果。这里的温度范围属于原口径描述,没有给出测点、负载、环境、散热边界和统计方法;“95摄氏度以上可能影响正常读写”也应理解为条件性观点,不能当作所有HBM的统一失效阈值。
逐字稿进一步提出,若HBM搭载MicroTEC,温度可能被限制在75摄氏度以内,并改善GPU与HBM之间的热耦合。这是方案目标或测算性判断,不是已由本文确认的量产性能。它能否成立,取决于热电器件的冷端位置、热端导出能力、额外功耗、封装空间、控制策略和GPU冷板的余量。主动制冷带来的温度收益必须与其自身耗电和热端增负荷共同核算。
MicroTEC的产业价值可能因此出现两种增长方式:一是同一模块中片数、面积或性能要求增加;二是从光模块扩展到更高价值的芯片、存储和先进封装场景。逐字稿给出了到2028年“几百亿甚至1000亿”的原口径市场估计,但市场边界、币种和是否包含光模块与HBM的重复计算均未核实,不能作为确定规模,也不在图中绘制。更稳妥的观察顺序是先确认DPC载板、热电偶阵列和封装器件是否完成客户验证,再看量产片数、单机用量与良率。
热电制冷器的控制目标通常不是恒定地把冷端压到最低,而是根据器件温度、输入电流和热端条件调整制冷量。电流增加会同时提高搬热能力和焦耳热,控制器如果只看冷端传感器,可能忽略热端逐渐升温造成的能力下降。光模块场景需要把激光器温度、环境温度、驱动功耗和光学输出纳入闭环;HBM场景还要考虑GPU主冷板和堆叠内部热扩散的延迟。控制响应、稳定性和异常保护必须与器件热性能一起验证。
DPC载板的导入还存在工艺链依赖。陶瓷基材、金属化层、图形精度、烧结收缩、焊接和检测任何一项出现离散,都可能放大到MicroTEC的电阻、热阻或绝缘失效。客户导入往往需要样品、小批、可靠性和持续量产多个阶段,供应商还需证明设备稼动率、关键尺寸能力和失效追溯。因而,国内替代的兑现节奏不能只看是否有样品,而应看批次合格率、验证周期和持续供货能力。
六、GPU、CPU与HBM:热管理从单点散热转向耦合控制

GPU、CPU和HBM的热管理差异,首先来自热源形态。GPU或CPU通常把较高功耗集中在一块芯片或多个计算簇中,热量经过TIM1、IHS或封装盖板后进入冷板;HBM则是多层堆叠,热量不仅从顶面和底部传出,还会在堆叠内部形成不均匀的温度场。两者安装距离越近,热耦合越强,任何一侧的散热优化都可能改变另一侧的温度边界。
GPU侧向热源与HBM堆叠热源叠加后,会出现三个管理目标。第一是降低最高温度,避免局部区域进入影响性能或可靠性的高温状态。第二是降低温度梯度,减少封装、互连和堆叠层之间的热机械应力。第三是控制温度波动,避免负载变化造成反复热循环。单纯提高冷却液流量可以改善平均温度,却不一定能解决局部热点和快速波动;单纯增加界面材料导热率,也不一定能让堆叠内部热量顺利抵达冷板。
CPU/GPU常见路径是芯片或裸片—TIM1—IHS或盖板—TIM2—冷板。TIM1决定芯片侧的初始热阻,TIM2和冷板决定热量能否从封装表面继续离开。若封装盖板面积大而压力不均,TIM2的厚度变化会造成局部热阻差异;若裸片直接连接冷板,则需同时解决芯片脆弱性、表面平整、压紧力和返修问题。封装方案不同,TIM层数和命名也可能不同,不能把一套热路径强行套到所有GPU、CPU和HBM产品上。
液冷的引入改变了热端边界,但也带来新的系统约束。冷板必须维持稳定的入口温度与流量,泵和歧管需要把多个高功耗器件的热量分配到系统级换热器;如果为保护HBM而降低局部冷板温度或提高冷却能力,系统能效可能受影响。逐字稿提到为保护HBM而调整冷板水温的思路,并把能效损失作为代价,这说明热管理的优化目标不是单项温度最低,而是性能、寿命、功耗和可靠性的综合平衡。
MicroTEC在这一体系中的位置是局部补偿。它可以对激光器、光引擎或HBM邻近区域进行精细调节,减少全系统为一个局部热点过度配置冷却能力的需要。但它不能替代GPU/CPU的主冷板,也不能在热端没有散热余量时创造额外的散热能力。评价主动器件时,应把芯片性能、HBM带宽稳定性、单位算力能耗、制冷器自身功耗、热端温升和封装寿命放在同一张测试表里。
热管理的验证应从器件级逐步扩大到系统级。器件级看热电性能、导热率、界面热阻、绝缘与可靠性;封装级看热阻网络、温度场、翘曲、应力和冷热循环;板级看冷板温度、流量、压降和泄漏;整机级看不同负载下的性能降频、HBM读写稳定性、光学漂移、噪声、能效与维护。只有这些层级的结果能够相互闭合,才能判断一个热方案是真正解决了瓶颈,还是把热点移动到不容易测量的位置。
GPU、CPU与HBM的负载也不能用一个固定工况代表。计算密集负载可能把热量集中在GPU核心,带宽密集负载则可能让HBM和互连的热贡献更突出;混合负载会改变两者的相互加热关系。测试应覆盖不同功耗分布、持续时间和频率变化,并观察是否发生动态降频、错误重试、带宽下降或温度保护。若MicroTEC只在一个短时峰值工况下显示降温,而持续负载时热端饱和,就不应据此推导长期性能提升。
对于HBM,温度管理还关系到封装机械可靠性。堆叠层、微凸点、基板和邻近GPU的热膨胀系数不同,温度梯度与循环次数会影响疲劳累积。降低峰值温度固然重要,但如果主动控温引入更快、更频繁的温度波动,也可能改变可靠性结果。应把峰值、平均值、梯度、循环幅度和循环次数同时记录,并用失效分析确认温控策略是否真正降低风险。
七、产业链、行业空间与兑现顺序:把预测拆成验证条件

热管理产业链可以先按功能划分为四类。第一类是材料,包括TIM、导热填料、绝缘材料、陶瓷基板和热电半导体材料;第二类是器件,包括MicroTEC、VC、温度传感和控制组件;第三类是结构与制造,包括光模块壳体、散热片、冷板、歧管、管路、金属化、DPC和精密加工;第四类是系统集成,包括光模块、交换机、GPU/CPU/HBM封装、液冷机柜和整机测试。不同环节的价值量、认证周期和客户集中度差异很大,不能因为同属“散热”就使用同一套估值逻辑。
材料厂商的核心验证条件是配方、稳定性和量产工艺。TIM需要证明相同压力和厚度下的热阻,以及泵出、干涸、老化、绝缘和批次一致性;陶瓷和DPC载板需要证明金属化、尺寸精度、绝缘耐压、热循环和批量良率;导热材料还需要适配客户的涂覆、贴合、固化和返修流程。实验室样品的高导热率不等于客户会导入,能否在客户设备与节拍下稳定生产往往才是关键门槛。
器件厂商的核心条件是进入热路径而非只提供单品。VC要证明在目标姿态、温度循环和振动下仍能有效扩散热点;冷板要证明热阻、压降、密封和加工一致性;MicroTEC要证明制冷能力、响应、功耗、绝缘、焊接和封装寿命。若器件需要与光引擎或HBM共同封装,还要增加洁净度、厚度公差、互连可靠性和客户失效分析。客户验证通过以后,片数、面积和每机用量才有可能转化为可持续收入。
制造商的优势通常来自长期工艺积累、客户协同和量产交付,而不是单一材料指标。冷板和DPC的加工能力、金属化能力、自动化装配和检测能力,会直接影响液冷与MicroTEC的扩张速度。拥有成熟结构件客户的厂商可能更容易进入新方案,但仍需证明新产品的热性能和可靠性;拥有材料配方的厂商也需要建立结构件、封装和客户现场的验证能力。产业链位置应以已量产产品、客户认证、订单结构和良率为依据,而不是以模糊专名或单次项目传闻确认供货关系。
兑现顺序大致可以分为三层。第一层是已经接近量产的升级,包括800G到1.6T带来的界面材料、VC、壳体和外部接触结构变化。验证重点是模块功耗、热点温度、热阻、结构寿命和真实出货量。第二层是冷板和液冷组件的系统导入,重点看机柜液冷渗透、单板热设计、流道与密封、歧管交付以及终端运维能力。第三层是NPO/CPO与MicroTEC向光引擎、HBM等更高耦合场景扩展,重点看客户设计定点、封装空间、主动控温控制、额外功耗和长期可靠性。
行业空间的判断必须保留口径边界。逐字稿给出过“2028年VC市场超过200亿”的原口径预测,也给出过光模块与HBM的MicroTEC到2028年达到几百亿甚至1000亿的估计。前者没有明确市场边界、币种和统计范围,后者还存在金额单位与重复计入的识别疑点;这些数字不能作为确定市场规模,不能在图形中按比例展示。更稳健的做法是用渗透率、单机用量、单价、良率和客户数量建立自下而上的模型,并将不同应用的替代关系分开计算。
主要风险有五类。第一是技术风险:被动散热、VC、冷板和MicroTEC可能在不同平台上互相替代,理论增量不一定叠加。第二是可靠性风险:界面泵出、冷板泄漏、陶瓷开裂、热电器件疲劳和封装热循环都可能延迟量产。第三是客户风险:光模块、交换芯片、GPU、HBM和机柜的验证链条不同,单一客户导入不能代表全行业渗透。第四是能效风险:主动制冷、泵、控制和更低水温会增加额外功耗,局部降温可能降低系统级能效。第五是口径风险:功耗、温度、材料导热率、单价和市场规模若缺少测试条件与单位,容易把方向性判断误写成确定事实。
因此,最值得跟踪的不是某个单独的概念,而是从设计到交付的证据链:1.6T模块是否持续放量,VC和外部TIM是否进入稳定BOM,冷板和液路组件是否完成可靠性验证,MicroTEC及DPC载板是否形成批量供货,HBM热方案是否从演示进入客户定点。只有当这些条件逐一出现,热管理的材料升级、器件增量和系统价值量才会从预测转化为可兑现的产业收入。
投资或产业跟踪还应把“设计采用”和“收入兑现”分开。设计采用可以由样品、定点、联合开发或测试平台证明,但收入兑现还需要持续出货、单机用量、良率和结算周期。液冷项目可能先由整机客户验证冷板,再由多个结构件厂商分配订单;MicroTEC可能先在长距离光模块中形成稳定用量,再进入更严格的芯片封装。每一个阶段都可能因成本、供应链替代或客户路线调整而停滞,因此兑现顺序应以连续季度的出货和产品结构变化确认,而不能只依据一次导入消息。