澜起科技:CXL让DDR4重返数据中心,低成本扩容能兑现多少增长?
澜起科技相关CXL内存扩展方案尝试复用DDR4缓解服务器容量压力;成本优势能否转化为增长,取决于性能、平台、软件与客户验证。

澜起科技相关CXL内存扩展方案,切入的是人工智能基础设施从算力扩张转向内存容量约束后的新问题。CXL提供了一条通过PCIe通道扩展内存的路径,使服务器能够把仍可使用的DDR4接入新系统;这不意味着DDR4在性能上追平DDR5,也不意味着所有数据中心都能立刻采用。真正的机会来自容量紧张与资本开支压力,能否形成持续收入,则取决于延迟、通道资源、软件调度和客户验证。

一、AI工作负载把内存容量推到前台

章节配图 01
章节配图 01

生成式模型的推理可以表现为“输入问题、返回答案”,但智能体式工作负载需要持续保留更多上下文。一个智能体在处理复杂任务时,会保留指令、过程状态和待继续调用的信息;这部分上下文通常以KV Cache等形式占用内存。任务越长、并行运行的会话越多,单颗处理器可使用的内存容量就越容易成为约束。算力再强,如果上下文放不下,系统仍需要在并发数量、任务长度或响应方式上作出限制。

因此,内存需求增长并不只来自模型参数变大,也来自推理过程需要保存更多状态。内存扩容的价值在于把原本受服务器插槽和本地配置限制的容量边界向外推,而不是让每一类内存都承担同一种任务。高频、低延迟的数据仍有本地内存的位置;扩展容量更适合承接可以容忍较长访问时间的内容。容量层级如果能够按数据冷热安排,系统就有机会以较低成本保存更多上下文。

需求增加的同时,供给端也面临资源分配压力。逐字稿引用的口径称,生产相同容量的HBM3E需要占用相当于普通DDR5三倍的晶圆产能。这里比较的是达到相同内存容量所对应的产能占用,不是说HBM3E的市场规模或性能只相当于DDR5的某个倍数。高带宽产品占用更多生产资源,会挤压普通服务器内存可获得的产能;当数据中心仍需要大量通用内存时,供给紧张和采购成本就会同时进入决策。

逐字稿还给出一个2028年的服务器DDR内存缺口数字“110Gb”。现有表述没有进一步说明这里的b是比特还是字节,也没有交代统计对象和测算边界,因此只能保留为该预测口径,不能擅自改写单位或将它当作已发生的短缺。更可靠的判断框架是把需求增长、产能转向高带宽内存和普通服务器内存供给承压视为一条待验证的逻辑链,而不是用一个口径未明的数字代替整个市场分析。

一项被描述为已经进入生产环境的配置是768GB本地内存加256GB CXL扩展内存。它说明在特定系统中,本地内存与扩展内存可以并存,也显示出扩展容量的实际使用方式。单一配置不能代表行业采用率,更不能据此推断所有人工智能服务器都会增加相同比例的扩展内存。它提供的是一个应用信号:当本地容量不够、任务又能容忍不同内存层级时,扩展方案才有讨论空间。

这个应用信号还揭示了容量扩张的现实顺序。服务器不会因为有了扩展接口就把本地内存全部替换掉,而更可能先保留一层响应最快的本地资源,再把新增需求放到外接层。对智能体任务而言,部分上下文需要反复读取,部分上下文只在流程继续时才会再次调用;如果系统能把两者区别开,扩容就不必以同一规格覆盖所有数据。反过来,如果应用把所有数据都当作热数据,扩展内存的容量优势会被额外等待抵消。CXL的需求由此不是单一的“内存越多越好”,而是容量增长、访问模式和软件管理同时变化后的结果。

二、CXL如何把内存接到PCIe通道上

章节配图 02
章节配图 02

传统配置把内存插在处理器附近的DIMM插槽里。可用容量受主板插槽数量、单条容量和平台配置限制;当插槽已经用满,单纯再加内存条就不再是一个可选动作。CXL改变的是扩展路径:它是一种架设在PCIe总线上的高速通信协议,允许通过外接控制器把内存挂接到通用PCIe通道上,使内存容量不必完全依赖处理器旁边的插槽。

可以把它理解为在既有数据通道上增加一条通往外部内存的连接。主机一侧仍负责计算和发起访问,PCIe/CXL通道承载主机与扩展端之间的数据交换,内存扩展控制器(MXC)负责把扩展内存接入这条路径。原先无法放进本地插槽的额外容量,由此有机会成为主机可访问的另一层内存。这个比喻只说明连接关系,不代表扩展内存与本地DIMM在延迟、带宽或访问方式上完全相同。

这一区别决定了CXL首先解决的是“容量能否扩出去”,而不是“外接内存能否变成本地内存”。系统通过控制器访问扩展内存时,数据需要经过额外的连接路径;传输和排队都会形成代价。因而合理的设计不是简单地把所有内存都外接,而是区分不同数据对延迟的要求,把更多容量用于适合扩展层的负载。

在逐字稿呈现的商业路径中,MXC与DDR4复用被放在较早的大规模应用位置。其关键不是旧内存本身突然变快,而是CXL提供了新的接入方式,控制器又负责建立主机与外接内存之间的连接。若系统原有PCIe资源可用、扩展端能够通过兼容性验证,并且软件知道如何安排数据,这条路径便可能把可用容量增加到本地插槽之外。任何一环未满足,单独拥有旧内存或控制器都不能构成完整部署。

三、DDR4重新出现,首先是一笔资本开支账

章节配图 03
章节配图 03

重新考虑DDR4,原因不是新一代内存失去价值,而是容量、供应和成本在特定时期发生了错位。逐字稿引用的一组定价模型,把128GB原生DDR5的采购成本估为约3500美元;另一条路径使用两根拆机的64GB DDR4,并把CXL控制器和电路板成本一并计入,合计约920美元。按这组比较,后者比前者低约74%。这是具体模型下的对照,不是适用于所有采购批次、服务器配置和供应商报价的通用价目表。

两种配置容量相同,不代表它们在延迟、性能、功耗、可靠性保障或维护要求上完全等价。这个成本比较回答的是“为了获得额外容量要花多少钱”,不是“每一种工作负载都应选择更便宜的方案”。当部署规模较大时,单位配置的价差可能放大为显著的资本开支差异;逐字稿据此强调,数据中心可能用较低的初始采购成本,换取更多可安装的总容量。具体能省下多少,仍取决于价格模型、控制器与板卡成本以及能否实际复用合格的内存。

存量资产的使用周期为这种价差提供了另一层理由。逐字稿把服务器核心CPU和GPU的淘汰周期描述为每5至7年,而DDR4内存的物理寿命可超过10年。若服务器因计算平台升级而退役,内存仍可能保持可用,于是计算设备和内存资产不再必然同时报废。CXL提供的外接路径,让这批内存有机会进入下一轮系统配置;但“物理上仍可工作”不等于“已经通过新平台兼容性、稳定性和客户认证”,也不等于每根退役内存都值得回收。

复用的前提因此有三层。第一层是内存颗粒和模组仍具备可用的物理状态;第二层是模组、电路板、控制器和服务器平台之间能够稳定协同;第三层是客户愿意把经过筛选的存量部件纳入生产维护体系。任何一层缺失,回收价值都只能停留在账面上。尤其在大规模集群中,零散的二手条并不自动形成可管理的库存,容量、批次、故障率和替换方式都会影响维护成本。材料没有提供这些筛选和运维数据,因此成本优势应理解为“具备复用条件时的潜在优势”,而不是所有退役DDR4都能按同一价格重获价值。

成本优势还要与运行费用一起看。DDR4在代际性能和能效方面不如DDR5,扩展内存也会增加连接与控制器的功耗。如果这些容量长期满负载运行,省下的采购成本可能被电费和运行成本侵蚀。逐字稿提出的缓冲条件是,CXL控制器具备电源管理机制,低频调用时扩展内存可以休眠;另一项考虑是,数据中心在AI建设阶段面对较大的资本开支和现金流压力,较高的一次性内存采购可能比后续逐步发生的电费更难承受。

这是一种资本开支与运营开支之间的权衡,不是对所有场景都成立的结论。材料没有给出休眠状态下的实际功耗、唤醒成本、负载曲线或电价,也没有对比完整生命周期的总拥有成本。若扩展内存持续处于高负载,或者电力成本远高于节省的采购成本,结论可能改变。因此,DDR4方案的价值要以工作负载和运行条件为前提:先确认它承接的数据确实可以低频访问,再计算省下的初始投入是否大于新增运行代价。

四、DDR5与DDR4的部署取舍:容量不等于性能

章节配图 04
章节配图 04

本地DDR5和CXL扩展DDR4承担的角色不同。前者依靠靠近处理器的本地路径,适合对响应速度要求高的数据;后者通过PCIe/CXL增加可用容量,主要提供成本较低的扩展层。把两者放在同一套服务器中,不意味着二者可以随意互换,也不意味着更大的总容量会自然转化为更高的应用性能。应用究竟受益还是受损,取决于新增数据被放在哪里以及访问频率有多高。

逐字稿给出的低负载延迟对比是:本地DDR5约80至110纳秒,CXL连接内存约200至270纳秒,扩展内存延迟约为本地的2至2.5倍。负载升高后,排队延迟还会进一步恶化。这里的数值是特定比较口径,不能直接推广到所有处理器、控制器或软件栈;但它足以说明扩展容量不是免费的性能提升。若热数据频繁访问CXL,额外等待就可能进入应用关键路径。

因此,工作负载需要做冷热分层。逐字稿把智能体上下文等对瞬时响应要求相对较低的数据归入较适合扩展层的温数据,同时明确排除高频交易和实时渲染等对响应时间敏感的场景。这个区分不是说所有KV Cache都天然适合放在CXL上:上下文不同片段的访问频率可能不同,是否放入扩展内存还要看实际调用方式。容量很大但访问频繁的数据,仍可能因为延迟而不适合;容量较小但能够容忍等待的数据,反而更可能从扩展层受益。

功耗也会影响部署位置。DDR4的能效不及DDR5,CXL控制器的休眠机制只能在低频调用时提供缓冲,不能消除运行功耗。若某类数据在实际负载中并未进入休眠,或者频繁唤醒造成额外开销,就不能只引用“可休眠”来证明电费可控。部署前需要结合工作负载测量访问频率、响应要求和运行功耗;现有材料没有提供这些测试结果,因而只能说明机制和可能的取舍,不能给出普遍适用的性能结论。

连接资源是另一项硬限制。一般服务器被描述为有80至128条PCIe通道,分出部分通道用于CXL仍可能可行;AI服务器中的GPU加速卡和高速网卡已经占用大量通道,剩余资源可能不足。于是,“能通过PCIe扩展”不等于“每台AI服务器都有空余通道可用”。平台配置必须核实实际通道分配和设备优先级,不能只看CXL控制器理论上可以连接。

这也意味着部署取舍会落到平台级设计,而不是只落到一块扩展板。若GPU、网卡和其他设备已经占满通道,增加CXL可能需要改变主板布局、设备组合或拓扑安排;即使通道数量足够,新增路径也要评估是否与现有设备争用带宽。材料没有给出具体平台的通道分配表,所以不能判断某一服务器一定可以插入多少扩展内存。对采购方而言,容量缺口、数据热度、通道余量和运行功耗必须一起测量,不能用一项成本差额替代完整的系统评估。

五、澜起科技的机会,仍需经过产品与客户验证

章节配图 05
章节配图 05

澜起科技的增长逻辑,建立在CXL扩展内存需求可能形成产品市场这一判断上。逐字稿把MXC,即内存扩展控制器,视为连接CXL与外接内存的核心部件,并预测相关业务有机会为澜起科技2028年营收带来约10%的额外增长。这个数字描述的是预测情景下的营收增量,不是已经实现的收入,也不能读成公司全部营收增长率或利润增幅。

把技术机会转成供应商收入,需要经过一串具体门槛:产品设计完成、服务器平台能够兼容、客户完成资格验证、设备进入部署,最后才可能形成持续采购。现有逐字稿没有列出澜起科技相关产品的具体型号、参数、兼容平台清单或已经完成的客户认证结果,也没有把某一客户的扩展内存配置明确归因于澜起的控制器。因此,能够确认的是预测所依赖的产品类别和验证路径,而不是澜起某款产品已经在某家客户处批量部署。

客户案例与供应商验证必须分开。逐字稿提及的768GB本地内存加256GB CXL内存配置,是一个生产环境应用信号;但它没有给出所用控制器的供应商,也没有说明采购数量、部署范围或认证过程。该案例能支持“扩展内存并非只停留在实验室设想”的有限判断,不能支持“澜起已经赢得该客户订单”或“该配置已经大规模复制”。

市场份额假设也很具体:预测2028年营收增加约10%,前提是澜起在中国市场取得50%的份额、在中国以外市场取得10%的份额。两项份额是模型条件,不是当前份额或已经拿到的订单。若后续披露的客户验证、实际装机与销售份额没有接近这组假设,增长模型就需要下调或重算。评估时还需辨别份额的分母和产品统计范围;现有表述没有进一步定义口径,因此不能把两项比例扩写成全球总市场已经形成的格局。

硬件之外,软件生态也决定扩展内存能否被有效使用。逐字稿强调Linux内存分层,也就是Memory Tiering,需要识别哪些数据留在昂贵、低延迟的本地内存,哪些数据可以进入较便宜的扩展层。若系统没有能力管理冷热数据,扩展容量即使安装完成,也可能无法按照预期被应用利用。换言之,控制器兼容只是必要条件之一;操作系统和软件栈是否能把数据放到合适的位置,同样关系到客户是否愿意持续部署。

从商业化角度看,软件层还会决定客户的切换成本。客户不仅要购买控制器和内存,还要确认现有应用、调度策略和故障处理流程能识别不同层级。若数据迁移需要大量人工规则,或者应用无法接受访问延迟的波动,扩展容量的理论利用率就会低于安装容量。反之,若系统能够根据访问频率自动完成分层,客户才可能把CXL从一次性的容量补丁变成可重复部署的基础设施。材料只提出Memory Tiering这一验证方向,没有给出软件版本、功能覆盖或性能测试,因此目前只能把它列为商业化必要条件,不能写成已经成熟的生态能力。

六、市场预测需要兑现为采购,而不是停留在估值情景

章节配图 06
章节配图 06

逐字稿提出,DDR4复用相关业务到2030年可能催生约80亿美元的新市场;另一个预测是该业务有望为澜起科技2028年营收带来约10%的额外增长。两者是不同指标:前者描述预测中的市场规模,后者描述单家公司在特定份额条件下的营收影响。现有信息没有完整展开80亿美元的市场定义、覆盖环节、统计区域或价格假设,不能把它直接等同于可服务市场、公司收入或利润。

市场形成依赖几个条件同时满足。第一,AI服务器容量需求和普通内存供应压力持续存在,使数据中心愿意评估替代扩容方式;第二,CXL与MXC方案的总成本优势在加入控制器、板卡、功耗与维护后仍然成立;第三,服务器平台存在可用PCIe通道,延迟适合承载目标数据;第四,产品完成兼容性与客户资格验证;第五,软件能够将冷热数据分配到不同内存层级。只要其中一个环节卡住,理论容量就未必转化为采购。

因此,判断增长逻辑是否兑现,应同时看三类信号。第一类是云服务商的qualification进展和实际插卡部署范围,并进一步区分试点、少量上线和规模采购;只有真实采购才能证明预算从测试走向商业化。第二类是澜起相关产品的市场份额和后续财务披露,尤其是能否接近中国50%、中国以外10%的模型前提。第三类是Linux内存分层的软件成熟度,系统能否持续、自动地将适合的数据安排在扩展层。市场份额、客户测试和软件支持不能互相替代,任何一项单独改善都不足以证明整个商业链条已经跑通。

风险也应按兑现顺序观察。DDR4与DDR5存在性能和能效差距,CXL延迟可能限制适用工作负载;高负载排队会增加不确定性;AI服务器PCIe通道被GPU和高速网卡占用,可能压缩扩展空间;实际功耗和休眠效果尚无完整测算;新旧内存的兼容和客户认证状态未展开;市场空间、份额和营收增量都属于预测。若客户验证推迟、采购意愿减弱、系统软件不能管理数据冷热,或内存价格变化削弱成本优势,市场规模和公司收入预测都可能落空。

还需要区分“需求存在”和“需求由某一供应商承接”。智能体带来的容量压力可能推动客户寻找方案,但客户可以选择增加原生内存、调整软件、改变服务器配置,或者等待供给恢复;CXL扩展只是其中一条路径。即使客户采用CXL,也不意味着所有扩展卡都由同一家控制器供应商提供。因而,对澜起科技的判断应同时关注产品在客户系统中的实际位置、认证是否转化为采购、采购是否扩大为批量部署,以及收入增量是否具有持续性。仅凭总市场预测或单个应用案例,无法完成这条归因。

七、从外挂扩容到内存池,是愿景而非当前部署结论

章节配图 07
章节配图 07

CXL更长远的设想,不止是把一组内存挂到单台服务器外部,而是把多个系统可访问的内存资源组织成池。逐字稿所描绘的演进顺序是直接扩展、内存池化、再到内存共享:起点是为单台主机增加外接容量,中间阶段让内存从固定归属转为可被组织和调度的资源,远景则是数据中心内的计算设备按需获取共享池中的容量。

这个方向可以帮助理解为什么CXL被视作架构层面的机会:如果内存资源不再严格绑定于一台服务器,资源利用方式和基础设施边界就可能发生变化。逐字稿以城市供水管网作比喻,表达的是“需要时取用、用完后归还”的共享构想。比喻不是部署方案,也没有给出池化系统的实际规模、访问延迟、故障恢复方式或可实现时间表。

因此,不能把内存池化和共享写成DDR4复用已经实现的下一步商业结果。现有具体论证聚焦于通过CXL扩展内存并复用DDR4;更大范围的共享架构仍缺少清晰部署时间线和量化预测。协议标准和互联控制权可能影响下一代计算架构,这是战略层面的推演,不等于某家公司已经取得标准控制权或确定的市场地位。

对这项机会更稳妥的判断,是把近期、可验证的扩容经济性与长期架构愿景分开。近期看单机容量、成本、延迟、PCIe通道、兼容性和真实采购;中期看客户部署规模、营收贡献和软件分层;远期才讨论池化与共享能否改变数据中心资源组织。只有当这些阶段逐步通过验证,CXL才可能从解决容量缺口的连接方式,发展为更广泛的内存基础设施。预测可以描绘方向,实际产品、系统适配和客户采购才决定增长是否兑现。

这条观察顺序也避免把不同时间尺度的判断混在一起。DDR4复用可以先以单机扩容的形式出现,解决的是眼前的容量和资本开支问题;内存池化则要求更多设备在协议、调度、故障隔离和资源归属上形成配合,验证难度更高。前者即使获得订单,也不能自动证明后者已经临近。对投资和产业判断而言,最重要的不是把远景叙事提前计入现实,而是按客户验证、硬件部署、软件支持和财务披露逐层更新概率。这样才能在“旧内存重获使用价值”的短期机会与“计算架构被重新组织”的长期愿景之间,保留必要的证据边界。