数据中心,液冷正成为必选项
最近,新华三在NAVIGATE 2026领航者峰会上,发布高密全液冷整机S90000,整机最高可达576核心。新华三提出通过创新的高密供电与全液冷散热范式,可将数据中心PUE降至1.05以下。
无独有偶,2026年3月的GTC大会,英伟达也明确Vera Rubin NVL72为首个100%全液冷架构,GB300/Rubin、谷歌TPU v7、Meta Minerva等全球算力巨头已全面转向液冷方案。当单芯片功耗从H100的700W跃升至Rubin的2000W乃至Vermeer的5000W以上,传统风冷在物理层面已触及天花板。更关键的是,政策端已不给数据中心留下"不液冷"的退路。液冷不再是"节能可选项",而是算力部署与法规合规的双重"必选项"。
为什么必须要液冷?
液冷的全面普及,是技术、商业、政策等多重合力共同推动的必然结果。
芯片功耗的指数级飙升是液冷产业化的根本原因。英伟达单芯片TDP从H100的700W攀升至B200的1000W以上,再到Rubin的2000W及后续平台的5000W+;谷歌TPU v7达到980W,v8P突破1500W。当单机柜功率密度突破60kW甚至向130kW迈进时,风冷系统的散热极限与PUE劣化已不可逆转。液冷系统通过减少甚至取代高能耗的风扇群,并利用高温液体制冷实现自然冷却,可将数据中心PUE显著降低至1.05-1.1区间。
除了物理散热极限的硬约束,液冷更是保障AI训练任务连续性的生命线。大模型训练通常需要数千张GPU长时间(数周至数月)不间断运行。风冷存在局部热点风险,温度波动会导致训练任务中断、checkpoint回滚,网络同步延迟增加,整体集群效率下降等问题。液冷能提供更均匀、更稳定的温度环境,芯片可在更低结温下工作,故障率显著降低。对于万卡集群而言,任何非计划停机都意味着数百万美元的损失,稳定性是第一优先级。
在土地与电力资源日益稀缺的今天,液冷带来的空间密度优势同样至关重要。液冷允许在更小的物理空间内部署更多算力。同样1MW电力,风冷可能需要数百个机柜及大面积空调机房。液冷可将机柜数量压缩50%-70%,大幅提升单位面积算力产出(FLOPS/m²)。这在一线城市或枢纽节点(土地、电力指标稀缺)尤为关键。
如果说技术与商业需求是液冷发展的内在动力,那么日益严苛的政策法规则彻底关闭了风冷的退路。工业和信息化部于2021年7月印发《新型数据中心发展三年行动计划(2021-2023年)》,明确到2023年底,新建大型及以上数据中心PUE降低到1.3以下,东数西算枢纽节点及寒冷地区力争降低到1.25以下。发改委2021年11月印发《贯彻落实碳达峰碳中和目标要求推动数据中心和5G等新型基础设施绿色高质量发展实施方案》,进一步明确“到2025年,新建大型、超大型数据中心PUE降到1.3以下,国家枢纽节点降至1.25以下”。“东数西算”工程八大枢纽节点,要求东部地区PUE目标不超过1.25,西部地区不超过1.2,能效指标更加严格。今年,四部门联合印发《促进人工智能与能源双向赋能行动方案》,明确:新建大型AI数据中心100%采用液冷散热,2028年前存量风冷全部改造,液冷渗透率成算力基地审批硬指标。
目前,全国绝大部分省份已出台配套的PUE管控与奖惩措施。北京自2026年起对PUE超过1.35的数据中心征收差别电价,超限定值一倍以内加价0.2元/度,一倍以上加价0.5元/度;上海将新建数据中心PUE严控在1.25以内,智算中心以1.25为硬门槛;四川天府集群对PUE低于1.25的新建项目一次性奖补2000万元,低于1.15则奖补3000万元。天津要求大型新建数据中心PUE≤1.3,中小型≤1.5;纳入京津冀枢纽节点的项目需≤1.25,2026年底前,所有PUE>1.5的存量项目必须完成改造,目标降至1.4以下,否则限制扩容。
一言以蔽之,智算中心必须液冷,不是因为液冷"更好",而是因为风冷在物理层面已无法支撑当前及未来的AI算力密度。液冷同时解决了散热极限、能耗合规、空间效率、运行稳定等痛点,是智算中心从"能用"走向"好用且可持续"的唯一路径。
液冷的三条技术路线
当前液冷市场呈现冷板式、浸没式、喷淋式三条技术路线并行发展的格局。