搜索
历史搜索
搜索发现

AI数据中心液冷技术:从风冷到芯片级液冷

| 来源:| | 0

  人工智能和高性能计算正在改变数据中心的计算密度,也在重新定义散热基础设施的设计边界。随着GPU、CPU及其他加速器持续提升计算性能,单台服务器的功耗不断增加,高功率设备在机架中的集中部署进一步推高了局部热负荷。

  过去,数据中心主要依靠空气流动将服务器产生的热量带离设备,再通过机房级制冷系统完成整体散热。这种方式技术成熟、部署体系完善,在传统企业IT、通用计算和中低密度服务器环境中仍具有较高适用性。但对于人工智能训练、推理以及高性能计算等持续高负载场景,单纯依靠空气输送热量正面临越来越明显的效率和密度限制。

  因此,数据中心冷却技术正在从“降低机房环境温度”逐步转向“直接控制芯片热量”。以冷板为代表的芯片级直接液冷(Direct-to-Chip,DTC)通过缩短热量传递路径,将冷却能力直接部署到CPU、GPU等主要热源附近,成为高密度计算基础设施的重要发展方向。

AI数据中心液冷技术:从风冷到芯片级液冷

  高密度计算为什么改变了冷却逻辑

  数据中心的冷却问题,本质上是计算功率向热能转化后的热量如何被持续、稳定地带走。

  传统服务器的功耗相对分散,机架内部的热负荷通常可以通过合理的冷热通道设计、服务器风扇以及CRAC或CRAH系统进行管理。但AI服务器往往集成大量高性能GPU或其他加速器,计算资源更加集中,单位机架产生的热量明显增加。

  这带来了三个直接变化。

  首先,热量更加集中。传统服务器可以依靠大量空气完成散热,而高性能GPU的热量主要集中在有限的芯片区域,热流密度明显提高。

  其次,机架功率持续提升。当更多加速器被部署在同一机架中,服务器产生的总热量同步增加。即使机房整体温度保持在合理范围内,机架内部局部热管理仍可能成为限制因素。

  再次,冷却系统本身的能耗开始受到更多关注。如果需要不断增加风量、提升风扇转速、扩大制冷设备规模来应对IT负载增长,那么冷却系统占数据中心总能耗的比例也可能随之上升。

  因此,高密度AI基础设施的冷却问题已经不只是“如何降低温度”,而是如何在有限的电力、空间和基础设施条件下,将更多计算能力稳定地部署到单位机架和单位面积中。

  风冷仍然重要,但适用边界正在变化

  空气冷却并没有因为液冷的发展而失去价值。相反,在大量数据中心环境中,风冷依然是最成熟、最容易维护的散热方式。

  典型风冷系统的热传递路径为:

  芯片→散热器→服务器内部空气→机架气流→冷热通道→CRAH/CRAC→制冷系统

  这种架构的优势在于标准化程度高,服务器和机房之间具有较成熟的配套体系。对于功率密度较低的设备,风冷仍然能够提供稳定的散热能力。

  但随着机架功率不断提升,空气作为传热介质的物理特性开始成为重要约束。

  空气密度低、单位体积携带热量的能力有限。要带走更多热量,就需要更大的空气流量,而增加空气流量意味着更高的风扇功耗、更复杂的气流组织以及更大的机房制冷能力。

  当高功率设备集中在有限空间内时,冷却系统甚至可能需要同时解决局部热点、机架进风温度、机柜气流短路以及冷却能力分配等问题。

  因此,未来的数据中心并不是简单地从“风冷时代”进入“液冷时代”,而更可能形成风冷与液冷长期共存、根据热负荷进行分层配置的架构。

  芯片级液冷改变了热量传递路径

  直接芯片液冷的核心变化,并不是简单地把空气换成液体,而是重新设计热量从芯片到设施侧的传递路径。

  在典型的DTC液冷架构中,冷却液通过管路进入服务器内部的冷板。冷板与CPU、GPU等高功率芯片形成高效的热传递界面,液体吸收芯片产生的热量后进入回路,再通过机架侧或设施侧的冷却液分配单元(CDU)将热量传递至更大的散热系统。

  其基本路径可以概括为:

  芯片→冷板→冷却液→CDU→设施侧换热系统→室外散热

  与风冷相比,液冷最大的结构性优势是将热量捕获点从机房空气层前移到了芯片附近。

  这意味着大量热量不再需要首先释放到服务器周围的空气中,再由空气带走,而是在热源附近直接进入液体回路。

  对于高热流密度的GPU和CPU而言,这种架构更符合高密度计算的发展方向。

  为什么液体更适合高热密度芯片

  液冷能够支持高密度计算,一个重要原因来自空气和水基冷却液在热物性方面的差异。

  在接近室温的条件下,空气密度约为1.2千克/立方米,比热容约为1.0kJ/kg·K,因此体积热容约为1.2kJ/m³·K。

  水的密度约为1000千克/立方米,比热容约为4.18kJ/kg·K,对应的体积热容约为4.18MJ/m³·K。

  这意味着,在相同温升条件下,单位体积的水能够携带的热量远高于空气。

参数 空气  水
 密度 约1.2kg/m³ 约1000kg/m³
 比热容 约1.0kJ/kg·K 约4.18kJ/kg·K
 体积热容 约1.2kJ/m³·K 约4.18MJ/m³·K
 单位体积携热能力 较低 显著更高

  实际液冷系统并不一定直接使用纯水,而是根据系统设计、温度范围、材料兼容性以及水质管理要求选择相应的水基冷却液或其他工作流体。

  从工程角度看,液冷的价值并不只是“液体比空气更能带热”,更重要的是它能够以较小的流量将热量从高热流密度区域快速转移出去,从而降低对大规模空气流动的依赖。

  液冷如何降低冷却系统压力

  液冷首先减少的是服务器内部和机架周围对大量空气流动的依赖。

  在高密度风冷系统中,服务器风扇需要推动大量空气经过散热器。随着芯片功耗增加,风扇功耗和气流需求也会增加。

  DTC液冷则将主要热量直接交给冷却液处理。对于采用混合散热架构的服务器而言,GPU和CPU等高功率器件使用冷板液冷,内存、硬盘、电源模块以及其他低热负荷部件仍可以采用空气冷却。

  这种方式并不是完全取消空气,而是将不同热密度的组件交给更适合的冷却方式处理。

  因此,未来高密度AI服务器更可能采用混合冷却,而不是所有部件都进行液冷。

  更高的机架密度成为液冷的重要价值

  对于AI和高性能计算而言,液冷的意义最终会落到“单位空间能够部署多少计算能力”。

  如果继续通过增加空气流量解决机架功率增长问题,可能需要扩大冷却设备容量、优化冷热通道、增加风量甚至改造机房基础设施。

  而液冷能够将大量热负荷从空气系统中分离出来,使机房空气系统主要承担剩余设备以及环境热负荷。

  这为高功率机架提供了更大的部署空间。

  换言之,液冷并不是简单提高“散热效率”,更重要的是改变了数据中心的功率密度上限和空间利用方式。

  对于需要部署大量GPU加速器的AI集群而言,机架数量、机房面积和电力容量之间存在紧密关系。若散热能力无法同步提升,即使供电和计算资源已经准备就绪,也很难进一步提高部署密度。

  因此,冷却能力逐渐成为与供电、网络同等重要的基础设施规划指标。

  液冷还能降低部分冷却能耗

  液冷系统并不意味着冷却能耗自动下降,其实际效果取决于系统架构、冷却液温度、泵功率、CDU效率以及设施侧散热方式。

  但从系统结构看,DTC液冷可以减少服务器风扇和大规模空气输送所需的能耗。

  与此同时,如果设施采用较高温度的液体回路,并结合自然冷却或干式冷却器等方案,还可以减少部分机械制冷需求。

  在合适的气候和设施条件下,这种设计还有机会降低蒸发冷却带来的水资源消耗。

  需要注意的是,“液冷节能”不能简单理解为所有液冷数据中心都一定比风冷系统节能。液冷系统新增了泵、CDU、管路、换热器等设备,这些设备同样需要消耗能源。因此,评价液冷效果应关注整个冷却链路,而不是单独比较冷板或服务器风扇。

  从单机架升级到完整液冷基础设施

  高密度液冷的部署也意味着数据中心基础设施需要同步变化。

  传统风冷系统主要关注冷热通道、送风量、回风温度以及CRAC/CRAH容量。而液冷系统需要进一步考虑:

  冷却液温度和流量;

  CDU容量及冗余设计;

  机架歧管和快速接头;

  管路布局与维护空间;

  冷却液品质与过滤;

  泄漏检测;

  冷板与芯片之间的热界面;

  设施侧换热能力;

  泵送功耗;

  IT设备与液冷基础设施之间的接口标准。

  这意味着液冷不再只是服务器厂商需要解决的问题,而是涉及IT设备、机架、配电、管路、CDU、制冷设备以及数据中心建筑基础设施的系统工程。

  液冷部署需要关注可靠性与维护

  液冷能够提高高密度计算环境的散热能力,但也增加了系统复杂度。

  首先是液体管理。冷却液需要保持合适的化学性质和洁净度,避免腐蚀、沉积以及材料兼容性问题。

  其次是管路可靠性。连接件、软管、歧管和快速接头都需要具备长期稳定运行能力,并尽可能降低泄漏风险。

  再次是维护方式发生变化。风冷服务器的维护主要围绕风扇、散热器和空气过滤等部件展开,而液冷服务器还需要考虑冷板、管路、CDU和冷却液回路。

  因此,液冷数据中心的运维体系也需要同步升级,包括液体监控、压力监控、流量监控、温度监控以及泄漏检测等。

  风冷与液冷将长期共存

  从数据中心实际建设情况来看,未来并不会形成一种技术完全替代另一种技术的局面。

  对于普通企业服务器、网络设备、存储设备以及较低功率密度的IT设备,风冷依然具有较高的经济性和成熟度。

  对于高功率GPU服务器、高性能计算节点以及持续运行的大规模AI集群,液冷的优势则更加明显。

  因此,更合理的方向是根据不同设备的热负荷建立分层冷却体系:

AI数据中心液冷技术:从风冷到芯片级液冷

  这种混合模式可以避免为了少量高功率设备而对整个数据中心进行完全液冷改造,同时也能够为未来高密度计算设备预留升级空间。

  冷却架构将成为AI数据中心设计的核心指标

  过去的数据中心设计通常围绕机架空间、电力、网络和存储容量展开,而AI基础设施的发展正在把冷却能力提升到同等重要的位置。

  未来的数据中心建设,需要在服务器采购之前就确定机架功率密度、冷却方式、供电能力和网络架构之间的关系。

  对于新建AI数据中心,可以从规划阶段直接设计液冷管路、CDU空间、机架接口和设施侧换热能力。

  对于已经运行的传统数据中心,则更适合采用渐进式方式,根据高功率机架的部署位置和实际热负荷进行局部液冷改造,而不是一次性改变整个机房的冷却体系。

  这种方式能够降低改造复杂度,也更符合现有数据中心逐步增加AI计算能力的发展路径。

  总结:冷却正在从辅助系统变成计算基础设施

  人工智能和高性能计算的发展,本质上正在推动数据中心从“高计算密度”向“高计算、高功率、高热密度”同时演进。

  在这一过程中,冷却系统已经不再只是维持机房环境温度的辅助设施,而逐渐成为决定计算密度、机架设计、能源效率和扩展能力的重要基础设施。

  风冷仍然适用于大量传统计算场景,但当GPU和CPU等核心芯片的热流密度持续提高后,单纯扩大空气流量的方式将面临越来越明显的空间和能耗约束。

  芯片级直接液冷通过缩短热量传递路径,将冷却能力直接部署到主要热源附近,为高密度AI和高性能计算提供了新的散热路径。未来的数据中心更可能形成风冷、芯片级液冷以及其他液冷技术并存的多层次架构。

  真正决定冷却技术选择的,不是某一种技术是否能够完全取代另一种技术,而是计算密度、机架功率、空间、电力、气候条件和设施架构之间能否实现整体匹配。随着AI基础设施继续向更高密度发展,冷却能力将与算力、供电和网络一起,成为数据中心扩展能力的重要基础。


样品申请
×
联系客服
×
吉祥物