
1. 为什么AALC突然成了数据中心圈的热词这两年只要搞AI基础设施的同行应该都有一个共同的体感机柜功耗涨得太猛了。单张GPU卡的TDP从A100的400W一路飙到H100的700W到了B200甚至突破1000W一个GB200 NVL72机柜的整柜功耗直接干到120kW以上。传统风冷数据中心的单机柜极限大概在15到20kW机柜里塞满了高密度AI服务器之后风冷方案连“把热量移出机房”这个最基本的任务都完不成。在这种背景下Meta在开放计算项目OCP上推的风助液冷方案AALCAir-Assisted Liquid Cooling空气辅助液体冷却引起了特别多关注。它的核心思路是把芯片热量用液体带走再利用空气把液体里的热量排到大气中。听上去像是一个“中间路线”——既不是传统风冷也不是需要冷却塔和水处理系统的大型水冷而是一种对缺水地区、老机房改造、新建AI集群都非常友好的折中方案。这篇文章我就围绕AALC的原理、部署、选型和运维把我的实际观察和踩坑经验整理出来给正在评估液冷方案的团队一个参考。这篇文章适合谁看如果你正在做AI机房规划、高密度机柜改造或者被PUE指标压得喘不过气又不想上一整套复杂水冷系统那AALC值得你花十分钟认真了解。即便你暂时不上液冷理解AALC的设计逻辑也能帮你更清楚传统风冷在新一代算力面前到底卡在哪里。2. AALC的工作原理与架构拆解2.1 “液体搬运热量空气完成排放”的两级散热结构AALC这个名字拆开来看就很好理解液体负责把芯片热量搬走空气负责给液体降温。整个系统从服务器内部到室外环境可以分为两个循环。第一个循环是“机柜内液冷循环”。在GPU或CPU芯片表面贴一块冷板cold plate冷板内部有微通道结构冷却液流过微通道时把芯片热量带走。液体由机柜旁边的CDUCoolant Distribution Unit冷却液分配单元泵送通过软管和歧管manifold分配到每个服务器的冷板吸收热量后的温水再流回CDU。这个循环是封闭的液体不会和外界接触。第二个循环是“室外空气排热循环”。CDU把温水送到室外安装的干冷器dry cooler也叫干式冷却器。干冷器本质上是一组带翅片的换热管和一台或几台大风扇温水在换热管里流动风扇把环境空气抽过翅片表面热量就这么被空气带走。冷却后的液体再回到CDU送往机房继续吸收芯片热量。你可能会问这和传统风冷有什么区别传统风冷是“空气直接吹芯片空调把热风抽走再通过压缩机做功降温”AALC则是“液体直接接触芯片空气只负责最后一步的换热”。关键在于芯片热量的搬运过程不再依赖空气这个导热率很低的介质换热效率大幅提升功耗密度上限也彻底打开了。2.2 为什么“风助”而不是“水助”——关键在干冷器和补水量AALC在Meta的方案里之所以被划入“液冷”而不是“风冷”核心在于液体承担了90%以上的热量搬运但它的散热末端又完全靠空气所以也算是“风助”。这个“风助”有一个特别大的实际优势不需要补水或者补水量极小。传统大型数据中心用的冷却塔方案属于“蒸发式散热”利用水的蒸发带走热量一兆瓦IT负载一天可能消耗几十吨水。Meta在美国盐湖城等干燥缺水地区部署数据中心时当地根本没有那么多可用水资源冷却塔方案直接出局。干冷器是纯显热换热水在封闭管路里循环理论上不消耗一滴水只是在夏季极端高温天气可能需要辅助喷淋来降温补水量相比冷却塔只是零头。另外“风助液冷”避免了液态冷媒的复杂水处理流程。冷却塔容易滋生军团菌需要持续投加杀菌剂、缓蚀剂还要处理排污和补水的水质稳定问题。AALC的闭式循环把水质管理问题简化成了定期测电导率、补加缓蚀剂的日常维护运维门槛明显更低。2.3 高温水冷——AALC能省电的底层逻辑讲到AALC必须提“高温水冷”这个概念。传统风冷机房的空调出水温度一般7℃到12℃这需要压缩机做功把冷媒压缩到低温。AALC系统推荐的冷板进水温度在40℃到45℃之间回水温度50℃到55℃。你一定觉得奇怪这么高的水温怎么可能给芯片散热其实芯片表面温度通常在70℃到90℃只要冷板里的水温低于芯片结温两者之间就存在温差热量自然就能传导出去。关键在于40多度的水温意味着室外干冷器和环境空气之间的温差也足够大。哪怕夏季环境温度35℃45℃的温水仍然能有效向空气放热。环境温度越低散热效果越好甚至在寒冷地区可以实现全年都不开启压缩机制冷。省电的根源就在这AALC在绝大多数气候条件下都只需要“水泵加水泵”而不需要“压缩机做功”。整套制冷系统的功耗从风冷的空调压缩机能耗降到了CDU泵和干冷器风扇的能耗PUE能做到1.15左右比传统风冷的1.3到1.5好看太多。2.4 一个容易被忽略的部件CDU很多人在看AALC方案时注意力都放在冷板和干冷器上但其实CDU才是整个系统的“心脏”。它承担了四个关键职能。第一是动力职能CDU内置多台循环泵为整个液冷环路提供压头克服冷板微通道、软管、接头、干冷器管路的流动阻力。第二是水质维护职能CDU内部有过滤器、离子交换柱和电导率监测仪保证冷却液的纯净度。第三是压力管理职能系统在运行前需要充注和排气运行中要维持稳定的压力CDU配合自动补水阀和安全阀完成这一点。第四是智能控制职能CDU会实时采集流量、温度、压力数据联动风扇调速和芯片降频策略相当于散热系统的“大脑”。在Meta的OCP设计方案里CDU通常是一个标准化机柜模块支持室内部署或室外预置化安装容量从几十千瓦到兆瓦级不等。如果机柜规模大可以采用“N1”冗余配置也就是多台CDU并联工作其中一台故障时其余设备依然可以承担全部负载。3. 实操部署从评估到落地的关键步骤3.1 第一步先摸清你的热负荷和机房现状不要上来就谈设备选型先回答三个问题单个机柜的峰值功耗是多少整个机房的总负载是多少改造机房的承重、层高和室外空间够不够热负荷摸底建议用实际测量而不是标称值。拿功率计或者PDU的实时读数记录一周的功率曲线找到峰值和谷值。注意那种白天负载低、夜间训练任务跑满的情况在AI机房特别常见CDU的容量设计要以峰值负载为基数再乘上1.2到1.3的安全余量。改造机房的承重也要考虑。冷板本身不重但CDU加满冷却液之后单台重量可能超过一吨必须确认楼板载荷是否满足。层高影响软管走线和吊装室外空间则决定了干冷器能放几台、放在哪个方向才能避开常年主导风向。3.2 第二步冷却液温度与流量计算这个环节是AALC设计里最核心的数学部分直接影响设备容量、管路管径和风扇配置。核心公式就是热力学第一定律的换热公式Q m × c × ΔT其中Q是热量单位kWm是冷却液的质量流量单位kg/sc是冷却液的比热容单位kJ/(kg·K)ΔT是进出口温差单位K或℃。我们用一个实际案例来算一遍。假设机房总IT负载为2MW2000kW选用的冷却液是纯水比热容约4.18 kJ/(kg·K)设计温差为5℃进水45℃、回水50℃。那么总质量流量为m Q / (c × ΔT) 2000 / (4.18 × 5) ≈ 95.7 kg/s换算成体积流量大约是每秒95.7升也就是每小时344立方米。这个流量要用CDU泵组和管路总管径来匹配。如果选择3台CDU2用1备单台CDU的额定流量至少要按每小时170立方米来选才能保证单台故障时系统不降额。冷却液的选择也需要考虑。纯水的比热容高、导热好、成本低但冰点0℃如果你所在的机房冬季可能断电停机管路有冻裂风险就要换成乙二醇或丙二醇与去离子水的混合液。我建议南方机房用纯水加缓蚀剂北方机房直接上30%到40%浓度的丙二醇水溶液稳妥省心。3.3 第三步干冷器选型与环境温度适配干冷器的选型不能只看标称换热量必须结合当地全年的干球温度数据来核算。干冷器的散热能力取决于换热管内外温差环境温度越高同等风量下能带走的热量越少。因此厂家给的额定散热量一般是在35℃环境温度下的数据如果你的机房在武汉、重庆这种夏季40℃以上的地方散热量就要打折到额定的80%左右来选型。我建议的做法是找当地最近十年的气象统计取夏季最热月平均温度和极端最高温度两个数值分别做两套校核正常工况按平均温度选型极端工况按最高温度考虑降频策略。如果极端高温天实在太长这一块后期还需要想办法辅助降温具体我在第5节常见问题里会展开说。干冷器的安装位置也很讲究。放置时注意让风扇排出的热风不要吹向进风面两台干冷器之间保持至少等于风扇直径一倍以上的间距避免热风回流造成散热能力断崖式下跌。有条件的话可以做导风罩把热风统一导向指定方向。3.4 第四步机柜侧安装与系统调试机柜内部的安装环节虽然看起来只是拧螺丝、插接头但藏着最多的实操坑。冷板安装时要保证和芯片表面的接触压力均匀硅脂涂布厚度控制在0.2mm左右太薄填不满微小空隙太厚反而增加热阻。冷板的固定螺丝建议用扭矩扳手按规定扭矩拧紧不要蛮力硬怼。歧管接到了每个服务器的软管接口这个接口通常是无滴漏快接头UQD公母头对接前一定要检查密封圈是否完好。管路安装完成后最关键的一步是压力测试。我见过的标准做法是系统充注冷却液后排净气泡然后升压到工作压力的1.5倍稳压30分钟压降不超过5%算合格。这个步骤绝不能省因为液冷管路一旦漏液轻则服务器宕机重则整柜电气短路。气压测试之后还要做流量分配测试。多柜并联时离CDU远的机柜往往流量偏小所以每个机柜的歧管入口最好安装调节阀测试时逐个调节保证各柜流量偏差控制在10%以内。4. AALC与其他散热方案的对比与选型4.1 四大散热方案横向对比为了帮你快速建立决策框架我把风冷、AALC、冷板液冷加冷却塔、浸没式液冷放在同一张表里对比。方案适用单柜功率典型PUE水资源消耗改造难度初期成本运维复杂度传统风冷≤20kW1.3~1.5无低低低AALC风助液冷20~100kW1.1~1.2极少或零中中中冷板液冷冷却塔50~120kW1.08~1.15高高中高高浸没式液冷100~200kW以上1.03~1.10无(但冷却液昂贵)高高高从表里能明显看出AALC卡在了一个特别舒适的位置它比风冷能扛的功率密度高得多比冷却塔方案省水得多比浸没式方案便宜得多改造难度又控制在普通工程团队能够消化的范围内。这也是Meta大力推广它的原因——不是因为它最强而是因为它最“实用”。4.2 什么场景无脑选AALC我根据自己的观察总结了四个特别适合AALC的场景。第一种是缺水地区的新建AI集群。美国西部、中东、中国西北部这些地方水资源紧张冷却塔方案的取水许可根本办不下来AALC闭式循环不耗水的优势是决定性的。第二种是老旧风冷机房的渐进式改造。老机房不想推倒重来又需要插入越来越多的AI加速卡。AALC可以只在需要高功率密度的部分机柜部署其余普通机柜继续走风冷实现“风液混合”过渡不必一次性把所有基础设施都换掉。第三种是对PUE有硬性要求但预算有限的云厂商。AALC的初期投资低于大规模水冷系统却能把PUE干到1.15以内综合算下来生命周期成本是划算的。第四种是极寒地区的数据中心。AALC在冬季几乎不需要额外耗电环境温度低到零下十度甚至零下二十度时干冷器换热效率极高自由冷却时长接近全年节能效果非常夸张。4.3 什么情况别选AALCAALC也有明显的边界。如果你的单柜功率直奔150kW以上或者机房位于高湿高热且全年无凉爽季节的地方AALC的干冷器在极端工况下会非常吃力。这种情况下老老实实上冷板加冷却塔或者浸没式反而是更稳妥的选择。另外如果你的机房空间极其紧张连室外干冷器的安装位置都找不到那AALC也做不了。干冷器占地面积不小一兆瓦负载大约需要整个设备区面积的三分之一到二分之一这个空间成本要在规划早期就想清楚。5. 常见问题与运维排查实录5.1 问题一支路流量不均导致局部芯片温度偏高现象是CDU总流量正常、回水温度正常但某台服务器的某个GPU核心温度明显高出其他节点。这个案例我遇到过不止一次根因多半是并联管路水利失衡——离CDU最近的机柜流量大最远的机柜流量小远端的冷板换热不足芯片温度自然压不住。排查思路是先看该节点流量计的读数低于设计值就顺时针调节歧管入口的平衡阀。调完不要马上封口等十五分钟看温度曲线是否稳定再微调。如果调节阀拧到底流量依然不够就要检查UQD快接头有没有插到位接头不到位造成的局部节流有时候非常隐蔽。5.2 问题二夏季高温天干冷器散热能力不足这是AALC方案最容易遇到的天灾型故障。环境温度一旦逼近40℃干冷器的换热温差被严重压缩回水温度持续性上升CDU开始高温告警最终触发GPU降频保护算力白白损失。我见过的处理方式分三步。第一步是把干冷器风扇转数提到额定上限并清理翅片上的灰尘和柳絮很多时候散热能力复原20%以上。第二步是检查干冷器是否有热风回流如果有直接做导风改造。第三步是考虑辅助喷淋系统在极端高温时段对翅片喷水雾利用少量蒸发潜热快速降温。这一步虽然违背了“零耗水”的初衷但作为每年只用几天的应急手段实际效果非常好。5.3 问题三冷却液电导率持续升高闭式循环的冷却液本身不消耗但运行半年到一年后电导率还是会缓慢上升主要原因是金属管路内部微量腐蚀产生的离子溶入水中。电导率过高时冷却液可能在某些电位差场景下引发微电流腐蚀对冷板内部微通道造成不可逆损伤。日常运维要定期记录电导率数值发现趋势性上升就检查CDU的离子交换柱是否饱和。离子交换柱是消耗品颜色指示剂变色之后就更换。同时在系统初次充注时就要加足缓蚀剂后期补液时按比例补加这是多数团队容易忽略的点。5.4 问题四UQD快速接头滴漏快接头是液冷系统里最娇气的部件。UQD在插拔时设计有自密封结构但如果密封圈老化、表面划伤或者插拔次数超过设计寿命就会出现接头处轻微渗液。运维上最重要的两条规则一是不要反复插拔同一个接头设计寿命往往只有几十次每插拔一次密封性能都有衰减二是巡检时重点看接头下方有没有水迹发现一点潮痕就立刻更换密封圈不要心存侥幸。液冷系统的漏液绝大多数都是从小渗开始的。5.5 问题五干冷器冬季噪音投诉干冷器的风扇是机房周边的主要噪音源白天环境噪音大不明显到了夜间低速运行时低频嗡嗡声反而特别讨厌。如果机房离居民区近这个投诉几乎必然会出现。处理方法是给干冷器加装隔声罩或者设置夜间降转速策略。夜间气温低换热效率本身就高风扇降到额定转数的60%到70%也能满足散热需求噪音能下降好几个分贝。这种策略不用硬编码在CDU控制系统里加一条时间表就行。6. 部署AALC时值得注意的几个“隐性坑”6.1 快接头不要搞混型号AALC系统的UQD接头标准看起来统一实际上各家品牌的自密封阀结构和接口尺寸并不完全通用。采购时如果混用了不同厂商的产品轻则插不进去重则强行对接导致密封圈损坏后期漏液风险极高。我建议在项目启动时就把所有接头品牌型号统一并且每种接头保留两个备件库存。6.2 冷板安装前必须除尘运维团队在加装冷板时最容易犯的错误是忽略芯片表面的灰尘。AI服务器长期运行在风冷模式下散热器和芯片周围的粉尘堆积非常严重。冷板直接压上去等于把灰尘锁在芯片和冷板之间导热界面被污染热阻直线上升。正确做法是拆卸旧散热器后用无尘布和专用清洁剂清洁芯片表面确认无尘无油污后再涂硅脂、装冷板。6.3 控制系统要设置“回水温差”告警而非只有“进水温度”很多初代部署的CDU只设置进水温度高告警但进水温度正常不代表换热正常。如果某条支路流量下降冷板吸收的热量变少回水温度反而会下降这恰恰是散热不足的信号。更合理的做法是把“进回水温差”作为核心监控指标温差低于设计值一般意味着流量不足或冷板接触不良。6.4 预留好软管弯曲半径软管接进服务器机柜时一定要留够弯曲半径。软管弯折半径太小的位置通流面积缩减长期弯折处还会出现应力疲劳和老化裂纹。常规经验是软管弯曲半径不小于管径的6到8倍并且在走管时用线卡固定避免在维护拉拽时产生位移。6.5 不要把“水冷”当“免维护”AALC系统不需要每天补水但绝对不意味着装完就万事大吉。按季度检查水质电导率、半年更换一次过滤器滤芯、一年检查一次管路接头和冷板接触面这些基础维护动作一样都不能少。很多团队就是栽在“系统很稳就不管”的心态上等出了问题已经是回水温度飙升、芯片过热降频。我在几次AALC项目的实际落地中最深的体会是这个技术方案的工程门槛并不高真正决定成败的反而是设计阶段的前瞻性和运维阶段的细致程度。热负荷评估做扎实一点干冷器选型留足余量快接头统一管理日常巡检盯住那几个关键指标AALC用起来比想象中省心得多。后面如果你们团队也在评估类似方案建议先在几个高密度机柜上做小规模试点跑一个完整夏季再全面推广数据说话比任何PPT都靠谱。