
这两年AI大模型直接把数据中心单机柜功率密度推到了一个新量级。GPU单卡功耗从250W一路涨到700W甚至更高一台八卡训练服务器说吃40kW就吃40kW整柜功率奔着100kW去的时候传统风冷系统基本就到了瓶颈。倒不是风冷团队不努力而是空气的物理性质摆在那里想靠加大风量、降低送风温度来压住芯片热量风机的电费和对流热阻都会先把你劝退。Meta在公开技术分享里反复提到的AALCAir-Assisted Liquid Cooling风助液冷正是冲着这个矛盾去的。AALC的思路其实很务实在机柜里保留原本的风冷通道让空气继续负责那些低功耗器件和环境热负荷再把最热的CPU、GPU、加速卡用冷板接入液冷环路把大头热量直接交给水带走。它不需要把机房推倒重建也不用像浸没式液冷那样把整台服务器泡进冷却液里所以对存量数据中心的改造友好得多。这篇内容我会从AALC的架构原理、关键设计参数、改造流程到实际项目里踩过的坑和排查方法都过一遍适合正在评估液冷方案的运维负责人、基础设施工程师以及想理解数据中心散热技术演进的同行。1. 为什么数据中心需要风助液冷技术1.1 空气冷却的物理天花板在哪里风冷散热的过程可以简化成这样芯片把热量传导到散热器翅片风机驱动空气流过翅片空气升温并把热量带走。一个标准2U服务器内部能用的翅片面积、风扇数量、风道空间都是固定的。以一颗功耗400W的CPU为例散热器热阻要做到0.15°C/W甚至更低才能把结温压在正常工作范围以内。空气的定压比热容只有1.005kJ/(kg·K)密度约1.2kg/m³也就是说每立方米空气升高1°C只能带走大约1.2kJ的热量。对比一下水的密度接近1000kg/m³比热容4.18kJ/(kg·K)相同体积升高1°C能带走约4180kJ差了三千多倍。再算一笔机柜层面的账。假设一个机柜要散掉60kW的热量靠纯风冷就算送回风温差做到15°C需要的风量大约是60kW ÷1.005kJ/(kg·K) × 15K≈ 3.98kg/s换算成体积风量接近12000m³/h。一个常规机房精密空调的额定风量也就两三万m³/h也就是说一个高密度柜要吃掉半台空调的风量。真到了这种工况柜内风速、风机噪声、风机功耗都会爆炸式上升。更麻烦的是局部热点的换热系数上不去芯片表面到空气的热阻降不下来单纯堆风量解决不了核心问题。所以在实际运维里风冷机柜做到15-20kW已经算不错做到25kW以上就需要非常精细的气流组织再往上就是硬刚物理极限。1.2 全液冷虽然香也不至于把楼拆了全液冷浸没式看起来最彻底把服务器整个泡在绝缘冷却液里热量直接通过液体对流甚至沸腾相变带走单柜功率密度做到100kW以上也不稀奇。但落地的时候问题一个接一个服务器要专门定制标准商用服务器插拔显卡、换内存都要把整台机器从冷却液里吊出来运维流程完全变样原厂质保经常会因为介质兼容性问题打折扣冷却液本身不便宜泄漏回收也是麻烦事。对一个已经稳定运行多年的存量机房来说这种改动几乎等同于重建。所以在“风冷够不着”和“全液冷太重”之间出现了两条主流路线一条是冷板式直接液冷一条就是AALC这类风液混合方案。冷板式液冷的思路是把冷板贴在芯片上让冷却液直接吸走芯片热量但机柜里其他高功耗器件比如电源、网卡、内存还是得靠风冷处理。AALC的特别之处在于它一开始就把“风冷液冷并存”当成设计目标要求两种冷却方式共享一个机柜空间并且能方便地嵌入现有风冷机房。对存量机房来说这意味着不用重建空调系统不用大规模改造机柜承重和配电就能在一排风冷机柜中先改造出几排液冷柜。1.3 Meta为什么选择AALC这个演进路线Meta拥有大量超大规模数据中心而且大部分是传统风冷架构。AI算力需求上来以后全量推倒重来在时间和预算上都不可接受。从公开信息看Meta把AALC作为从风冷到液冷的过渡方案看重的是三件事第一利用现有风冷系统和机房空间按需增量部署第二液冷部分采用较高温度的水最大化利用外部自然冷源降低耗水和耗电第三风冷继续兜底即使液冷环路某一段故障机柜内的空气通道仍然能维持一段运行时间不会瞬间宕机。这第三点尤其重要。很多人在评估液冷时只盯着散热能力忽略了系统的降级能力。AALC保留了完整的风冷路径等于给了运维人员一个缓冲期液冷故障后可以靠风扇把负载撑着按计划降载、迁移任务而不是被一个漏水报警逼着紧急停机。实际运维中这种冗余思维比纸面上的散热指标更救命。2. AALC到底是什么风液协同的架构拆解2.1 三条技术路线怎么选把传统风冷、风助液冷、浸没式液冷放在一起对比能更清楚地看到AALC的位置维度传统风冷风助液冷AALC浸没式液冷单机柜散热能力15-30kW40-100kW100kW对现有机房改造量无小可增量部署大基本等于重建冷却介质空气空气水/冷却液绝缘冷却液运维复杂度低中等高服务器兼容性通用通用服务器冷板组件需专门定制或改造故障降级能力天然在线风冷兜底降级运行单点依赖液体循环浸没式的极限散热能力最强但工程代价也最大。纯风冷运维最简单但功率密度天花板太低。AALC夹在中间兼顾了两头把高密度芯片的热量交给液体把低密度热量继续留给空气在现有基础设施上就能实现40-100kW的机柜功率。对绝大多数已经投运的数据中心来说这是近期最现实的AI算力散热路径。2.2 AALC系统的完整散热链路AALC的热量传递路径可以拆成五段芯片到冷板冷板内部有微通道冷却液在通道里高速流过直接带走芯片表面热量。冷板与芯片之间有一层导热硅脂或相变材料确保接触面没有空气间隙。冷板到机柜分集水器每台服务器用软管或硬管连接到机柜内的分水器和集水器形成并联支路。分集水器的作用是把总管水流均匀分配到每台服务器再把升温后的水汇拢。机柜到CDUCDUCoolant Distribution Unit冷却液分配单元内部有板式换热器、循环泵、过滤器、膨胀罐和电动调节阀。它把机柜内的二回路和机房外的建筑级一回路隔开既能精确控制机柜侧水温和流量又能防止建筑水系统的杂质、压力波动直接影响服务器冷板。CDU到冷源一回路回到冷站通过冷却塔、干冷器或冷机把热量排到大气。气候条件允许时可以直接用外部空气冷却回水冷机不启动这就是free cooling。风冷旁路同一时间机柜内的风扇和机房空调仍然在运行负责处理电源模块、内存、网卡、硬盘等非液冷部件的热量维持机房环境温度。空气路径和水路路径是并行工作的。在高密度AI机柜里通常60%-80%的热量由液冷环路带走剩下20%-40%由风冷系统消化具体比例取决于芯片功耗分布和风冷设计。2.3 “风助”背后的设计哲学从字面理解AALC把液冷当主力风冷当辅助。这个命名很说明问题凡是能在机柜里用空气解决的低密度热量用风冷处理成本最低只有那些空气搞不定的高功耗芯片才值得动用液冷。它把两种介质的优势按热流密度切分而不是一刀切全上液冷。实际项目里我也经常被问“既然液冷这么强为什么不全液冷”我的回答是液冷系统的成本不只在冷板而在整个水环路。管道、泵、换热器、水质管理、泄漏检测每一个环节都需要持续投入。风冷的边际成本很低环境温度控制住就行。AALC的核心价值是在不牺牲可靠性的前提下把液冷的覆盖面精确控制在“必要”的范围内这也正是它能在存量机房落地的根本原因。3. 关键技术细节与设计参数3.1 高温水设计AALC效率的关键AALC想要高效水温必须“高温”。传统机房冷冻水一般是7-12°C空调送风还要经过除湿、再热能耗很高。而冷板液冷的供水温度可以做到32-40°C回水温度可以到45-50°C。这个温度级别带来三个直接好处无凝露风险只要供水温度高于机房露点温度冷板表面就不会凝结水珠。正常机房露点通常在15-20°C以下32°C的冷板表面完全不存在结露问题不需要保温棉也不用担心水滴滴到主板上。free cooling窗口大幅拉长外部气温低于回水温度时就可以直接通过干冷器或冷却塔把热量排掉冷机压缩机全年大部分时间可以停机。以35°C供水为例在很多气候区free cooling时长能覆盖全年一半以上在寒冷地区甚至能覆盖90%。冷机效率提升即使冷机运行时段因为蒸发和冷凝之间的压差小冷机COP也会比低温冷冻水系统高不少。理解水温也就理解了AALC背后的节能逻辑用提升散热介质温度的方式换取更长的自然冷却时间和更低的制冷能耗。这和传统数据中心“水温越低越保险”的思路刚好相反但前提是芯片厂商允许这么高的冷却液温度。所以做选型时第一件事不是订设备而是确认CPU、GPU原厂对冷却液进口温度的上限要求这个约束决定整个系统的水温设计区间。3.2 流量计算50kW机柜到底需要多少水液体侧的热平衡公式很简单Q m × cp × ΔTQ是热负荷kWm是质量流量kg/scp是水的比热容4.18kJ/(kg·K)ΔT是供回水温差K。以单柜50kW、设计供回水温差10K为例m 50 /4.18 × 10≈ 1.2kg/s质量流量换算成体积流量水的密度按1000kg/m³计大约是4.32m³/h。也就是说一个50kW柜子每小时需要大约4.3吨水在冷板里循环。一排10个柜就是43m³/h一个5MW的数据中心模块100个柜就是430m³/h左右。430m³/h什么概念管道流速按2m/s估算主管道直径要做到DN300左右。这就是为什么AALC改造时一定要提前规划主管道走向和机房空间的原因——冷量密度拉上来之后水系统本身就会占据可观的物理空间。不同功率和温差下的典型流量需求如下表机柜功率ΔT8KΔT10KΔT12K30kW3.2m³/h2.6m³/h2.2m³/h50kW5.4m³/h4.3m³/h3.6m³/h80kW8.6m³/h6.9m³/h5.7m³/h把温差从8K放宽到12K流量可以降低33%但回水温度升高对换热器和芯片温度裕量都有影响。实际项目里这个ΔT不是拍脑袋定的需要结合CDU换热能力、水泵功耗和芯片温度裕量综合权衡。作为对比同样50kW的柜子如果纯靠风冷送回风温差按15K算需要将近10000m³/h的风量。水侧和风侧的流量需求完全不在一个量级这也是液冷能支撑高密度机柜的根本原因。3.3 配电与冗余设计液冷解决的是散热不是供电AALC解决的是散热问题不是供电问题。一个机柜从20kW升到60kW即使冷却跟得上配电同样要跟上母线槽容量、UPS和市电切换、列头柜开关、柜内PDU每一级都要重新核算。这一点在存量机房改造里往往比冷却改造更棘手经常是冷却方案都做完了一查电力容量不够项目又得回去改配电。冗余设计方面建议至少按照以下思路做CDU冗余一个CDU带多个机柜时建议N1配置。CDU内循环泵一用一备电动阀要有手动旁路。管路隔离每个机柜或每排机柜要有独立的手动隔离阀方便维护时单独排水不至于影响整排机柜。泄漏检测分区机柜底部放接水盘接水盘内布置点式或线式漏水传感器传感器接入动环监控报警后自动联动切断该区域供水电磁阀。风冷兜底保留机房精密空调和柜内风扇的控制逻辑液冷故障时能以强制风冷模式维持低负载运行。配电和冗余这两块建议在设计阶段就拉上电气工程师一起评审别等设备进场了再发现母线槽容量不够。4. 存量机房部署AALC的实操过程4.1 第一步现场热环境与基础设施审计我带队做这类改造时第一周基本不碰设备全部泡在机房里量数据。现场审计至少要覆盖五个方面功率统计现有每柜电流、三相平衡情况估算目标机柜的功率需求。AI训练柜往往需要双路大电流要确认PDU和母线槽能否支撑。风量用红外热像仪和压差计测冷通道、回风口温度找出局部热点。这一步能判断现有风冷系统还有多少余量决定风侧要不要加强气流组织。空间确认机柜周围有没有足够空间放CDU、走水管道地板承重是否满足要求。水和电同时增加的重量不能忽略。水确认现有冷站容量、预留接口位置、供水压力判断一回路能否直接接入还是要新增干冷器或冷机。动环确认监控点位和告警通道液冷系统要接入现有动环不能另起一套无人值守的独立系统。现场审计的产出是一份改造可行性报告核心结论是哪些机柜适合先改哪些位置适合放CDU一回路从哪里接配电要不要扩容。这一步做得越细后面施工越顺。4.2 设备选型与系统设计要点审计完就可以开始选型了。几个关键决策点CDU形态行级CDU和机柜级CDU各有适用场景。行级便于集中管理、可靠性高适合整排改造机柜级更灵活适合先做试点。试点阶段我建议用机柜级CDU出了问题影响面小。冷板兼容性冷板要根据CPU、GPU封装尺寸选对应扣具不同代际的芯片扣具位置不一样。采购前要和服务器厂商确认冷板兼容列表别等装的时候发现扣不上。管路材料软管一般用EPDM材质硬管可以用PEX或不锈钢。接头建议选无滴漏快插QD这样服务器维护时可以快速断开且不洒水。连接器寿命QD接头是有插拔次数限制的采购时问清楚寿命指标备件要多备几个。水质方案闭式循环水系统要用纯水加缓蚀剂定期化验。不要直接用自来水微通道口径很小自来水里的杂质和微生物会堵。设计阶段还要把排空和冲洗方案想好。液冷系统不是装完就能用管道里残留的焊渣、尘土如果不冲洗干净进到微通道里就是灾难。4.3 施工、冲洗、试压与调试AALC改造的施工流程我习惯分成八个步骤安装CDU并连接一回路先把CDU就位接好建筑侧水系统确认压力和水质满足要求。安装机柜分集水器、软管和冷板分集水器固定在机柜内冷板安装在芯片上安装压力按厂商规格书要求不能凭感觉。系统冲洗用清水循环冲洗整个二回路直到出水目测清澈、没有颗粒物为止。这一步不能省冲洗不彻底后面堵微通道的教训我见过不止一次。气密性试验先用氮气或压缩空气试压试验压力取工作压力的1.5倍稳压至少12小时。气试比水试干净万一漏了也不会水淹机房。充水和排气气密性试验通过后充入纯水启动CDU泵打开排气阀把管道内空气排净。空气排不干净会出现气堵直接表现为流量不稳。流量平衡从最远端机柜开始调节平衡阀使各支路流量达到设计值。近端机柜先别急着开满否则远端流量会被抢走。带载测试跑真实的AI训练或推理负载观察芯片温度、供回水温度和流量是否在设计范围内。这一步要跑够24小时以上看长期稳定性。接入动环监控把温度、压力、流量、漏水报警全部接入动环设置分级告警阈值。试压和冲洗这两个环节是施工中出问题最多的地方。冲洗时间不够导致杂质堵塞微通道、气试没做好就急着水试导致漏水都是实际项目里踩过的坑。宁愿在调试阶段多花两天也不要带着隐患上线。4.4 运维流程与应急预案液冷系统上线后的运维和传统风冷机房很不一样重点在四个方向水质管理每周化验电导率、pH值、颗粒物和微生物指标每月检查缓蚀剂浓度。水质劣化是缓慢过程真到了堵塞微通道再处理成本就高了。泄漏应急演练定期做漏水应急演练让运维人员在真实操作下熟悉隔离阀位置、排水流程和服务器关机顺序。纸面预案和实际动手差别很大。备件管理QD接头、密封圈、软管、传感器这些易损件要有安全库存尤其是QD接头的密封圈老化后微漏很难及时发现。运维培训液冷系统的故障识别和排障思路必须传递到一线值班人员不能只有项目负责人会处理。监控看板上至少要有机柜供回水温度、单柜流量、CDU进出口压差、泵状态和漏水报警这几项。阈值设置要留裕量比如芯片温度告警设在规格上限的80%-90%而不是等到临界值才报警。5. 常见问题与排障实录5.1 机柜流量分配不均这是AALC调试初期最常遇到的问题。症状很典型同一排里有的机柜回水温度偏高有的机柜供回水温差很小CDU总流量正常但分布不均匀。排查顺序一般是看每柜流量计读数找出流量明显偏低的机柜。检查对应支路手动阀开度确认没有半关状态。在分集水器排气阀放气排除气堵。管道里如果积气流量会时大时小。检查CDU进出口压差如果压差低于设计值泵转速或管路可能有问题。用红外枪扫一下各冷板表面温度确认实际散热效果。流量分配的本质是水力平衡问题和暖通系统一模一样。最稳妥的做法是调试时从最远端支路开始逐个平衡近端支路最后调往复两轮基本上能稳定。5.2 快插接头微漏QD接头是AALC里最容易被低估的薄弱点。服务器维护插拔几次之后密封圈老化、端面磨损就会出现“表面看着干燥、用手摸有轻微水迹”的微漏状态。处理办法并不复杂把接头拆开清洁端面更换密封圈重新插拔到位。关键是及时发现。微漏如果不处理长期下来会在接头周围累积水垢甚至顺着服务器底板流到其他部件上。所以在巡检制度里我建议每季度对全量QD接头做一次目视加触感检查别等到漏水报警响起来再处理。5.3 水质劣化与微通道堵塞水质问题通常是慢性的但一旦爆发就是批量故障。最常见的表现是某个机柜的冷板供回水温差逐周变大流量逐步下降芯片温度缓慢升高。排查路径先看CDU过滤器压差确认是否需要更换滤芯。取水样化验看电导率、颗粒物、浊度和微生物指标。如果颗粒物超标对系统进行冲洗微生物超标需要做化学清洗和除菌处理。如果个别冷板已经堵死只能更换。水质管理的原则只有一条闭合环路也不能掉以轻心。冷却液里的缓蚀剂会随时间消耗微生物会找到生存空间只有定期检测和主动维护才能避免问题累积。5.4 芯片温度偏高但流量正常这种情况最容易让运维人员摸不着头脑流量正常、水温正常芯片温度就是偏高。问题往往不在水路而在冷板和芯片的接触界面上。常见原因有几个导热硅脂老化或挤出长时间高温循环后TIM材料性能下降接触热阻变大。冷板安装压力不均螺丝扭矩不一致冷板歪斜局部接触不良。温度传感器偏差芯片内置传感器漂移或者冷板温度传感器贴装位置不对。排查时先看芯片温度和冷板出水温度的差值也就是“趋近温度”。正常设计下这个差值应该在10-20K范围。如果差值明显变大优先怀疑TIM层问题重新涂抹导热硅脂、按扭矩复装冷板往往就能解决。5.5 排障速查表把最典型的故障场景整理成一张表方便值班人员快速定位症状可能原因排查与处理单柜流量偏低平衡阀未调好、气堵、过滤器堵塞放气、检查阀开度、清洗过滤器供回水温差过小流量偏大、换热不足、传感器异常核对流量计和温度传感器芯片温度持续升高TIM劣化、冷板接触不良、水温偏高重涂导热硅脂、复装冷板接头有微漏密封圈老化、端面磨损更换密封圈、清洁端面水质电导率升高缓蚀剂消耗、混入杂质化验水质、补充药剂、必要时换液漏水报警触发软管破损、接头松动、冷板泄露立即隔离该柜、排水、修复后试压这张表背后有一条通用经验液冷系统90%的故障都能追溯到“流量、水质、接触、泄漏”这四类问题上。把每类问题的处理流程固化成标准操作步骤值班人员才能第一时间正确响应。我自己实际做下来最深的体会是AALC的真正门槛不在冷板本身而在系统性的工程管理。水温、水质、流量、泄漏每一个环节都需要完整的监控和流程缺一环后面都会拿稳定性来还。如果你是第一次接触这个技术我的建议是先拿一个机柜做试点把水质管理、泄漏预案、流量平衡这套流程跑顺了再复制扩充。别一上来就追求整层楼改造渐进式部署才是AALC最舒服的打开方式。