ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

英伟达130亿收购Mellanox:GPU算力背后的网络棋局

英伟达130亿收购Mellanox:GPU算力背后的网络棋局 1. 这笔130亿美元买的到底是什么2019年3月英伟达官宣以69亿美元现金收购Mellanox后来交易完成时实际金额约为70亿美元。而“130亿”这个数字大概率是媒体口径把后续几年围绕网络、DPU、软件生态的持续投入全算了进去。先不纠结数字口径单说Mellanox——这是一家做高性能网络设备的公司核心产品是InfiniBand交换机、网卡以及后来的以太网方案。很多人第一反应是英伟达一个做GPU的为什么要花这么多钱买一个“卖网线”的公司这恰恰是理解黄仁勋焦虑的关键切口。GPU算力再强数据过不去也是白搭。早期AI训练是单机多卡几张GPU插在同一台服务器里通过PCIe总线互联数据交换延迟在微秒级几乎不用考虑网络。但到了大模型时代单台服务器撑死塞8张GPU而训练一个千亿参数模型需要几千甚至上万张GPU一起干活。这时候每张卡不仅要算还要频繁和其他所有卡交换中间结果。如果把每张GPU比作一个快递员模型训练就是所有人协同完成一个超级大单快递员业务能力再强如果电梯和货运通道不够用订单一样会卡死。Mellanox的价值就在这里。InfiniBand网络天生就是为高性能计算设计的它的延迟可以做到微秒级甚至亚微秒级带宽是传统以太网的几十倍还支持RDMA这种“绕过CPU直接读写远端内存”的机制。换成大白话就是数据从一个GPU搬到另一个GPU以前要经过操作系统、网卡驱动、协议栈层层中转现在直接一条专线走完。收购完成之后英伟达把Mellanox的网络能力和自家GPU捆绑搞出了SuperPOD这种整机柜交付方案云厂商和超算中心只需要把柜子通电、通网连上电就是一台万卡级超算。这套东西后来成了GPT系列、Llama系列等大模型训练的事实标准基础设施也成了英伟达数据中心业务狂飙的重要支点。所以黄仁勋买的不是一家公司而是一条从GPU到网络再到集群调度全栈打通的数据通路。这笔账当时看很贵现在回头看某种程度上比买ARM如果真买成的话还要关键。2. 黄仁勋到底在怕什么2.1 怕算力被网络瓶颈卡死多卡训练模型时通信开销是真实的性能黑洞。一张H100的理论算力接近1000 TFLOPSFP16但实际跑大模型训练GPU有相当多时间是在等数据。NCCLNVIDIA Collective Communications Library的实测数据显示万卡规模训练中通信耗时能占到总训练时间的30%到50%。也就是说你买了一万张卡真正算的只有五千张卡的活剩下五千张卡在干等。这不是危言耸听。以GPT-3的训练为例参数规模1750亿采用ZeRO等并行策略后每次梯度同步需要搬移的参数量依旧是GB级别。在万卡集群上每步训练都要做一次全局规约把所有GPU的梯度求和再广播回去这个操作对网络的延迟和带宽极其敏感。网络只要差一点整体吞吐就会断崖式下跌。英伟达自己的数据是用InfiniBand组建的万卡集群网络利用率可以达到70%以上而传统以太网方案能做到40%就算烧高香。这30个百分点的差距意味着同样的电费、同样的机房租金、同样的卡数量训练效率差了近一倍。在大模型军备竞赛的今天谁能把集群效率从60%提到90%谁就能用一半的时间把模型训出来提前抢占市场。2.2 怕GPU变成白菜价的时候没有护城河GPU硬件本身是有寿命周期的。每一代架构的红利只能维持两到三年竞争对手用同样的制程、同样的HBM显存、类似的互联方案很容易在性能上追到七八成。英伟达真正的壁垒如果只是硬件黄仁勋根本不需要焦虑成现在这样。真正让他坐立不安的是一旦硬件同质化云厂商完全可以换别家的卡。这时候就必须靠网络、软件生态、集群调度这些“看不见的东西”来锁死客户。Mellanox贡献的除了InfiniBand的硬件还有它在高性能网络领域积累的大量协议栈、驱动、调试工具以及和Linux内核、HPC生态深度绑定的软件体系。这些代码层面的东西是竞争对手短期很难补齐的。2.3 怕数据中心方案被整体替换很多非技术背景的人不理解为什么云厂商买GPU还要看英伟达的脸色。原因是现在英伟达卖的不再是一张卡而是一整套东西GPU NVLink InfiniBand CUDA NCCL 集群管理软件。你买了一万张H100如果不用它的NVLink做卡间高速互联、不用InfiniBand做跨节点网络、不用NCCL做通信库这堆卡根本发挥不出应有的性能。表面上看你买的是硬件实际上你买的是整个软硬一体化方案。这套方案的学习成本、运维成本、生态工具链全都绑定在英伟达的体系里。想换AMD的Instinct、谷歌的TPU不是换一张卡那么简单而是要连根拔起整个技术栈重写通信逻辑、重配集群调度器、重新调优分布式训练框架。这个切换成本比硬件采购成本高一个数量级。黄仁勋怕的就是这个局面被人打破。而网络层又是这套体系里最容易被切入的一环——毕竟GPU和CUDA可以自研但InfiniBand的可靠性、性能、生态是积累了二十年的东西不是砸钱就能短期追平的。3. 收购Mellanox之后英伟达的棋局是怎么落的3.1 NVLink与InfiniBand的配合NVLink是英伟达自家的GPU间高速互联协议带宽远高于PCIe在单节点内可以实现高带宽低延迟通信。但NVLink有个天然限制——它是板级和机箱级的互联跨服务器就够不着了。收购Mellanox之前跨服务器的GPU通信走的是以太网加RoCERDMA over Converged Ethernet或专用HPC网络方案性能和稳定性都不尽如人意。收购之后英伟达把NVLink和InfiniBand做成了黄金搭档机箱内用NVLink机箱间用InfiniBand。两层互联都掌握在自己手里整条数据通路没有短板。这相当于一个快递公司不仅管快递员的配送效率还把驿站、干线物流、最后一公里的路全修完了。你想用别家快递就得连路一起换现实吗3.2 从GPU公司到数据中心全栈方案商英伟达现在的产品线已经远超GPU本身。从Grace CPUARM架构、BlueField DPU数据处理单元、InfiniBand网络、NVLink交换机到CUDA、NCCL、Triton推理服务器、Megatron-LM训练框架再到NVIDIA AI Enterprise软件订阅服务覆盖了从芯片到框架到部署运维的每一层。这种全栈策略带来的效果是可怕的。客户不需要自己在开源社区里东拼西凑英伟达已经把所有组件帮你调试好遇到问题一个工单就能解决。云厂商的TCO计算里除了硬件采购成本还包括工程团队的研发成本、系统调优成本、故障排查成本这三项加起来往往超过硬件本身。全栈方案正是靠压低这三项成本来留住客户。值得注意的是英伟达并没有把宝全部押在InfiniBand上。2023年之后它也推出了基于Spectrum-X的以太网方案目标直指那些不想被InfiniBand绑死的云厂商和AI企业。这个动作非常有意思既然你们怕绑定我就做一个“兼容标准以太网”的高性能方案用软件层优化把RoCE的短板补上。意图很明确——我没有给你叛逃的理由。3.3 GB200带来的新联动GB200是英伟达新一代芯片单机柜内部的互联带宽进一步拉高同时通过NVLink Switch把更多GPU组成一个逻辑上的巨型GPU。这种“超节点”概念对网络的要求更加苛刻也强化了英伟达在互联层的话语权。说白了英伟达产品的演进路径是单卡性能提升的边际收益越来越小制程到头了功耗墙在那里但通过系统和网络把几千张卡组织起来性能的倍增空间还很大。收购Mellanox就是为这条路径提前铺路。现在回看2019年的决策几乎可以断定黄仁勋在当时就已经看清楚了AI计算的发展方向未来不是比单卡算力而是比整个数据中心算力而数据中心算力的核心瓶颈就是网络。4. CUDA护城河受到挑战的说法靠谱吗热搜词里有个很有意思的话题“英伟达最新发布的CUDA tile更新可能会终结其长期建立的软件护城河”。这话有些夸张但确实点到了敏感处。我想聊一个技术背景CUDA的护城河分为两层。第一层是CUDA编程模型的普及度。全世界几百万开发者的第一门并行编程语就是CUDA几乎所有深度学习框架PyTorch、TensorFlow、JAX的底层都调CUDA。这个生态壁垒极其坚固因为它不是靠技术优势而是靠用户习惯和长期积累。第二层是CUDA的性能实现。英伟达不断更新cuBLAS、cuDNN、CUDA Graphs把底层算子的性能压榨到极限。竞争对手很难在这些基础库上匹敌——不是因为他们写不出算法而是因为他们拿不到英伟达硬件的底层细节只能在黑盒模式下调优。所谓“CUDA tile更新终结护城河”实际指的是英伟达在CUDA里增加了更底层的编程原语让开发者可以更低层次地控制GPU计算流程。表面上看这是“开放了更多底层能力”听起来像是降低了门槛实际上恰恰相反——开发者被教会用这些底层的精细控制手段之后对CUDA的依赖只会更深换平台的成本只会更高。用一个不精确但容易理解的比喻CUDA本来是一套自动挡汽车的驾驶培训体系你现在把驾驶标准升级成赛车级的精细化踩油门、刹车力度控制培训。学员学完之后只会开你这套培训体系的账换牌子就掌握不了那种细腻的操控感。所以我的判断是CUDA tile这种更新不会终结护城河反而是把护城河挖得更深了。这套路和收购Mellanox的逻辑一致——每多一个深度耦合的组件客户的迁移成本就高一分。5. 这笔收购对行业生态的影响5.1 对手的追赶空间被进一步压缩AMD的ROCm这些年一直在努力兼容CUDA生态但效果有限。谷歌TPU走的是封闭自研路线在自家体系内性能很强但无法替代通用GPU的位置。国内厂商的AI芯片在算力指标上可以追近但一上到大集群训练网络和通信库的短板立刻暴露。英伟达通过收购Mellanox等于在对手最薄弱的通信层又加了一道保险。现在很多芯片厂商宣传自己的集群方案几乎都会强调“兼容XX网络的通信库”这个“兼容”本身就说明了生态位上的被动。5.2 云厂商的处境与选择AWS自研了Trainium和Inferentia芯片谷歌有TPU微软投资了OpenAI之后也在搞自研芯片。大家嘴上都说要“摆脱对英伟达的依赖”但实际采购依然以英伟达为主。原因很简单自研芯片的量产规模、软件生态、集群稳定性都还在路上强行切换会让自己的客户体验打折扣。但云厂商也没有坐以待毙。AWS在自家数据中心里大量使用EFAElastic Fabric Adapter本质上是定制版网络方案微软在Azure里整合了InfiniBand和自家的云网络方案。这些动作都指向同一个方向把网络层的话语权从英伟达手里抢回来一部分。从纯竞争角度看这个博弈还在进行中。英伟达虽然在网络层占了先机但网络是个比芯片更讲究生态兼容性的领域InfiniBand在超算领域是王者在通用云数据中心里依然面临大量的成本阻力和运维习惯阻力。5.3 对普通从业者的启示这件事给普通开发者和技术决策者的启示我总结三点第一做技术选型不能只看算力指标还要看整个系统的可扩展性。很多团队买卡的时候只看单卡的TFLOPS忽略了集群规模上去之后网络会成为瓶颈。预算是死的网络方案的差距会导致同样的预算产出完全不同的训练效率。第二软件生态的价值往往被低估。英伟达真正的核心竞争力是把硬件、网络、软件、生态四位一体打包了单看任何一环都有替代品但合在一起就是没有替代品。个人开发者在学习技术栈的时候也要有这种“全链路”思维不要只盯着单一技能点。第三关注基础设施层的机会。大模型时代GPU的上游有光模块、PCB、铜缆、HBM存储这些领域的机会并不比英伟达本身少。英伟达花130亿美元买网络平台这件事本质上就是给整个AI基础设施赛道做了一次清晰的定价——网络的重要性至少和芯片一样高。6. 实操视角我怎么理解英伟达这套网络方案的价值评论区经常有人问InfiniBand到底比以太网好在哪值得花这么多钱我用一个很具体的场景来回答。假设你要做一次8卡DDP训练模型参数70亿。每训练一步8张卡之间要同步1.4GB的梯度数据。在单机内NVLink的带宽是900GB/sH100同步一次只要1.5毫秒左右这个速度几乎感觉不到通信开销。但如果换成8台机器每台机器1张卡跨节点的通信就要走网络。好一点的InfiniBandNDR 400Gb/s理论带宽是50GB/s但因为协议开销和集群时延实际同步一次要20毫秒以上。如果是普通万兆以太网理论带宽只有1.25GB/s一次梯度同步就得1.1秒通信开销直接把训练效率拉垮到不忍直视。这就是为什么大规模训练一定要投资网络。很多人只盯着GPU采购成本忽略了一个简单的事实如果网络拖后腿再贵的GPU也是在烧电和折旧费。从技术实操的角度我自己在跑多机多卡训练时的经验是优先选择InfiniBand做计算网络存储网络单独走以太网两块物理隔离避免存储IO把计算网络打满。如果预算不够至少要用25GbE以上的RoCE网络并配齐PFC优先级流控和ECN显式拥塞通知机制否则RoCE在高负载下很容易丢包一旦丢包性能衰减是以数量级计算的。另外NCCL的调优不是玄学。集群搭建后先用NCCL的all_reduce_bench跑一遍真实的通信带宽数据再根据结果调整网卡中断绑定、NUMA亲和性、协议选择这些参数。实测下来合理的调优往往能让通信性能提升30%以上这不比多花预算买卡省钱英伟达收购Mellanox之后把Mellanox的调优工具和NCCL做了深度集成很多以前要手动配的参数现在可以一键完成这就是这笔收购带来的实际生产力提升。回看这套组合拳黄仁勋怕的不是某个具体的竞争对手而是怕整个数据中心计算的主线从GPU身上移开。只要未来几年的AI训练和推理都离不开高性能集群而高性能集群又离不开GPU加高速网络的组合英伟达的这套布局就会持续吃红利。130亿美元买的不只是一个网络平台而是未来十年算力基础设施建设里的定价权。作为吃瓜的从业者我们要做的就是看清楚这个技术演进的底层逻辑想清楚自己在其中处于哪个位置提前准备技能和资源的卡位。
返回列表