
超节点 GPU 数量为什么是 8、72、128、144、576——数字背后的工程逻辑、行业主流超节点盘点、国内拼多卡vs 国外单卡高性能路线之争本文作为笔者个人备忘的文章不喜勿喷。以及 AI 生成。不构成投资建议。本文基于 NVIDIA 官方博客GB200 NVL72 与 Dynamo、中兴通讯超节点白皮书、东吴/华泰/国泰君安等券商研报、环球网/艾媒/新浪华为 Atlas 950 真机、NVL144/NVL576 对标、《财经》客户端昇腾 960/4096 卡、证券之星国产超节点量产元年、CSDN/博客园GB200 NVL72 架构等公开资料系统性回答为什么超节点 GPU 数量常是 8、72、128、144、576尤其 72 的倍数、盘点行业主流超节点并深度对比国内拼多卡路线 vs 国外单卡高性能路线。一、这些数字的来历从 8 到 72 到 576 的工程进化1.18第一代 Scale-up 域的上限阶段GPU 数量来源HGX H100/H200第 1/2/3/4 代 NVLink8 卡单个 NVLink 域最多连接8 个 GPU900GB/s即 DGX/HGX 8 卡标准PCIe 时代4-8 卡PCIe 总线带宽有限为什么是 8 - 早期 NVLink 通过NVSwitch实现全互联受交换芯片端口数、板卡供电、机箱散热限制 - 8 卡是成本 × 带宽 × 密度的工程平衡点8×80GB640GB 显存、可装下 70B 模型 - 是后来所有超节点数量的基本单元1.272NVL72 的里程碑——为什么不是 64/80/96NVIDIA 在 GB200 时代将单个 Scale-upNVLink 域从 8 卡跃升至72 卡。维度NVL72 关键结构基本单元GB200 Superchip 1 个 Grace CPU 2 个 Blackwell GPUNVLink-C2C 900GB/s机柜组成36 个 Superchip × 2 GPU 72 GPU或 18 计算托盘 × 4 GPU互联第 5 代 NVSwitch单卡 NVLink 1.8 TB/sGPU 间总带宽130 TB/s统一内存72 GPU 共享统一内存空间72×80GB ≈ 5.76TB设计目标专为 MoE 模型EP64 专家并行与 Llama 70B 等稠密模型服务72 的数学/工程根源 -72 2³ × 3²因数丰富易做拓扑切分可分 2/3/4/6/8/9/12/18/24/36/72 -由超芯片结构决定36 个 Grace-Blackwell每芯片 2 GPU→ 36×2 72是超级芯片 ×2的自然结果 -受单机柜物理限制供电~120kW、液冷散热、NVSwitch 端口数决定一柜只能容纳约 72 GPU - 72 正好承载MoE EP64专家并行 64所需的 GPU 规模与模型并行需求强耦合1.3144、57672 的倍数Scale-up 域级联数字组成含义NVL3618 超芯片 × 2半柜/入门超节点NVL7236 超芯片 × 2标准单柜超节点NVL1442 × 72双柜级超节点英伟达新一代对标基准NVL5768 × 72 5768 个机柜 × 72 GPU 纳入同一高速互联系统英伟达2027 年 Rubin Ultra计划NVLink 光互联关键规律576 8 × 72、144 2 × 72——超节点数字都是以 72 为基数、按柜数或域数级联因为 Scale-up 域以 72 GPUNVL72为一个原子单元多域堆叠成更大超节点。中兴白皮书确认英伟达通过 NVLink 光互联扩展至576 卡集群超节点。1.4 其他主流数字128/384/512/640/1024/4096数字厂商/产品说明128阿里磐久AL128云侧资源池化、单级交换重构超节点384华为Atlas 900 A3早期国产超节点512阿里 UPN512单层光互联 512 xPU Scale-up 网络640 / 1280中科曙光scaleX640单机柜 640 卡、双柜 1280 卡算力 600 PFLOPs1024华为 950 系列上一代超节点集群4096华为昇腾 960新一代超节点集群规模 4096 卡8192 / 15488华为 Atlas 950/960单系统最多互联卡片数国内数字128/384/512/640源于各厂商自研超节点原子单元规模华为走超大超节点千卡级 Scale-up 域英伟达走72 卡原子单元逐柜级联。二、行业主流超节点全景盘点2025-2026阵营厂商超节点GPU 数关键特性海外英伟达GB200/GB300NVL7272NVLink 5、1.8TB/s、MoE 优化英伟达NVL576规划 2027576Rubin Ultra、8 柜光互联AMDHelios72MI455X UALoE、对标 NVL72国内华为Atlas 900 A3384自研 HCCS/灵衢 UB华为Atlas 950/9601024→4096/8192业界最大规模商用超节点中科曙光scaleX640640/1280高密架构浸没液冷、开放阿里磐久AL128/UPN512128/512云资源池化、单级交换字节跳动EthLink—以太网 Scale-up 协议腾讯ETH-X—以太网 Scale-up浪潮元脑SD200—高密定制趋势东吴/华泰 - 中国移动 2026-2027 超节点集采20 亿- 华泰测算2028 年国产超节点市场空间 3414 亿元2026-2028 CAGR 194%- Scale-up 协议NVLink 封闭 vs 以太网UALink/SUE/EthLink/OISA开放双轨三、国内拼多卡路线 vs 国外单卡高性能路线3.1 两条路线的本质维度国外英伟达路线国内华为等路线单卡策略单卡性能极致B300 288GB/超高带宽/NVLink 1.8TB/s单卡性能落后制程/架构代差约 2 年超节点策略NVL72 单柜72 GPU 紧密耦合超大超节点多卡互联4096/8192 卡核心思想用顶级单卡 高度成熟互联做少而强用多卡 Scale-up 集群补齐单卡差距软件栈CUDA成熟护城河CANN/MindSpore、TileLang等效算力1 张 GB300约 4 张华为卡硬件代差代表GB200/GB300 NVL72/NVL576Atlas 900/950/9603.2 华为拼多卡的底层逻辑梁文锋论断核心论断集群方案可以补齐单卡差距所有 GB300 能做的任务华为超节点都能做延迟都一样做法把原本分散在多台服务器的 AI 芯片组成数百甚至数千卡的系统提高芯片间互联效率、降低性能损耗实证华为 4096 卡超节点若以 4096 卡为基本单元组 10 万卡集群相比约 1.25 万台传统 8 卡服务器集群MFU模型算力利用率差距达约 2.75 倍为什么被逼走这条路线受出口管制2025 下半年后无合规途径的先进英伟达芯片进中国华为只能靠多卡互联 × 超大 Scale-up 域弥补单卡代差已跑通DeepSeek V4 已实现纯昇腾训练国产 AI 芯片 2025 年出货 41%160 万张华为 81.2 万张领跑3.3 两条路线各自的优劣对比项英伟达单卡强华为拼多卡单卡性能✅ 顶级代差-2 年❌ 落后约 2 年互联带宽✅ NVLink 5 1.8TB/s⚠️ 自研 HCCS实测待验证软件生态✅ CUDA 最成熟❌ CANN/MindSpore 成熟度差距明显规模上限NVL72576 单系统规划中✅ 4096/8192 卡超大 Scale-up可用性/合规❌ 受限不可购/供应不足✅ 国产自主可控、供应充足成本/溢价—⚠️ 华为卡溢价 50%-200%单位集群 MFU高✅ 4096 卡组集群 MFU 高 2.75 倍结论 - 英伟达赢在单卡 生态华为赢在规模 自主可控 集群 MFU- 拼多卡不是劣势妥协而是在单卡受限下的系统性工程选择——用超大 Scale-up 域弥补单体差距本质是把硬件差距转化为拓扑/调度优势四、为什么有这些 / 如何想到的 / 核心解决什么问题4.1 怎么想到的逻辑链① 从 8 到 72突破 NVLink 域的带宽天花板- 问题8 卡 Scale-up 域训练千亿参数模型需跨域通信走 InfiniBand比 NVLink 慢 36 倍→ 通信瓶颈 - 解法NVSwitch 5 把 NVLink 域扩到 72 卡让更多模型参数住在同一个高速域内 → 减少跨域流量② 为什么是 72与 MoE 模型并行深度耦合- 问题MoE 专家并行EP64需要大量 GPU 同域互联EP 内通信延迟敏感 - 解法72 卡形成高带宽 NVLink 域正好匹配 EP64 的专家规模 → 推理/训练吞吐显著提升③ 576 8×72Scale-up 域级联- 问题单机柜装不下再多 GPU供电/散热物理极限 - 解法72 卡为原子单元用 NVLink 光互联把 8 个柜级联成 576 卡统一域 → 单柜算力走向集群级基础设施④ 国内拼多卡出口管制下的以多补单- 问题先进单卡不可获得/受限 → 单卡性能无法与英伟达比 - 解法不拼单卡拼Scale-up 域规模用 4096/8192 卡超大超节点 高 MFU 调度补足 → 我卡少不强但我节点大、调度好4.2 核心解决什么问题问题解法跨 NVLink 域通信带宽瓶颈NVL72 扩 Scale-up 域至 72 卡MoE 专家并行通信延迟72 卡同域 EP64 匹配单机柜物理装不下更多 GPU72 卡原子单元 → 5768 柜光级联单卡性能不足国产超大超节点4096/8192多卡互联补齐模型利用率低下4096 卡超节点组集群 → MFU 提升 2.75 倍4.3 命名数字的战略意义72/576英伟达原子单元级联哲学的具象化72→144→576384/512/640/1024/4096各厂商差异化的超节点原子单元规模形成产品矩阵这些数字不是随手定的而是硬件物理极限 × 模型并行需求 × 机柜工程三者博弈后的最优解五、参考来源NVIDIA 官方博客GB200 NVL72 与 Dynamo 提升 MoE 推理性能NVLink 域从 8 卡扩至 72 卡、1.8TB/s、EP64、比 400G 以太快 36×博客园/DevPressGB200 NVL72 架构深度解析Grace-Blackwell 超级芯片、36×272、NVSwitch 5、统一内存 5.76TB中兴通讯超节点白皮书NVLink 光互联扩展至 576 卡集群超节点、NVL72 内 130TB/s、NVL36/NVL72艾媒网/环球网华为 Atlas 950 超节点真机单柜 64 卡起步、最多 8192 卡、对比 NVL144 卡规模 56.8×/互联带宽 62×/内存 15×对比 NVL576 领先《财经》客户端华为昇腾 960 集群 4096 卡、950 系列 1024 卡、MFU 2.75×、昇腾 910C/950DT/950PR 主流出货新浪/东吴证券国产超节点产品全景华为灵衢/中科曙光 scaleX640 640/1280/阿里磐久 128/浪潮元脑 SD200、趋势从单柜走向集群级技术栈华为昇腾 950 vs 英伟达 GB300 对比4 华为卡:1 GB300、单卡代差约 2 年、CANN vs CUDA、梁文锋集群补齐单卡差距ZAKER/21 世纪经济报道梁文锋5 万张 GB300 或 20 万张国产卡四张华为卡顶一张英伟达DeepSeek V4 纯昇腾训练/国产卡出货 41%证券之星/东吴国产超节点量产元年中国移动 20 亿 集采、UALink/SUE/以太网 vs NVLink未来智库/华泰2028 国产超节点市场 3414 亿元、CAGR 194%、超节点推动整柜系统交付本文作为笔者个人备忘的文章不喜勿喷。以及 AI 生成。