ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

浪潮数据AS13000G7拿下MLPerf训练场景双第一:给大模型训练装上“自动存档“

浪潮数据AS13000G7拿下MLPerf训练场景双第一:给大模型训练装上“自动存档“ 训练一个大模型到底有多难想象几千甚至上万张GPU卡要连续跑上几周、甚至几个月才能完成一轮大模型训练。中间任何一次服务器故障、网络中断都可能让前面的努力全部归零——除非系统提前存了档。这个存档动作在 AI 领域叫Checkpoint检查点。它每隔一段时间就把训练进度完整保存下来。一旦出问题不用从头再来从最近一次存档点接着跑就行。听起来很简单难就难在这个存档极其频繁、数据量极大而且训练越大的模型越考验存储的速度。存得太慢几千张 GPU 就得停下来干等——每一秒等待都是真金白银的算力浪费。这就是今天要讲的故事浪潮数据如何解决大模型训练存档慢这道难题。01一张来自国际权威评测的成绩单近日国际权威AI基准评测组织MLCommons公布MLPerf® Storage V3.0测试成绩。在大模型训练最核心的 Checkpoint场景Llama3.1-70B 模型负载中浪潮数据AI存储 AS13000G7拿下多项单节点、单U读写带宽双第一单节点读带宽269 GiB/s单U读带宽134 GiB/s单节点写带宽195 GiB/s单U写带宽97 GiB/s浪潮数据在CheckpointingLlama3.1-70B负载下测试成绩翻译成大白话就是它一秒钟能读入的数据相当于200多部高清电影。而MLPerf® Storage之所以被全球智算中心、大模型企业当作选型标尺正是因为它的考试方式很刁钻——要求连续完成10轮循环读写、每轮都是TB级数据灌入全程不掉速才算合格。靠临时调优刷出来的一次性高分在这里行不通。单节点、单U两个维度同时登顶对客户意味着两件事单节点性能越强集群里需要的存储节点就越少采购和运维成本越低单U性能密度越高越能节省宝贵的机房空间和长期电费——性能和成本两头都占。02高分背后三个看不见的功夫很多人以为跑分高就是堆了几块好硬盘。但这次成绩的看点恰恰在于硬件只是地板软件架构才决定你能摸到多高的天花板。AS13000G7搭载浪潮数据自研的InData AIOS靠的是三招内功。第一招数据不绕路直接上高速传统存储架构里数据写入要先经过一层中转站控制节点再落盘路径绕、效率低——就像快递要先送到分拣中心再发往目的地。玄同架构把指挥和搬运彻底分开指挥系统只管调度数据本身不再经过中转直接写入硬盘。路径短了速度自然就上来了。玄同架构下数据路径示意图第二招一次搬运连签收单一起搞定存储数据时系统还要额外记录一份校验信息用来确保数据没写错。传统做法要分两次操作完成等于搬一次货、签两次单。AS13000G7把这套流程合并成一次数据连同校验信息一次落盘I/O交互次数减少50%写延迟被明显压低。别小看这 50%——在每轮TB级数据、连续10轮的高压测试里省下的每一次往返都实实在在地转化成了带宽优势。原生全闪存数据布局技术优化前后对比第三招给每块硬盘配个智能调度员一个存储节点里有很多块硬盘。传统方案按固定规则分配数据容易旱的旱死、涝的涝死——有的盘累到打满有的盘闲到发慌整体速度被拖垮。InData AIOS里的智能负载均衡像一位实时盯着路况的调度员哪块盘有空闲数据就往哪走让每一块硬盘都跑满性能谁也别闲着。智能负载均衡功能优化前后对比图03跑分之外客户真正得到什么榜单上的数字最终要落回客户的机房里。Checkpoint速度提上来之后客户得到的是一连串实打实的好处训练更稳存档快故障恢复就快长周期训练不再提心吊胆GPU不空等数据供得上昂贵的算力资源每一秒都花在刀刃上成本更优同样的带宽需求用更少的存储节点就能满足。大模型训练是一场马拉松而存储决定的是——你中途停下来喝水存档时需要多久才能重新跑起来。浪潮数据用这套从架构到调度的全栈自研能力让每一次存档都快人一步。浪潮数据将持续深耕AI存储技术让算力不等待、让训练不掉速为千行百业的大模型落地筑牢数据底座。
返回列表