ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek为什么要16000张卡?

DeepSeek为什么要16000张卡? 2026年5月的一场业绩说明会上中芯国际联席CEO赵海军讲了一句话人工智能在海外的「虹吸效应」让消费和IoT客户跑到内地来找产能。订单在往回流。他还说了一句更要紧的客户因为担忧供应不足在提前备货。这话翻成大白话就是现在买卡的人最怕的是以后买不到。那为什么买不到得从产能说起。中芯国际最近一个季度的产能利用率是93.7%这是它自己财报里写的数。更实在的一条在2月赵海军说去年公司新增了大概5万片12英寸产能今年年底比去年年底月产能还要再增4万片。一年多扩产折成12英寸晶圆4万片。对一家公司不算少对一个行业是杯水车薪。中芯自己讲得清楚我们不做GPU等AI主芯片。它做电源管理、数据传输这类配套芯片这些也供不应求。赵海军的原话是「公司受限于自身产能正在积极调配资源优先支持」。真正造AI芯片的那条线全国能规模量产的就一条。它一年能出多少东西高盛8月24日发了份报告算先进制程晶圆的供需缺口。2025年这个数是92%。什么概念一百片的需求国内只能供上八片剩下九十二片得看别人的脸色。这份报告的话说到2035年。那一年缺口收窄到34%中国先进制程月产能41万片国内需求61.9万片。十年时间缺口从92%降到34%。压缺口靠供给端每年46%的复合增速需求端只有17%。头几年得先把良率这道坎补上。高盛假设中芯的先进制程良率从2026年的23%往上爬2030年到50%2035年到75%。对照台积电2018年量产7纳米起良率现在已超过90%。23%是什么意思同样一百片晶圆能凑合用的只有二十来片剩下七十多片全是白扔的。到2026年五家已上市的国产AI芯片公司按券商引用的市场一致预期收入同比要增长120%加起来盘子257亿。钱在往这个方向涌。而去年国产AI加速卡出货165万张全市场400万张国产占了四成。这个四成算全部AI加速卡各种制程一锅端。前面那个23%算7纳米以下的先进制程两笔账不在一个池子。份额听着不低可这里有个错位。国内做AI芯片的设计这一侧从来不缺人也不缺钱设计能力在往上走制造能力卡在那儿。真正稀缺的是把图纸变成硅片的地方。中芯国际今天最抢手的产能握在签了长约的人手里。赵海军在业绩会上讲过产能分给谁的先后次序第一原则是过去跟客户之间的相互承诺。「并不是一个后来者突然出现给了更高的价钱我们就去做。」活儿是中芯先挑的。可对排在后面的人呢去年出货165万张里有一部分设计能力不差就是排期靠后有人的流片从一季度推到二季度再推到等通知投资人问量产时间他答不上来答案不在他手上。所以卡住国产AI芯片的是排期表。产能不够那就买不到买不到就只能用国产的。可用国产的这件事比买不到更难对付。一个写了五六年CUDA的工程师换到另一套芯片上攒下的调优经验全要重来查资料的路径、手里的工具链也一样。芯片跑得快不快早就不是卡点了。性能上来了用的人上不来。卡点在人在会不会用这道坎比造芯片还难。......9月30日DeepSeek开源了六个组件它要解的就是这后半截。芯片能不能跑DeepSeek三年前就交过卷了现在轮到人。那六个组件编译器、计算库、通信库都有公告末尾有一句关键的话所有组件与此前面向英伟达平台的开源组件一一对应。评论区当天挺热闹。这句话的分量得自己去仓库里数。我去数了三件事。第一件六个组件里四个早就有了。DeepGEMM-Ascend是矩阵乘法的库建在9月29日晚上DeepEP-Ascend是通信库建在30日凌晨。这两个确实是新的。剩下四个。跑向量计算的TileKernels是今年4月做注意力算子的FlashMLA去年2月做数据筛选的DeepSelect是9月9日TileLang更早2024年10月。六个仓的建仓时间都在GitHub上摆着。官方说的「开源」是这六个东西当天对齐到昇腾不等于当天从零写了六套。第二件TileLang到底是谁写的一直有人说这是DeepSeek自研。去年9月它开源V3.2算子时就有这说法。梁文锋在投资者交流会上也讲过训练V3时已几乎不依赖英伟达的软件生态全部基于自研的TileLang完成。可论文的署名摆在那儿。核心作者十一个人北大六个帝国理工一个微软亚洲研究院四个里头没有一个DeepSeek的人。所以严格说这门语言不是它写的。「自研」这个说法多半是把「深度参与」讲成了「自研」。论文发在2025年4月项目当年1月开源比这次公告早一年半。DeepSeek在里头另做了两件事。先用TileLang写了自家模型训练里的大部分算子拿产品给这门新语言做压力测试。「算子」就是模型里一个个具体的计算动作。然后它把训练里用到的每个算子在昇腾上重做一遍。官方的原话是训练中用到的每一个TileLang算子在昇腾上都有对应的高性能实现。先有模型后有算子清单再让芯片照着清单去适配。DeepSeek出题芯片动手。华为那边出的力也不少。超节点组网是两边一起定义的128卡做到3.2Tbps单层交换成果还在华为自己的CANN社区同步开源。第三件性能数字的实测口径。官方的说法是跨卡发送的带宽做到每秒375 GB把结果聚回来的每秒347 GB接近硬件上限。数字没错。卡和卡之间要交换一大堆数字。跨卡发送等于一屋子人互相递东西人手一份聚合等于各人手里的东西收回到一个人手上。人多了必慢官方报的那个上限是8卡规模下的成绩。375是8卡规模下的最好成绩卡数往上翻32卡落到335128卡掉到313聚合那头更明显347一路降到272。卡数翻了十六倍单卡分到的带宽掉了不到两成这个成绩不算难看。再往后还有个时间差。这组数字出自给DeepSeek的测试版硬件加手工配置。要让满带宽跑起来得等配套的那版商用固件。按DeepSeek自己开源仓库的说明那版固件计划10月中旬公开大概15日并注明这是厂商计划以华为发布为准。硬件已经在卖了缺的是让它跑满的那一版。口径差这么一点决定这套东西眼下解决了什么。适配一个昇腾算子过去按周按月算现在写在TileLang里后端换个编译器。省下的是时间。有人会问中立层这活儿不是早有人干吗FlagOS 2.0今年3月发布二十三家公司一起做覆盖十八家厂商三十二款芯片统一表示层第一批适配名单里就有昇腾。不过它管系统软件栈那一层统一表示、算子库、框架插件、跨芯片发布都在它那儿TileLang管的是语言这一层。北大在两边的名单里都有上游下游谁也替不了谁。这两层合起来要解决的就是这后半截。人会不会用得有人把路先摊平。......7月流出来的那份交流记录有句话最怪。梁文锋谈起华为超节点和英伟达的价格差说了一句贵百分之一百无所谓贵百分之两百都无所谓。买家的本分是砍价。他这话等于把价签当场撕了。正常情况嫌贵可以不买。他嫌贵还准备买那两倍溢价在他眼里换的就是别的。一个准备下单十六万颗芯片的人把价格放这个位置不是姿态。他那本账里芯片的价钱已排不到前头。那他买的到底是什么同一场交流他还说过一句唯一的瓶颈是产能。华为要四张卡才顶英伟达一张迭代节奏还落后大概两年这些他都认摆完还说贵两倍无所谓。账要这么算才通。他要的是能确定拿到手的卡价格往后放。他说华为给DeepSeek的产能大概一万六千张卡。同一场里他还提了一句互联网大厂拿十几万张。一万六千张是什么量级按他自己的算法相当于四千张英伟达的卡做不了下一代模型。他还留了后半句但足够帮华为把生态跑通。先认不够用再说够干什么这顺序有讲究。订单那头还有个数彭博社9月的报道说DeepSeek计划部署至少十六万颗昇腾950DT用在内蒙乌兰察布在建的1GW数据中心。报道里提到华为这颗芯片年产能约几十万颗这一笔得慢慢交可能拖上一年。一头下了一年的单一头一年只出得来几十万颗。谁手上有卡谁就是稀缺的那一方。他多付一倍两倍的钱换先把卡拿到手。一个做模型的人最怕的是手里这些卡不够支撑下一代模型那下一代就得等。等多久谁也说不准决定权不在他手上。钱是肯定要花的花多少也大致有数。往后拖多久没数。所以两本账放一起他的算法很简单多掏钱换时间。还有一句更硬的话在后面。他说如果是在一个正常的商业环境里面我能买到英伟达的卡那么国产替代是比较难的但是在英伟达的卡买不到的情况下所有人都迫不得已都要去做国产芯片。这话把因果说反了吗没有。他把国产替代的动力从「国产更好」挪到了「买不到别的」。这个前提是很脆的哪天英伟达的卡重新买得到用国产的理由就少了一大半。开源这件事放在这个前提下就说得通了。它让多几家芯片公司能把卡做出来也让用卡的人敢下手DeepSeek手上就多几张牌。别人多一条路它自己多一个能拿到货的地方。做慈善和留后手在这儿是同一件事。9月30日那天市场没给这套组件定价沪指涨了0.31%科创综指跌1.81%半导体板块集中调整寒武纪跌了2.97%。一条消息能不能变成钱得看它离订单有多远。这套组件还隔着好几层。过去国产芯片要证明自己能用得先说服客户现在多了一个正在用的人而且这个人是当下最有资格挑刺的那个。它一边买着华为的卡一边把工具链开源给所有芯片厂。买和送是一套动作。这动作看着往外给为的还是往里拿。多几家厂能出卡它就不必只盯一家三年前它解的是「芯片能不能跑」现在解的是「能不能排上」。题换了人也是。......写到这儿估计有人会想这事在二级市场怎么落先看中芯国际二季度产能利用率93.7%资本开支18.36亿美元毛利率25.3%三季度公司预期回到95%上下订单已收到年尾。为什么是中芯能规模量产先进制程AI芯片的产线国内就它一条签长约的也是它。谁签了多少、排到哪儿都在它账上。它半年报里有个10.29%是应收账款余额最大客户的比重前五大加起来42.43%。欠款口径跟收入不一回事但下游的钱往头部走这儿看得见。再往上游看扩产得先买设备。伯恩斯坦八月把中国晶圆厂设备市场的盘子调到2027年730亿美元、2028年1010亿美元还说设备股今年涨了60%到110%。涨的是预期接下来看交付。旁边的配套也顺手看一眼中芯二季度把产能往AI计算、HBM和高毛利存储上挪标准逻辑、联网芯片、利基存储的供给就紧了。谁在涨价、谁的单排到明年看这儿。这三条线要是看反了各有各的记号。良率明显偏离高盛那个23%先进制程这笔账得重算10月中旬那版固件实测低于现在这组数据性能口径得收回长约客户在应收款里占比掉下来排队那套说法得改口。所以DeepSeek开源这套底层框架给自己多开几条队有得选是最贵的一样东西也是唯一花钱买不到的。原文链接DeepSeek为什么要16000张卡-虎嗅网我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表