ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek 这次开源昇腾基础组件,到底图什么?

DeepSeek 这次开源昇腾基础组件,到底图什么? 想象这样一个场景你向一个 AI 助手抛出一个问题它在一两秒内给出答案。这个看似平常的过程背后其实是一场精密的接力赛——数据要在计算单元、内存、多张芯片之间飞速穿梭每一棒都不能掉链子。而这场接力赛的跑道过去几乎只有英伟达一家能铺。直到 2026 年 9 月 30 日DeepSeek 把一套面向华为昇腾芯片的跑道给开源了。一、先聊聊算力这件被忽略的小事很多人以为大模型厉害是因为模型大。这话只对了一半。真正的门槛往往藏在更底层——你用什么芯片、用什么软件栈去驱动这些庞大的计算。打个比方模型像一辆性能强悍的跑车但跑车要跑起来得靠一条好路芯片还得有一套熟练的驾驶系统软件栈。英伟达之所以能称霸 AI 江湖靠的正是路和驾驶系统都做得极好——尤其是它的 CUDA 软件生态几十年积累成了所有 AI 开发者默认的驾驶习惯。DeepSeek 的算力布局其实一直是双路并行训练主力用英伟达的卡推理部分则早早用上了华为昇腾。也就是说昇腾并不是新面孔而是一直在后台默默干活的老伙计。转折出现在 2025 年。路透社在当年 1 月报道DeepSeek 的 R1 模型发布后有关部门鼓励它采用华为昇腾处理器。随着海外高端芯片出口持续收紧越来越多的企业把算力供给转向国产。到了 2025 年 9 月伴随 DeepSeek-V3.2-Exp 发布昇腾完成了关键算子的适配——这算是这次大开源前的一次热身。真正的重头戏在 2026 年 4 月 24 日DeepSeek-V4 选择在昇腾平台首发底层代码从 CUDA 体系整体迁移到华为自研的 CANN 框架据说涉及 200 多个算子的重写。到 2026 年 9 月 30 日DeepSeek 干脆把这套昇腾版的底层组件全部开源。一句话概括这不是一次普通的开源而是把国产芯片的软件生态从零开始搭起来并且公开给所有人。二、六个组件就是一场接力赛的六个赛段要理解这六个组件最好的方式不是背功能列表而是想象一次推理请求在芯片里跑的过程。我们把这场接力赛拆成几个赛段每个赛段对应一个组件。第一棒TileLang —— 写接力指令的语言接力赛要跑首先得有人写比赛规则、发号施令。在芯片世界里这个发号施令的角色就是编程语言。TileLang 是 DeepSeek 自研的高级编程语言它在国产芯片上的角色就相当于英伟达生态里的 CUDA。它的本事在于把底层那些晦涩的硬件指令包装成人类更容易读懂的代码让开发者不用死磕硬件细节也能写出高性能的算子。在昇腾上它封装的是华为的 Ascend C 指令还专门针对芯片里的两类计算单元——矩阵计算单元和向量计算单元——做了优化。对我们这些写代码的人来说最直观的感受是写算子的门槛降低了代码更好读了。这就像是把一份复杂的比赛规则翻译成了普通人也能看懂的说明书。第二棒DeepGEMM-Ascend —— 负责重体力活的矩阵运算接力赛里最累的赛段往往是矩阵运算——大模型里绝大多数计算量都集中在矩阵乘法上。DeepGEMM 就是专门干这个的加速库。昇腾版和它的英伟达版完全兼容支持 BF16、FP8、FP4 等多种精度还能处理大模型特有的 MoE 计算。它最贴心的地方是把昇腾芯片底层的矩阵排布、对齐、地址计算这些繁琐细节统统封装了起来。你不需要懂芯片底层的排兵布阵也能把矩阵运算跑得快。这就像接力赛里你不用亲自研究怎么摆接力棒只管全力冲刺就行。第三棒DeepEP-Ascend —— 负责接力棒交接的通信接力赛最容易出问题的环节是交接棒。大模型训练和推理也一样——数据要在多张芯片之间来回传递一旦通信慢再快的计算也白搭。DeepEP 就是解决交接棒问题的分布式通信库。它负责在多张芯片之间高速传输数据覆盖了专家并行、上下文并行、流水线并行等主流的并行模式。实测数据很能说明问题它的传输速度已经接近硬件的物理上限。这意味着通信不再是拖后腿的环节算力能被真正榨干。第四棒TileKernels —— 基础动作的常规赛段除了重体力的矩阵运算模型里还有大量常规的向量计算和内存读写。这些动作单独看不大但数量极多是这场接力赛里最频繁的常规赛段。TileKernels 就是负责这些基础动作的组件。第五棒FlashMLA —— 长文本场景的特殊赛段当你的问题很长比如要读完一整篇文章模型需要处理的注意力计算会爆炸式增长这是长文本推理最大的瓶颈之一。FlashMLA 就是专门啃这块硬骨头的稀疏注意力算子。它优化了长上下文下的注意力计算让模型在处理超长文本时不至于被计算量拖垮。第六棒DeepSelect —— 精准挑选的筛选赛段最后这一棒是负责挑选的。大模型里经常需要从一堆候选里挑出最关键的几个——比如从几百个专家里选出最相关的或者从海量信息里筛出最重要的。DeepSelect 就是干这个的它负责从候选数据里选出得分最高的 K 项专门服务稀疏注意力和采样器这类场景。三、和英伟达那边其实是一一对应的看到这里你可能发现了这六个组件怎么越看越像英伟达生态里那些熟悉的名字没错。DeepSeek 官方也反复强调一一对应。我们用一张表把这种对应关系理清楚DeepSeek 的昇腾组件角色定位英伟达那边的对应物TileLang写算子的高级语言CUDADeepGEMM-Ascend矩阵运算加速cuBLAS / CUTLASSDeepEP-Ascend跨卡通信NCCLTileKernels基础向量/访存算子基础算子层FlashMLA稀疏注意力FlashAttentionDeepSelectTopK 筛选采样/稀疏算子这张表最有意思的地方不在于抄了谁而在于它把英伟达生态的每一层都在国产芯片上补了一个对应的开源实现。英伟达有的语言、矩阵库、通信库、注意力算子DeepSeek 都在昇腾上放了一份。四、跑得快不快数据说话说一千道一万最后还是得看跑得怎么样。这次公开的数据确实拿得出手传输速度跨卡通信实测接近硬件上限速度非常可观。推理速度整体吞吐达到了数千 tokens/s 的量级。超节点算力华为昇腾 950 超节点4096 卡规模FP8 算力达到 8 EFLOPS计划 2026 年 Q4 批量上市还能扩展到 8192 卡组网。响应时延在 8K 输入场景下跑 V4-Pro 单 token 解码时延约 20 毫秒V4-Flash 约 10 毫秒。吞吐表现在特定超节点上部署 V3/R150 毫秒时延约束下单卡解码吞吐突破 1920 tokens/s。DeepSeek 官方更是放话“训练中用到的每一个算子在昇腾上都有对应的高性能实现。”这句话的分量在于——它证明国产芯片不只是能跑而是能跑得快。这对很多被算力卡脖子的团队来说是实打实的希望。五、这场开源背后到底图什么技术开源只是表面真正值得琢磨的是背后的算盘。1. 想打破只有英伟达能跑的魔咒英伟达最大的护城河从来不是芯片本身而是它的软件生态——几百万开发者、几十年积累、无数库和工具。这套生态一旦形成别人想换赛道成本高得吓人。DeepSeek 这次开源等于在向行业喊话不必再被这一家绑死你可以用我的这套工具写一次代码跑在别的芯片上。这是对开发者习惯的直接争夺。2. 给国产芯片搭桥对华为来说这简直是天上掉馅饼。有网友调侃有人帮他们搭基础环境这还愁卡卖啊“话糙理不糙——DeepSeek 相当于免费帮国产芯片补齐了最缺的软件栈这一环让芯片从能卖变成好卖、好用”。华为也在同一天开源了双方联合创新的成果覆盖模型部署、大规模训练等场景。3. 商业上的组合拳融资与估值DeepSeek 据称以超 200 亿美元估值完成首轮外部融资腾讯、阿里参与其中。算力采购据称采购了 16 万颗华为昇腾芯片。定价策略其模型 API 定价大幅下调意在建立行业定价标准。4. 生态号召力这套工具正在成为国产芯片上事实上的标准。当越来越多的开发者开始用它写算子英伟达的垄断地位就会一点点松动。这就像一场接力赛刚开始只有一支队伍在跑但赛道一旦铺好就会有更多人加入。六、也得泼点冷水当然任何值得高兴的事都要留一分清醒。有分析一针见血地指出“99.8% 是真的部分算子仍只支持 CUDA 也是真的。”这句话的意思是DeepSeek 的适配确实做得很扎实绝大多数算子都实现了高性能移植但并不是 100% 覆盖仍有一部分算子只在英伟达那边能用。这是基本可用到完全可用之间的真实差距。另外DeepSeek 的算力布局仍是双路线并行——训练主力在英伟达推理在昇腾。昇腾版组件更多是支撑推理侧要完全替代英伟达生态还有很长的路要走。七、写在最后这场开源的意义不在于又开源了一个项目而在于它给国产 AI 芯片生态铺下了一条真正能跑起来的赛道第一次有头部模型厂商系统性开源面向国产芯片的整套软件栈第一次让摆脱英伟达绑定这件事从口号变成了可运行的代码第一次用实测数据证明国产芯片不仅能跑大模型还能跑得快。对开发者来说这是一份礼物——你不再被单一生态绑架可以选择国产芯片而且有一套成熟、高性能、开箱即用的工具链。对行业来说这是一次宣言——AI 算力的未来不该只属于一家公司。一场接力赛刚刚鸣枪。
返回列表