ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GEMM 与 BLAS 全解:Tensor Core、CUDA、Transformer 的关系,各家 GPU 与框架的实现逻辑,以及投资机会

GEMM 与 BLAS 全解:Tensor Core、CUDA、Transformer 的关系,各家 GPU 与框架的实现逻辑,以及投资机会 GEMM 与 BLAS 全解Tensor Core、CUDA、Transformer 的关系各家 GPU 与框架的实现逻辑以及投资机会声明本文作为笔者个人备忘的文章不喜勿喷。本文由AI辅助生成技术参数与市场信息整理自公开资料仅供参考。一、一句话结论GEMM通用矩阵乘法是大模型/深度学习绝对的计算心脏占 Transformer 计算的 90% 以上BLAS 是矩阵/向量运算的标准库接口而 Tensor Core 是 GPU 上为 GEMM 专门造的乘法机房。整条链路是Transformer 的每一层几乎都是 GEMM → 由框架PyTorch 等下发 → 调用 cuBLAS/cuDNN/CUTLASS → 在 CUDA 上驱动 Tensor Core 硬件。谁把 GEMM 跑得更快、软件生态更好谁就赢得 AI 算力竞赛。二、GEMM 与 BLAS 是什么2.1 BLAS基础线性代数子程序库BLASBasic Linear Algebra Subroutines是 1980 年代起逐步标准化的线性代数底层函数接口分三个层级 -Level 1向量-向量运算如点积、axpy -Level 2矩阵-向量运算GEMV -Level 3矩阵-矩阵运算GEMM是最重要、最难优化的一个。价值BLAS 让无数科学计算、机器学习程序不必重复造轮子统一调用同一套接口而具体实现由各厂商针对硬件优化。2.2 GEMM通用矩阵乘法C α·A·B β·CA 是 M×K、B 是 K×N、C 是 M×N计算量为2·M·N·K次浮点运算是深度学习里吃算力最大的单一算子。2.3 cuBLAS 与 CUTLASSGPU 侧的两条路cuBLASNVIDIA 官方的BLAS 的 GPU 加速闭源库开箱即用、高度调优但像黑盒。CUTLASSNVIDIA开源的 C 模板库把 GEMM 优化拆成可组合的积木数据tile、线程配置、指令可定制、可庖丁解牛也是 FlashAttention 等的底层抽象来源。三、GEMM 与 Tensor Core 的关系Tensor Core 是专为矩阵乘设计的硬件单元NVIDIA 自 Volta 2017 起加入一条指令即可完成一块小矩阵的乘累加如 4×4、8×8、16×8 的 MMA而普通 CUDA Core 只能做标量乘加。GEMM 是 Tensor Core 的核心负载Tensor Core 把 GEMM 的乘累加一条条打包并行。混合精度是关键Tensor Core 用FP16/BF16/TF32/FP8 输入 × 运算 → FP32 累加在损失可接受精度下大幅提速。性能差距巨大H100 的 FP16 Tensor 稠密约 989 TFLOPS而 FP32 CUDA Core 仅约 67 TFLOPS——专用硬件 低精度是 15 倍差距的来源。一句话GEMM 是要算的活Tensor Core 是专干这活的机器。四、GEMM 在 GPU 中如何计算4.1 三层分块Tiling沿 M/N/K 三个维度把大矩阵切成小 tile每个线程块Thread Block算一块输出 tileK 维迭代累加。复用远比算一次重要数据尽量停留在高速存储寄存器、共享内存少去全局内存。4.2 数据流Global Memory → Tile 加载 → Shared Memory → 寄存器(Register Blocking) → Tensor Core(Warp 级 MMA)Warp 级 MMA32 个线程协同执行一条 Tensor Core 矩阵乘指令优化手段多级 tile、共享内存复用、避免 bank conflict、双缓冲/流水线、寄存器阻塞。4.3 实测Tesla T42048×2048方案时间GFLOPSCPU~65885 ms~1.5CUDA Naive~61 ms~308Shared 优化~25 ms~475cuBLAS~2.65 ms~2462数据说明同样的 GEMM从朴素写法到 cuBLAS性能差几个数量级——这就是为什么大模型必须优化到极致。五、GEMM 与 CUDA 的关系CUDA 是 NVIDIA 的编程模型/运行时。开发者用 GEMM 有三种层次 1.直接调库cublasGemmEx/ cuDNN——开箱即用、性能最好 2.CUTLASS 手写需要定制/算子融合时用 C 模板写 Kernel 驱动 Tensor Core 3.CUDA C 裸写基础教学/特殊场景。框架PyTorch/TensorFlow的 matmul 最终都落到 cuBLAS / cuDNN / CUTLASS。所以看懂 GEMM 就看懂了 AI 算力的软件底座。六、GEMM 与 Transformer 的关系Transformer 的每一层几乎都是矩阵乘 -QKV 投影X·Wq / Wk / WvGEMM -注意力分数Q·KᵀGEMM -输出投影Attention·WoGEMM -前馈 MLPGELU(X·W1)·W2两个大 GEMM。GEMM 占 Transformer 总计算的 90% 以上。所以优化 GEMM如 FlashAttention、更优的矩阵分块直接决定大模型训练/推理速度这也是各家 GPU 都拼命优化 GEMM 的原因。七、每家 GPU 如何实现矩阵乘法硬件 软件栈厂商硬件矩阵单元软件栈策略NVIDIATensor CorecuBLAS / CUTLASS / cuDNN私有高性能 生态垄断AMDCDNA Matrix CoreROCm / rocBLASHIP 兼容对标 CUDAIntelXMX 矩阵引擎oneMKL服务器/数据中心华为昇腾Cube Unit可重构 Cube16 FP16 ALU INT8 MACCANN编译器把 GEMM 拆成 Load→Compute→Store 三阶段直接映射硬件流水线全栈自研DSA 高能效batch1 小矩阵延迟比 A100 低约 11%寒武纪MLU Core 稀疏加速器自动跳过零值乘加1024 步压到 320 步NeuWare适配推荐/稀疏CV 等均匀权重场景反而低效摩尔线程全功能 GPUMMX 矩阵单元MUSAAPI 兼容 CUDAMUSIFY 一键迁移 TileLang-MUSA极致兼容迁移成本最低海光DCU类 AMDDTK基于 ROCmHIP 兼容 CUDA算子覆盖超 99%源码兼容HPCAI壁仞云端 GPUBIRENSUPA类 CUDAvLLM/SGLang 快速适配沐曦异构计算曦云/曦思通用推理两条路线 -GPGPU 通用路线海光、摩尔、沐曦、AMD兼容 CUDA 生态迁移成本≈0 -DSA 专用路线昇腾、寒武纪、昆仑芯、Google TPU专为张量计算定制牺牲通用换更高能效与自主可控。八、常见框架如何实现PyTorch用户写torch.matmul/nn.Linear→ ATen 层 → 调用cuBLAS/cuDNNNVIDIA或各厂商库昇腾走 CANN/Torch-Ascend、寒武纪走 NeuWare 一键迁移。TensorFlow/JAXXLA 编译后调用 cuBLAS/CUTLASS。训练/推理框架DeepSpeed、vLLM、SGLang 下层仍归到 GEMM 算子库。TileLang新变量一个不归属任何硬件厂商的中立算子编译语言。芯片厂商只需提供编译后端与底层指令接口上层算子生态即可复用——这让国产芯片有望第一次共享同一套算子生态解决长期碎片化。DeepSeek 已开源昇腾全套组件并适配寒武纪、海光、摩尔线程等。九、为什么有这些怎么想到的解决什么问题BLAS为什么先有接口数十年前科学计算重复造矩阵库。BLAS 用统一接口解决问题让每个厂商只优化一次、人人共享——本质是工程标准化。GEMM 是核心因为几乎所有线性代数与深度学习都收敛到 GEMM。优化 GEMM 优化一切。Tensor Core为什么被想到NVIDIA 发现 AI/ML 主负载就是矩阵乘且能容忍精度损失。于是造专用硬件 开混合精度——用精度换性能解决通用 CUDA Core 算 GEMM 不够快/不够省。各家定制为什么有分歧绕开 CUDA 生态垄断 自主可控 能效比衍生出 GPGPU 兼容路线迁移成本低与 DSA 专用路线能效高——解决生态 vs 能效 vs 自主的三难。TileLang/算子生态新问题国产芯片软件栈碎片化模型厂商适配每家都要重来。中立编译语言 共享算子生态解决国产算力从推理可用走向训练可用、降低迁移门槛。本质AI 算力几乎全花在 GEMM 上谁把 GEMM 的硬件 软件 生态做到最好谁就占据算力主导。十、投资视角行业占比、投资情况与趋势10.1 市场规模与占比中国 AI 服务器本土芯片采购占比已升至约 40%训练芯片国产替代率超 30%。国产格局华为昇腾一家独大占半壁江山寒武纪第二海光、天数、摩尔线程、沐曦、燧原构成第二梯队。10.2 主要玩家2025 出货/业绩概览华为昇腾DSA 全栈自研出货领先摩尔线程出货约 6-8 万张2025 营收 15.05 亿元全功能 GPU 龙头沐曦出货约 5-7 万张2025 营收 16.44 亿元燧原科技S60 累计出货/订单超 10 万片增速天数智芯 168.5%寒武纪、摩尔、沐曦营收均翻倍以上。10.3 三条技术路线交付模式分化SRAM 推理专用曲速科技高能效低延迟适合推理优先全栈自研华为昇腾端到端可控、全场景适合自主可控要求高通用 GPU寒武纪、海光、沐曦生态兼容、迁移成本低兼顾训练与推理。10.4 趋势研判算子生态走向统一DeepSeek 开源昇腾组件 TileLang/FlashAttention-Ascend 等国产从各自建生态走向共享算子层。训练可用性升级国产芯片从能跑推理迈向能训大模型V4 已在昇腾首发、多芯片适配。AI 服务器国产化率稳步抬升本土芯片采购占比 40% 且续升。资本市场分化摩尔/沐曦/天数等 2025 年陆续上市后板块回调估值从稀缺溢价转向业绩验证。十一、当前主要优劣NVIDIA Tensor Core优性能与生态CUDA/cuBLAS/CUTLASS碾压混合精度成熟。劣封闭、对华受限专用性牺牲了通用性。华为昇腾 Cube Unit优DSA 高能效、全栈自主、可重构小矩阵/推理场景优秀。劣通用性弱需适配定制 Torch/CANN生态仍在追赶。寒武纪 MLU优稀疏计算加速推荐系统等稀疏场景强PyTorch 一键迁移。劣CV 等均匀权重场景开启稀疏反而增加开销实测延迟 7%。国产 GPGPU海光/摩尔/沐曦优生态兼容HIP/MUSA、迁移成本低、HPCAI 兼顾。劣单卡性能仍逊于英伟达依赖跟跑其生态资本市场估值高企后回调。十二、小结GEMM 是 AI 算力的心脏BLAS 是它的标准接口Tensor Core 是为它而生的专用硬件——三者 CUDA/框架一起构成从算法到硬件的完整链路。Transformer 几乎全是 GEMM优化 GEMM分块、共享内存、混合精度、算子融合直接决定大模型速度。各家 GPU 分 GPGPU 兼容与 DSA 专用两路分别解决生态迁移与能效/自主。投资主线国产算力国产化40% 且续升、算子生态统一TileLang/DeepSeek 开源、训练可用性升级、AI 服务器/高速互联配套叠加资本市场从稀缺溢价转向业绩验证。附参考来源公开资料整理NVIDIA 技术博客CUTLASS 3.x、Tensor Core 浮点仿真、CUTLASS v2.8腾讯云开发者社区CUDATensor Core 与混合精度 GEMM、cuBLAS SGEMM 性能实测GitCode / CSDNsimpleCUBLAS、CUTLASS 源码解析、行/列主序腾讯云 / CSDNGPU 执行单元昇腾 Cube Unit、寒武纪 MLU 稀疏加速、三家软栈对比腾讯新闻 / 网易DeepSeek 开源昇腾组件、TileLang 跨芯片算子生态知乎2026 国产 GPU/AI 芯片出货情况昇腾/寒武纪/摩尔/沐曦等央广网 / 中国经济时报 / 新京报AI 芯片 GPU/ASIC/TPU 多路线、三条交付路线腾讯新闻摩尔线程等国产 GPU 上市后板块表现微信公众号AI闲谈、国联民生电子等笔者按本文为个人备忘与学习笔记面向普通读者讲清 GEMM/BLAS 与 Tensor Core、CUDA、Transformer 的关系及各家实现。技术参数以各芯片厂商官方与权威机构数据为准若有出入以官方为准。
返回列表