ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

算力基础概念

算力基础概念 算力是AI时代的核心生产力。本文从定义、分类、度量单位到核心指标系统梳理算力基础概念帮你建立完整的算力认知框架。一、什么是算力算力Computing Power 是计算机设备或计算/数据中心处理信息、执行计算的能力。在AI语境下特指用于AI模型训练和推理的计算能力以FLOPS每秒浮点运算次数或OPS每秒运算次数度量。算力的物理实现依赖三个基础半导体芯片中晶体管的开关速度、并行处理单元的数量、存储与计算单元之间的数据通路带宽。现代AI算力是一个综合指标不仅包括原始计算吞吐量还包括显存容量、显存带宽、片间互联带宽、节点间网络带宽。算力、算法、数据是AI三要素· 数据是原材料AI需要数据学习没有数据再强的算法和算力也无济于事。· 算法决定如何从数据中学习好算法能用更少数据和算力学到更好模型。· 算力决定处理速度数据量增大需要更强算力算力增强使更复杂算法成为可能算法进步又反向要求更多数据。大模型为什么“吃算力”1. 处理万亿级Token的训练数据海量读取和预处理。2. 千亿参数模型每次前向传播和反向传播都需要极其庞大的矩阵运算。3. 训练过程反复迭代数百万次。4. 整个训练持续数周到数月数千块GPU不间断运行。以GPT-4为例训练成本估计超1亿美元约25000块A100 GPU训练约100天。大模型训练被称为算力军备竞赛——千亿参数模型需处理万亿级Token、迭代数百万次GPU数量直接决定训练周期这是AI公司疯狂抢购GPU的根本原因。训练计算量估算Chinchilla Scaling LawC ≈ 6 × N × DN参数量D训练Token数。以175B参数、300B Token为例C ≈ 6 × 175×10⁹ × 300×10⁹ ≈ 3.15×10²³ FLOPS。若用A100 GPUFP16算力312 TFLOPSMFU约45%单卡实际吞吐约140 TFLOPS25000卡总吞吐约3.5 EFLOPS所需训练时间约104天与公开报道约100天高度吻合。二、算力的分类1. 通用算力通算——基于CPU应用场景Web服务、数据库、企业管理系统、办公软件。特点通用性强适合串行逻辑运算并行能力有限。在AI中主要承担数据预处理、业务逻辑处理、模型服务调度等辅助环节。CPU采用多级流水线、分支预测、大容量多级缓存和乱序执行优化单线程延迟。典型Intel Xeon Platinum 8480C拥有56核112线程FP64峰值约3.2 TFLOPS。通算成本低适合I/O密集和逻辑密集任务但矩阵运算吞吐远逊于GPU。2. 智能算力智算——AI算力的核心基础GPU、NPU、TPU适合大规模并行计算、模型训练与推理。应用场景大模型训练/推理、图像识别、语音识别、推荐系统。采用SIMT单指令多线程或VLIW超长指令字架构数千个并行计算单元实现高吞吐。以H100为例132个SM每SM含128个FP32 CUDA Core总计16896个CUDA CoreFP16峰值1979 TFLOPS是同代CPU的数百倍。3. 超级算力超算场景天气预报、核模拟、基因组测序、新材料模拟。追求极致浮点运算FP64双精度15-17位有效数字智算用FP16/BF163-4位有效数字数值更高但精度更低。采用MPP大规模并行架构通过高速互联InfiniBand HDR/NDR、Slingshot、Aries连接数千至数万节点。2024年TOP500榜首Frontier美国橡树岭FP64达1.2 EFLOPS由8,699,904个AMD EPYC核心Instinct MI250X组成。中国“天河二号”“神威·太湖之光”曾连续登顶。4. 量子算力基于量子叠加和量子纠缠N个量子比特可同时表示2^N种状态特定算法Shor、Grover下指数级加速。技术路线超导量子IBM、Google、离子阱IonQ、光量子中科大“九章”、半导体量子点。2024年IBM推出1,121量子比特的Condor芯片Google Sycamore完成量子优越性实验。瓶颈量子纠错逻辑量子比特约需1000个物理量子比特、相干时间。量子计算不会取代经典计算只在特定问题上提供加速。当前处于实验室阶段未来可能在密码破解、药物分子模拟、量子化学、优化问题等特定领域大显身手。三、算力的度量单位FLOPS单位体系十进制前缀与存储的二进制前缀不同· FLOPS每秒浮点运算次数基础单位· MFLOPS每秒百万次10⁶早期个人电脑· GFLOPS每秒十亿次10⁹普通CPU· TFLOPS每秒万亿次10¹²一块高端GPU· PFLOPS每秒千万亿次10¹⁵中型GPU集群· EFLOPS每秒百亿亿次10¹⁸大型智算中心· ZFLOPS每秒十万亿亿次10²¹未来国家级算力网络FLOPS仅度量浮点运算不反映整数/逻辑运算和内存操作。AI推理常用TOPS1 TOPS 10¹² OPS通常指INT8整数吞吐量。不同精度对应能力· FP6464位最精确、最慢用于超算、科学模拟。· FP3232位通用用于传统深度学习训练。· FP16/BF1616位速度快大模型训练主力。· INT88位快、精度低用于AI推理部署。· INT4/FP44位最快用于极限推理优化。NVIDIA H100各精度算力FP64 34 TFLOPSFP16 1979 TFLOPS约2 PFLOPSINT8 3958 TFLOPS约4 PFLOPS。看算力数字必须问什么精度下的FLOPSFP16 vs BF16· FP161位符号 5位指数 10位尾数范围约±65504精度约3-4位有效数字大数溢出为Inf。· BF161位符号 8位指数 7位尾数范围与FP32相同±3.4×10³⁸精度约2-3位。大模型训练普遍用BF16梯度值范围大FP16易溢出NaN/InfBF16动态范围与FP32一致训练更稳定。Google TPU率先使用NVIDIA从AmpereA100起全面支持。精度选择要点训练用BF16稳定、防溢出推理用INT8/INT4速度快、显存省科学计算用FP64精确。同一芯片不同精度算力差距巨大H100 INT8 3958 TFLOPS是FP64 34 TFLOPS的116倍比较算力数字必须标明精度。四、算力的核心指标1. 峰值算力理论最大计算能力实际很难达到。2. MFUModel FLOPs Utilization 实际计算FLOPS /GPU数量 × 单卡峰值FP16/BF16 FLOPS。“实际计算FLOPS”只计入模型前向/反向传播6×N×D不含通信和优化器计算。大模型训练MFU一般40-55%其余被All-Reduce通信、数据加载、梯度同步占用。3. HFUHardware FLOPs Utilization 实际计算FLOPS含重计算Recomputation/ 峰值FLOPS。使用Gradient Checkpointing时HFU高于MFU重计算增加FLOPS但减少显存。4. 通信计算比 通信时间 /通信时间计算时间通过梯度累积Gradient Accumulation和张量并行Tensor Parallelism优化。5. 能效比H100约2.8 TFLOPS/WFP16昇腾910B约1.6 TFLOPS/W直接影响电费。6. 网络带宽与延迟分布式训练GPU间通信是主要瓶颈InfiniBand延迟约1微秒普通以太网10-50微秒。7. 存储吞吐训练频繁读取数据吞吐不足会导致GPU“等数据”。 本文标签算力 FLOPS GPU AI基础设施 训练 推理 精度参考资料《第八章 算力基础概念》柏舟生。版权声明本文为基于原文的整理与解读遵循 CC 4.0 BY-SA 版权协议转载请附上原文出处链接及本声明。
返回列表