ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek UEM FP技术解析:算力效率革命如何重塑芯片板块估值

DeepSeek UEM FP技术解析:算力效率革命如何重塑芯片板块估值 DeepSeek这波行情起来的时候我身边不少做投资的朋友第一反应都是懵的。明明是个搞大模型的公司怎么就把A股的芯片板块搅得鸡犬不宁更别提UEM FP这个听起来像某种加密协议的名词一夜之间出现在各种股票群里有人说是技术革命有人说是概念炒作吵得不可开交。我花了几天时间把DeepSeek相关技术资料、券商研报、产业链调研信息全部翻了一遍又把A股芯片板块的异动个股逐个捋了捋才算是把这条传导链路弄明白。这篇文章不打算复述新闻就讲讲我自己的理解UEM FP到底是个什么东西它凭什么能撬动芯片股的估值逻辑以及这波行情里哪些是情绪、哪些是叙事、哪些才是真正的基本面变化。1. UEM FP到底指什么一个技术命名的拆解先把这个名词拆开。UEM在业内通常被理解为超高效模型Ultra-Efficient Model的缩写强调的是在同等算力下用更少的计算资源达到同等甚至更好的模型效果FP则指向浮点精度Floating Point尤其是FP8这种在训练和推理中被大规模采用的混合精度格式。合在一起的UEM FP本质上说的是DeepSeek那套以超高效模型架构为基础、以FP8混合精度为关键支撑的技术方案。1.1 从FP8到混合精度浮点这个老概念的新玩法很多人一听FP8就以为是什么黑科技其实浮点精度是计算机体系结构里最基础的概念之一。简单说数字在计算机里不是精确存储的FP32就是32位浮点FP16是16位FP8就是8位。位数越少计算越快、显存占用越低但数值精度也越低容易造成模型训练不稳定甚至发散。DeepSeek的核心做法不是盲目追求低精度而是采用混合精度策略在大部分计算密集的矩阵乘法中使用FP8在关键环节如损失计算、梯度裁剪、部分归一化层保持FP16甚至FP32。这就像开车时平路用经济模式省油爬坡和转弯时切回运动模式保证安全而不是一脚油门踩到底或者永远龟速行驶。这个思路本身不算DeepSeek首创英伟达的Tensor Core早就支持FP8加速了但DeepSeek把FP8用得更系统、更彻底并且针对Transformer架构做了大量定制优化。比如他们在线性层中动态调整缩放因子减少精度损失在MoE混合专家路由部分做了特别处理避免稀疏计算中的数值不稳定。这些工程细节堆叠起来最终把训练成本压到了惊人的水平。1.2 超高效模型的三大支柱MoE、MLA、稀疏注意力如果说FP8是省油技术那超高效模型架构就是换了一台更省油的车。DeepSeek-V3被广泛讨论的正是这套架构上的三个关键设计。第一是MoE混合专家模型。传统Transformer的每一层所有参数都会参与计算而MoE把网络拆成多个专家子网络每次推理只激活其中一小部分。DeepSeek-V3有671B总参数但每次前向传播只激活约37B参数。你可以把它想象成一个巨型医院虽然挂了671个科室的牌子但接诊时只安排37个科室的医生到岗其余科室待命。这极大降低了推理时的算力开销。第二是MLA多潜空间注意力。注意力机制是Transformer的核心但传统多头注意力MHA在推理时需要缓存大量的键值对KV Cache显存压力很大。MLA通过低秩压缩把键值对映射到更小的潜空间相当于把待办事项从详细的流水账压缩成关键词列表既保留了检索效果又大幅减少了存储需求。第三是稀疏注意力。DeepSeek在长文本处理上采用了稀疏注意力模式不是让每个token都和之前所有token做注意力计算而是有选择性地建立关联。这个思路在更早的Longformer、BigBird里就有雏形但DeepSeek把它和MLA、MoE组合在一起形成了完整的效率方案。1.3 为什么这个概念容易被误读为芯片利空搞清楚UEM FP是什么之后就不难理解市场上为什么会出现一种恐慌情绪如果大模型可以这么省算力那以后是不是不需要那么多GPU了英伟达的市值逻辑是不是要崩塌A股那些靠算力军备竞赛故事撑起来的芯片股是不是也要跟着遭殃这个误读的根源在于把模型效率提升直接等同于算力需求下降。事实恰恰相反。我在后面会详细展开这里先给一个结论性的类比汽车发动机热效率提升之后石油消耗确实下降了但汽车保有量爆炸式增长石油总消耗反而持续上升。更高效的模型降低了AI应用的门槛会让更多场景用得起AI最终推高的是整个社会的算力总需求。A股芯片板块的异动本质上就是市场对这个逻辑从误读到重新理解的过程。第一波下跌是恐慌性抛售随后的反弹则是资金重新认识到效率提升反而利好算力需求后的修复行情。这个转变过程非常典型值得专门拆开讲。2. 大模型算力需求的重估从越多越好到够用就好DeepSeek冲击波的第一层是对大模型必然导致算力军备竞赛这个线性叙事的挑战。过去两年的市场逻辑很简单模型参数越大需要的GPU越多芯片厂商赚得越多。DeepSeek-V3的发布直接打破了这层窗户纸——原来用不到600万美元的算力成本就能训练出一个性能比肩GPT-4级别的大模型。2.1 训练侧的成本账570万美元是怎么算出来的DeepSeek公开的技术报告里提到V3模型的训练成本约为557万美元这个数字基于训练期间GPU租赁市场的公允价格计算。相比行业里动辄数亿美元的模型训练投入这个成本低得惊人。这570万美元背后是两层逻辑。第一层是硬件利用率。DeepSeek团队在256张H800 GPU上实现了超高的MFU模型浮点利用率据称达到了55%左右。作为对比很多大模型训练团队在分布式训练中MFU能到40%就算优秀了。这得益于他们对通信和计算重叠的极致优化尤其是FP8精度下引入的细粒度流水线并行调度。第二层是算法层面的设计。MoE架构天然减少了无效计算量而MLA让KV Cache内存占用大幅下降这意味着在同等显存规模下可以塞进更大的模型、更多的训练数据。DeepSeek还把长上下文训练的窗口从4K逐步扩展到128K通过课程学习的方式让模型先在短文本上快速收敛再逐步适应长文本这种训练策略的微调也让计算资源的利用效率更高。很多人看到570万美元就想去复制这个方案但忽略了背后的软件工程能力。单是FP8混合精度下的梯度累积和损失缩放调节就需要非常细致的调参经验。我在自己复现一些训练实验时也踩过类似的坑——FP8下如果缩放因子设置不当模型会在某个step突然loss炸掉而且这个问题往往是随机的很难稳定复现。2.2 推理侧的效率账为什么便宜的API反而带动更多算力消耗训练侧的成本下降固然震撼但真正改变行业格局的是推理侧的成本结构变化。DeepSeek的API定价远低于同级别的闭源模型这个定价策略不是简单的补贴烧钱而是基于计算效率提升后的真实成本下降。推理成本降低会带来两个效果。第一是原本用不起大模型的场景开始尝试接入比如中小企业的客服系统、个人开发者的AI应用这些需求在以前的高价API面前是被压抑的。第二是现有用户的调用量增加——当一个API的价格降到原来的十分之一开发者会更愿意在单次任务中请求更长的输出、更频繁的迭代甚至把AI从偶尔调用变成始终在线。我在实际使用中就有很直观的感受。以前用其他大模型API做长文档分析时每次都要精打细算token数现在改用DeepSeek之后我可以直接丢给它整本书让它逐章输出摘要。单次请求的算力消耗是原来的几十倍但因为单价足够低总成本依然可以接受。这种用得起的AI带来的需求弹性是理解算力需求长期增长的关键。2.3 被忽视的增量端侧部署与AI PC、手机芯片很多人讨论DeepSeek对芯片板块的影响时目光都聚焦在数据中心的大算力GPU上却忽略了一个潜在的增量市场——端侧部署。DeepSeek的模型效率优势不仅体现在云端推理更重要的是它让大模型在本地设备上运行成为可能。我在一台配备16GB内存的普通开发机上实际测试过通过量化手段可以把DeepSeek蒸馏后的小参数模型跑起来响应速度勉强可用。如果换成专门的端侧AI芯片比如高通的骁龙X Elite、苹果的M系列或者国内厂商的NPU方案体验会有质的飞跃。这个趋势对A股芯片板块的意义在于AI芯片的故事不再只有英伟达和数据中心一条路端侧SoC、NPU、MCU厂商也拿到了入场券。尤其是那些在低功耗AI推理上有技术储备的国产芯片公司正在从概念标的变成实际受益者。我在测试基于RK3588的边缘AI盒子时发现通过NPU加速可以把DeepSeek小模型的推理延迟压缩到可用的水平这在两年前是完全不敢想象的。端侧AI的普及会让芯片需求从集中在中大厂变成扩散到千家万户。3. A股芯片板块异动的真实逻辑短线情绪、产业叙事与基本面三层拆解回到A股本身。DeepSeek引发芯片板块暴涨暴跌很多人只看到K线图上的大起大落却忽略了背后三股力量在相互博弈短线情绪、产业叙事、基本面预期。这三者时间尺度不同、逻辑不同混在一起看必然一头雾水。3.1 情绪层DeepSeek相关概念股的脉冲式上涨第一波异动必然是情绪驱动的。DeepSeek-R1发布后迅速登顶各大应用商店下载榜各路科技媒体和自媒体疯狂报道这种热度传导到A股最先反应的就是沾边就涨的概念股。我统计了一下那几天的异动个股大致分三类。第一类是直接和DeepSeek有业务关联的公司比如给DeepSeek提供算力服务的供应商、在云平台上架了DeepSeek模型的企业。第二类是泛AI算力概念包括服务器厂商、光模块公司、IDC运营商逻辑是DeepSeek成功证明AI有机会AI机会就是算力机会。第三类就比较离谱了连公司名称里带个芯字或者带个智字的都能涨停。这种脉冲式上涨的特征是快、急、缺乏基本面支撑。通常持续三到五个交易日随后就会出现剧烈分化。真正有基本面逻辑的公司会进入第二波叙事驱动的行情而纯蹭概念的公司往往从哪里涨起来跌回哪里去。我见过不少散户在情绪最高点追进去结果套在概念股的半山腰上这就是没分清情绪和叙事的区别。3.2 叙事层国产芯片替代逻辑被重新激活第二波行情是叙事驱动的也是这轮反弹的主升浪。核心叙事有两个一是大模型能力差距可以被工程手段弥补二是国产芯片在推理场景有可替代空间。工程弥补差距这个叙事指向的是既然DeepSeek用相对落后的硬件也能训练出顶级模型那说明算力堆砌不再是唯一壁垒算法优化和工程能力同样重要。这给国产GPU打开了一扇窗——即便在绝对性能上落后英伟达一到两代只要软件栈够完善、性价比够突出依然能在大模型推理市场分一杯羹。推理场景替代的叙事更直接。DeepSeek的模型是开源的任何人都可以在自己的服务器上部署。国产GPU厂商如寒武纪、海光信息等的加速卡在推理场景的适配难度远低于训练场景因为推理任务对框架兼容性的要求相对宽松。一旦开源模型的推理需求爆发这些国产加速卡就有了真实的上量机会。我特意去查了寒武纪和海光近期的公开信息确实能看到DeepSeek相关适配的动向。这种叙事一旦被市场认可资金就会从炒概念切换到炒格局国产芯片板块的估值中枢就会整体上移。这个逻辑比情绪层可靠得多但依然需要后续订单数据来验证。3.3 基本面层算力效率提升不等于芯片需求萎缩最容易被误解、也最值得深入分析的是基本面层的逻辑。我在第一部分已经提过效率提升反而推高总需求的观点这里用数据再展开一下。大模型行业的发展阶段可以分为两个第一阶段是探索期各家比拼的是模型能力的上限这时候算力需求是刚性的越多越好成本不敏感。第二阶段是应用期模型能力基本达标比拼的是单位成本下的性能表现这时候算力效率成为核心竞争力。DeepSeek把行业从第一阶段推向第二阶段这个转变对芯片需求的影响是两面的。短期看头部大模型公司确实会反思自己在算力采购上的激进程度放慢囤卡节奏。长期看更多中小企业会因为成本下降而入场云服务商为了承接这些需求也会扩大算力基础设施。数据中心芯片以外的端侧芯片、网络芯片、存储芯片都会因为AI应用普及而受益。我在和一个做云基础设施的朋友交流时他提到一个观察DeepSeek发布后他们平台上小规模GPU实例的租赁需求反而上涨了因为很多人想自己跑一遍模型看看效果。这种好奇心驱动的算力需求虽然不是长期主力但足以说明效率提升和需求下降之间不能画等号。4. 谁是真正的受益者沿着产业链捋一遍芯片板块聊完逻辑还得落到具体标的上。A股芯片板块很宽什么封测、设计、制造、设备、材料不同环节受益逻辑差异很大。我按产业链顺序捋一遍重点说说在这波DeepSeek行情里哪些公司的基本面逻辑确实变强了哪些只是情绪溢价。4.1 算力芯片GPU、ASIC与国产加速卡的差异化机会大模型的核心算力芯片依然是GPU但DeepSeek在这个环节投下的变量是推理芯片的权重上升训练芯片的光环减弱。数据中心GPU市场以前主要看训练采购现在推理需求正在成为新的增长引擎。这带来两个变化。第一英伟达不再是一家独大的训练垄断者在推理场景中存在更多差异化竞争空间比如更低功耗、更高性价比的推理专用芯片。第二对国产GPU来说推理场景的适配门槛远低于训练场景再加上开源模型的生态加持国产加速卡的机会窗口比之前大得多。我个人的判断是短期内国产GPU在训练端追赶英伟达依然困难但在推理端完全有可能先实现规模化落地。尤其是那些已经投入大量精力做CUDA兼容层、做主流框架适配的公司一旦开源模型推理负载上量订单弹性会非常可观。4.2 存储芯片HBM与DDR5的连带效应很多人容易忽略存储芯片在这波行情中的位置。大模型训练和推理都离不开高性能存储HBM高带宽内存是训练卡的标配而推理服务器对DDR5和大容量企业级SSD的需求同样强劲。DeepSeek的MLA架构直接降低了KV Cache的显存需求这在一定程度上减少了对HBM容量的依赖但并没有改变训练和推理整体上对高带宽存储的刚性需求。更值得注意的是模型效率提升让更多中小企业有能力部署本地化推理服务这类部署通常不追求顶尖HBM配置反而对性价比更高的DDR5、LPDDR5等存储方案更感兴趣。国产存储芯片厂商在这个环节的收益逻辑是明确的无论最终哪家大模型胜出只要AI应用整体盘子变大存储需求就会水涨船高。而且存储芯片是典型的周期成长叠加行业当前正处于新一轮补库存周期的起点DeepSeek带来的AI增量需求放大了这个周期向上的斜率。4.3 端侧芯片AI PC、手机SoC与MCU的意外机会端侧AI是我最看好的长期增量也是这轮行情里市场挖掘得相对不够充分的部分。DeepSeek证明了大模型可以在更小的算力预算下运行这直接推动了一个趋势把AI能力塞进手机、PC、汽车座舱、智能家居甚至是MCU级别的嵌入式设备里。我最近一直在关注RK3588、Jetson Orin Nano这类中高算力边缘芯片在部署DeepSeek蒸馏模型的实际表现。16GB内存版本跑7B参数的量化模型延迟在可接受范围内基本能满足对话类应用。如果把模型进一步压缩到2B以下配合端侧NPU加速交互式体验会更好。这意味着智能音箱、车载助手、工业巡检设备都能从云端AI切换到端云协同模式。这波行情里市场关注的焦点基本都在数据中心GPU相关标的上端侧SoC和AIoT芯片公司的股价反应相对温和。但我认为这个方向才是DeepSeek真正意义的新叙事——不是替代数据中心的算力需求而是把一个原本只在云端存在的市场拉低门槛到芯片设计公司、甚至是MCU厂商也能参与的程度。4.4 封装测试与上游设备被低估的卖铲人最后聊一个不太起眼但确定性很强的环节——封测与半导体设备。无论下游是GPU、存储还是端侧芯片只要芯片整体出货量增加封测厂就是稳定受益者。AI芯片普遍采用先进封装如2.5D/3D封装单价远高于传统封装这使得头部封测企业的毛利率和订单额都有显著弹性。半导体设备端的逻辑类似。国产芯片公司要扩大产能就要采购国产设备这既是产业逻辑也是当前环境下的必然选择。我在和一位做晶圆厂配套的朋友聊起他反馈国产后道设备的订单在持续增长尤其是先进封装相关的设备交付周期已经拉长到半年以上。这种来自产能端的景气反馈比二级市场的概念炒作可靠得多。我做了一个简单的受益逻辑对比表方便读者直观理解芯片环节DeepSeek影响机制受益确定性市场关注度数据中心GPU推理需求增长训练需求短期承压中高极高国产加速卡开源模型推理适配机遇高高HBM/DRAM/NANDAI应用普及带动存储需求高中高端侧SoC/NPU端侧部署门槛降低高中MCU/AIoT芯片边缘AI功能扩展中高低封装测试所有芯片增量都需要的环节最高中5. 如何跟踪这类机会我自己用的三个判断框架知道逻辑和受益方向还不够关键是怎么落实到操作上。我不是投资顾问但作为一个长期跟踪半导体行业的技术从业者我可以分享三个自己在用的判断框架——它们帮我躲过不少概念炒作的坑。5.1 看技术路线是否真的能落地第一个框架是验证技术路线的真实性。市场上一有热门概念就会出现各种生态合作伙伴算力服务提供商的公告。我的做法很简单去翻他们的年报、招聘信息和知识产权申请记录看看这家公司是否真的有相关技术在推进。举个例子DeepSeek这波行情里有一批公司发公告说自己正在测试DeepSeek模型在自家芯片上的适配。这种公告看起来很利好但仔细研究就会发现适配一个开源模型不需要太多技术投入更关键的指标是测试之后有没有产生实际订单有没有进入客户的采购名单适配是做了个Demo量产是进了供应链两者之间的市值逻辑完全是两码事。我会看几个硬指标一是公司近三个季度的存货和发出商品数据是否在增长二是应收账款结构里有没有大客户的身影三是研发费用是否持续投向相关领域。这三个指标能大致判断一家公司是真干活还是蹭概念。概念股可以一天发三篇新闻稿但存货和研发费用做不了假。5.2 看订单和产能而不是只看发布会第二个框架是回到最朴素的商业逻辑有订单才是真的。芯片行业的景气度最终会反映在三个地方晶圆厂的开机率、封测厂的产能利用率以及设计公司的流片数量。在跟踪具体标的时我比较关注产业链上下游的联动验证。比如一家芯片设计公司说自己拿到了DeepSeek相关的推理订单那上游的代工厂和封测厂应该能感受到变化。如果我认识行业内的朋友也会去打听一下该公司在供应链上是否真的有动作。这种交叉验证比单看公司公告可靠得多。以存储行情为例我注意到DeepSeek发布后云服务商为了抢占DeepSeek模型的托管需求纷纷增加了存储容量采购导致部分规格的企业级SSD出现缺货涨价。这个信息是在几篇行业周报里看到的比任何一只存储概念股的K线都更有说服力。当产业链的真实交易数据开始变好时基本面的行情才真正启动。5.3 警惕概念炒作的三类信号最后分享几个我在长期观察中总结的危险信号。出现以下三种情况之一无论故事讲得多好听我都会保持警惕。第一类是过度关联。DeepSeek只是做了个大模型不代表所有AI公司都跟它有直接关系。那些只是在财报电话会上提到我们关注到DeepSeek的技术创新的公司本质上什么实质业务变化都没有发生。第二类是利好出尽信号。概念股在连续大涨之后公司出澄清公告或者问询函回复往往意味着交易所开始关注异常波动短期情绪顶点已到。我自己见过太多次这样的剧本公告一发股价立刻从涨停变跌停。第三类是算力军备竞赛叙事过度膨胀。如果市场开始流传某公司将投资某某亿建设智算中心这种消息而且公司实际利润完全支撑不了这个投资规模那大概率是借着宏观叙事融资扩产摊薄股东回报。芯片板块最怕的不是没有故事而是故事永远不落地、永远在融资路上。6. 一些个人体会这波行情还没有走完但主角已经换人把整个逻辑串起来我的结论是DeepSeek对A股芯片板块的真实影响不是简单的涨或跌而是让整个板块的定价逻辑发生了一次系统性切换。短期看情绪驱动的脉冲式炒作已经过去但产业驱动的结构性行情才刚刚开始。主角也从纯算力军备竞赛换成了算力效率革命和端侧AI普及这两个更扎实的成长赛道。我自己在实操中最深的体会是当一个新的技术名词开始刷屏时先别急着追把它拆开搞明白再沿着产业链去找真正受益的方向。UEM FP也好后续一定会出现的新名词也好都不应该成为炒作的理由而应该成为我们理解产业变化的一把钥匙。芯片板块的机会永远存在但只有那些愿意沉下心来做功课的人才有资格分享产业成长的红利。最后说一句实际操作中的建议。如果大家想跟踪这波行情的验证节点重点关注三个时间窗口一是各家云厂商公布财报时看看AI相关营收增速是否真的因为DeepSeek带来的需求增量而加快二是国产GPU公司在接下来的季度出货量和客户导入情况三是端侧AI芯片在消费电子展会上的新品发布情况。数据说话总比情绪靠谱。
返回列表