
端侧推理芯片最近频频登上行业头条淬思科技完成过亿融资的消息又把“端侧”“推理芯片”这两个词拉回到聚光灯下。这家公司的联合创始人潘鸿洋是复旦微电子博士团队背景偏硬做的事也够硬不搞一款芯片通吃所有终端而是为不同端侧场景定制专属推理芯片。这两年AI模型越来越大手机、汽车、耳机、家电都在拼命塞AI功能但全部走云端推理根本不现实。延迟、带宽、隐私、续航哪一项都能卡住脖子。把推理搬到端侧让设备自己算几乎是所有硬件厂商的共同刚需。所谓“端侧AI硬件部署”本质上是要在极低的功耗和成本约束下用好每一次算力。淬思这条“场景定制”路线正好切中了这个痛点。1. 项目概述淬思科技到底在做什么1.1 为什么AI推理一定要“落到端侧”先看云端推理的代价。一个典型的云端AI调用数据要经过采集、上传、云端排队、推理、回传这几个环节光是网络往返就要几十毫秒。对聊天机器人来说这可能无所谓但对自动驾驶的紧急刹车、工业机械臂的实时避障几十毫秒就是生死线。另外云端推理的成本是按token、按GPU小时计费的如果一台终端整天都在调AI接口用户费用和厂商成本都吃不消。端侧推理正好能规避这些问题。模型跑在本地没有网络延迟响应时间是微秒到毫秒级数据不出设备隐私安全更好解释离线也能用地下车库、电梯、飞机上都不受影响。最直接的好处是省钱——一次流片、长期摊销后续推理不再按次付费。但“端侧AI”这四个字不是凭空就能实现的。手机SoC里的NPU能跑通小模型不代表一个几百毫瓦的智能门锁芯片也能跑大模型。不同端侧设备的算力预算、内存带宽、成本上限差异巨大这才是专用推理芯片存在的根本原因。1.2 为什么“一颗芯片打天下”行不通很多人理解里的AI芯片是一颗又大又全的通用AI加速器像GPU一样什么模型都能跑。但端侧场景恰恰是最不适合“通用方案”的地方。TWS耳机里的语音唤醒芯片整机功耗要控制在毫瓦级芯片面积要小到能塞进耳机柄成本还要低到几块钱而智能座舱里的AI芯片要跑多路摄像头感知、语音交互、驾驶员监控算力得几十TOPS功耗可以放到几瓦甚至更高。这两类场景用的如果是同一颗芯片要么耳机那边功耗严重超标要么座舱那边算力不够用。潘鸿洋在对话里表达过一个很核心的判断端侧芯片不能以“模型适配芯片”为出发点而是要以“产品体验”为出发点。先搞清楚设备形态、算法需求、功耗预算再去定义芯片架构。这就是“领域专用架构”的思路也就是DSA。2. 技术路线拆解专属推理芯片怎么设计2.1 算力不等于好用端侧芯片要看四个关键参数很多团队做端侧芯片时踩的第一个坑就是把TOPS当成唯一指标觉得算力越高越好。真实情况完全不是这样。端侧推理芯片好不好用至少要看四个参数。第一个是能效比单位是TOPS/W。同样做10 TOPS的算力5W能完成和15W能完成对设备形态的影响是天壤之别。耳机、手表这类设备整机热设计功耗本来就不高芯片能效比不够性能再强也装不进去。第二个是实际可达算力。芯片标称的TOPS往往是在最高频率、满负荷、数据连续流动的情况下测出来的而真实模型推理有数据依赖、有访存瓶颈实际吞吐可能只有标称值的50%甚至更低。判断芯片好坏要看真实模型跑到设备上的帧率而不是纸面TOPS。第三个是精度支持能力。不同模型、不同算子对精度的敏感度差异很大。有的模型用INT8就能无损部署有的模型必须保留部分FP16计算。专用芯片如果在硬件上只支持一种精度软件层怎么绕都是一笔糊涂账。第四个是工具链成熟度。这一点最容易被技术型团队忽略。芯片只是硬件载体没有好用的编译器、算子库、调试工具算法工程师根本没法把模型“塞”进芯片里。潘鸿洋特别提到他们在定义芯片架构的时候就把工具链当作第一优先级而不是产品做完之后再去补软件。2.2 从算法到芯片的联合设计先有鸡还是先有蛋端侧芯片和通用芯片的另一个本质区别在于设计流程。通用GPU的做法是先做一套高度灵活的计算单元再用编译器去适配各种新模型端侧专用芯片没有这个余量它必须在流片之前就知道自己将要面对哪些算子、哪种模型结构。实际操作中团队会选一组目标模型作为“黄金基准”。比如做智能座舱芯片先定好要跑的目标检测模型、姿态估计模型、语音识别模型然后把这些模型算子做一次统计卷积、全连接、Attention、Softmax各占多少计算量数据访存模式是什么样的。基于这份统计再决定芯片里放什么样的加速器、做多大的片上存储、设计什么样的数据通路。这本质上是一种“软硬协同设计”。模型在训练阶段就要考虑硬件特性比如用混合量化感知训练把权重和激活值都压到低比特硬件在架构阶段就要为模型预留扩展能力比如专门为Transformer类模型设计Softmax加速单元。潘鸿洋说他们团队很多时间都在做这种事把模型算子一层层拆开看到计算访存比再决定硬件里哪部分该做重、哪部分该做轻。听起来像算法工程师的工作其实是芯片架构师的基本功。2.3 自研指令集与算子加速把“理解模型”写进硬件端侧AI芯片内部通常会有一个专门的计算引擎业内喜欢叫NPU本质上是多个专用计算阵列的组合。淬思科技的做法是围绕目标场景定义小型指令集让编译器可以把神经网络映射成一系列硬件指令指令粒度比GPU的线程指令大但比通用CPU的指令更贴算子。举个例子Attention机制里的QK^T和Softmax如果在通用CPU上要拆成几百条指令但在专用芯片里可以直接做成一条硬件指令数据一次读进来、计算完直接写回。这种“算子级加速”省掉的不仅仅是计算时间更关键的是省掉了中间结果搬来搬去的访存开销。另一个重点是稀疏化支持。很多模型经过剪枝之后权重矩阵里会有大量0元素。如果芯片的硬件能跳过这些0实际算力可能比标称算力高出好几倍。但稀疏化对硬件设计非常挑剔稀疏粒度、索引方式、负载均衡都要仔细设计否则跳过了也不一定快。3. 端侧AI硬件部署从模型到芯片的落地实操3.1 模型训练、剪枝、量化与编译的完整链路先聊整个端侧AI硬件部署的标准流程。不管芯片多强最终要落地还是得走通“训练-压缩-量化-编译-集成”这条链路。第一步是模型选型和训练。端侧模型不一定非要自研完全可以从开源模型开始然后根据任务做微调。但要注意选模型时就要看硬件能不能跑。一个模型参数量400M和40M对芯片的面积、带宽、功耗要求完全不同。第二步是压缩。剪枝是把不重要的连接删掉蒸馏是用大模型教小模型大幅压缩参数规模。这一阶段最容易犯的错误是一味追求压缩率导致精度崩盘。合适的做法是“以精度为抓手”每做一步压缩都评估一次任务指标比如目标检测的mAP掉点不能超过一个阈值。第三步是量化。训练完的高精度模型要先转成低比特通常是INT8或INT4。最简单的做法是“训练后量化”把浮点权重直接映射成整数但这样大模型常常掉点业界主流做法是“量化感知训练”在训练过程中加入伪量化节点让模型自己适应低比特表达。我见过不少团队偷懒用训练后量化结果精度掉了一两个点然后赖芯片不好其实是流程的问题。第四步是编译。把量化后的模型导入芯片的编译器编译器会做算子拆分、内存分配、指令生成。这一阶段的最重要原则是“不要只盯着端到端延迟还要看算子的剖析报告”。哪一层算子跑得慢、哪一层访存有瓶颈编译器都得能反馈出来。最后一步是集成。芯片跑通模型后还要接入实时操作系统、驱动、应用层处理多任务调度、内存保护、功耗管理。这个环节看起来不性感但端侧产品能不能稳定运行全看这一步做得扎不扎实。3.2 场景化配置以智能座舱和家庭终端为例拿智能座舱来举个例子。座舱里的AI任务通常是多条流水线并行实时检测驾驶员疲劳状态、识别语音指令、渲染车载大屏的3D界面。模型不算特别大但并发多路且时延要求高。芯片设计上要配足够大的片上存储还要支持多路视频输入接口DMA调度要特别快。计算阵列倒不一定堆很多真正卡脖子的是访存和中断响应。再看家庭终端像智能门锁、空调面板、智能音箱。这些设备的共同特点是成本极其敏感、整机功耗预算低、待机时间极长。智能门锁要在微控制器级别跑人脸识别功耗要控制在几十毫瓦内智能音箱则要求随时监听唤醒词待机功耗低到几毫瓦但一旦被唤醒又能瞬间提高到几TOPS的算力。这种“平时极省用时能战”的动态功耗调节能力对芯片架构的电源域设计要求很高。两种场景一对比就能明白淬思科技为什么强调“定制”。座舱芯片要的是多路并行、高带宽、高可靠性家庭终端要的是低成本、超低待机、快速唤醒。硬要用同一颗芯片成本侧和功耗侧必然有一边妥协。3.3 编译器与运行时优化性能好坏的关键战场芯片流片之后性能能不能发挥出来几乎全看编译器。这里说三个高频优化手段。第一个是算子融合。把连续多个算子合并成一个算子减少中间结果的访存。比如卷积后面跟ReLU很多编译器会直接做“卷积ReLU”的融合算子数据不用写回DDR再读回来。典型优化可以把推理延迟降低20%到30%。第二个是内存复用和数据排布。模型中间激活值的生命周期很短用好了就可以在一个小内存池里反复覆盖大幅减少对外部DDR的依赖。数据在内存里的排布方式也很讲究NHWC和NCHW排布对计算阵列的访存效率影响很大有时一个layout切换就能快一倍。第三个是异步DMA和计算重叠。端侧芯片通常有专用的DMA引擎把下一块数据从DDR搬到片上SRAM的同时计算阵列在跑当前这一块。如果这两件事不能重叠加载数据的时间就全浪费了。运行时的调度器要尽量减少计算单元的空闲等待。4. 这轮过亿融资背后的商业逻辑与验证路径4.1 资本为什么在“端侧AI”赛道持续加注不少人会问大模型不是都在云端吗端侧芯片凭什么被资本看好这个问题其实要倒过来看。大模型应用跑起来的最大瓶颈之一就是推理成本把一部分推理任务从云端挪到端侧既减轻了云端压力又让产品有能力提供更低时延、更强隐私的体验。这种需求结构决定了只要AI应用往终端渗透端侧推理就是必经之路。从市场规模看端侧AI硬件的范围实在太广。手机、PC、智能汽车、可穿戴设备、家电、工业设备随便一个品类每年出货几千万台甚至上亿台每台都塞进一颗AI芯片这就是一个百亿级甚至千亿级的硬件市场。对VC来说与其押注一个云端大模型应用的“爆款”不如押注“卖铲子”的端侧芯片公司至少业绩路径更清晰。淬思科技这类团队能获得过亿融资另一个重要原因是“复旦博士”这张硬技术标签。微电子行业非常吃基础功底一个在关键架构、内存系统和工具链上有扎实经验的团队比一个只有宏大叙事的团队更值得投。资本现在越来越清醒芯片赛道拼的不是PPT而是流片成功率和量产交付能力。4.2 过亿融资之后摆在这家公司面前的三大挑战融资只是加速器芯片公司的真正考验是“流片-量产-Design-win”这条正循环。所谓Design-win就是你的芯片被终端厂商的设计选中进入量产机型。这条路听着简单要走通非常难。第一个挑战是流片周期长、费用高。一颗28nm工艺的中等规模AI芯片流片费用在千万级人民币每次流片周期三到六个月。如果第一次回来发现功耗不达标、接口有问题就得改版再来一轮。钱和时间都是硬约束容错空间很小。第二个挑战是客户验证极其漫长。终端厂商对芯片的验证不只是跑通模型还要做高低温测试、电磁兼容、功耗稳定性、生命周期供货承诺。从送样到量产少则半年多则一年半载。对初创公司来说这一阶段最考验现金流。第三个挑战是团队要同时懂算法、懂芯片、懂产品。潘鸿洋强调过他们团队里除了芯片设计工程师还有不少算法背景的伙伴。芯片公司如果只有硬件思维做出来的产品很可能“性能很极致但模型跑不动”如果只有算法思维又会做出“模型跑得爽但量产成本爆炸”的方案。这种复合团队的碰撞成本很高但恰恰是长期护城河。5. 端侧推理芯片设计与落地常见问题与避坑实录5.1 设计阶段的五个高频坑先列一个我自己看项目时常遇到的“隐形坑”清单。第一个坑是只关注计算阵列不关注数据搬运。很多芯片团队把大量精力放在怎么提高MAC阵列利用率结果片上存储只有几百KB每次权重更新都要从DDR搬数据。推理任务和训练任务不一样推理的访存瓶颈往往比计算瓶颈更严重。设计时一定要把“数据供需平衡”放在第一位。第二个坑是量化精度支持太单一。只支持INT8某些模型用INT8跑精度确实会掉软件团队就只能硬扛最后怪模型不好。成熟的方案是支持混合精度比如不同层用不同比特率硬件代价不大但对精度保护很有帮助。第三个坑是忽视“冷启动”和“低功耗状态转换”。端侧设备的AI任务往往是“偶发式”的平时大部分时间在待机突然唤醒要快速出结果。芯片的电源域设计、时钟切换、SRAM保持电压都要考虑低功耗场景否则待机功耗一超标产品根本进不了终端。第四个坑是工具链和模型示例不够。流片回来后客户第一件事就是跑一个demo。如果配套的模型库全是“看起来能用但调不通”的代码客户很容易失去耐心。芯片公司要在送样前就备好至少三套完整可复现的参考方案。第五个坑是“用big.LITTLE思路做AI芯片”。有些团队喜欢搞一个大算力核加一个小算力核以为能兼顾性能和功耗却忽略了多核任务切换的开销。端侧AI任务往往无法简单切分反而会让调度器焦头烂额。专用芯片就该把每个算力单元做到“一心一意”不要什么都想干。5.2 量产与交付环节容易被忽视的细节芯片design好是一回事能量产交付是另一回事。这里再分享几个量产阶段容易翻车的细节。良率问题。不同晶圆厂、不同工艺节点、不同IP组合良率差异巨大。流片阶段要有足够的测试芯片投片量同时和封测厂提前排好产能。很多初创公司计算成本时只算流片费用忘了封装、测试、老化筛选这些环节结果毛利算下来是负的。封装上的散热问题。端侧设备空间小散热条件很差。一颗芯片长时间满负荷跑推理结温可能轻松突破85摄氏度影响性能和寿命。设计阶段就要算封装热阻必要时用散热片甚至液冷是的某些车载场景真的要上液冷这一项经常被忽略。测试方案的覆盖度问题。端侧设备数量大每一颗芯片都要经过出厂测试。测试程序要覆盖不同电压、不同温度、不同频率下的功能完整性。测试项写少了出货后才发现某批芯片在低电压下不稳定召回成本远超测试成本。5.3 团队协作与项目管理的“软性避坑”芯片研发周期长、环节多项目管理的坑比技术坑还致命。我最想提的一点是“不要迷信一次性完美交付”。AI模型在变、产品需求在变芯片不能等所有需求都确定了再动手。正确方式是“架构先行、分期交付”第一版先把核心算子和数据通路做扎实第二版再扩展算子库第三版再优化能效比。让客户尽早拿到可跑demo的芯片比多花半年打磨一个“全功能”版本更有价值。另一条经验是“一定要让算法工程师尽早介入硬件验证”。传统芯片公司是硬件出来后才请算法团队适配但端侧AI芯片的架构和算法耦合太深最好从RTL冻结前就开始软硬协同验证。用真实模型的中间产物喂给RTL仿真器比纯用测试向量仿真更早暴露问题。最后一条有点务虚但很关键芯片公司要建立自己的“失败复盘库”。流片失败、性能不达标、客户验证不过这些不该是偶发事件而应该是公司知识资产的一部分。潘鸿洋团队能有今天这种“场景定制”的能力背后大概率就是靠一次次迭代沉淀出来的。6. 聊聊我对“端侧推理芯片”这门生意的看法先声明我自己不搞芯片设计但这些年看过的AI硬件项目不少。淬思科技这轮融资让我觉得最有价值的点不是“过亿”这个数字而是它代表了一个趋势AI芯片正在从“拼算力参数”走向“拼场景理解”。过去几年大家看AI芯片先看TOPS再看制程然后比谁的数字大。可到了端侧用户感知到的不是TOPS而是语音唤醒快不快、人脸识别准不准、设备续航长不长。这些体验背后需要的是芯片团队把算法、模型、功耗、成本放在同一张桌上反复权衡。潘鸿洋强调的“为不同端侧场景定制专属推理芯片”本质上是在把“芯片思维”换成“产品思维”。如果让我给团队提一条实际建议那就是“先把一个场景吃透再谈平台化”。专用芯片公司很容易犯一个毛病——模型还没量产就开始讲平台故事最后哪个方向都没做透。端侧AI的窗口期还在能把一个场景做得足够极致就有了进入下一个场景的资本。等客户量上来、工具链完善了平台化的故事才叫真正的故事。另外再提醒一句同行们常忽略的事芯片公司的里程碑不是融资发布会而是芯片的良率爬坡曲线和Design-win名单。过亿融资只能说明资本看好你真正能让你在行业里站住脚的还是那颗芯片在客户产线里能不能稳定跑上一年。融资是燃料不是终点——这句话送给所有正在做硬件的团队。