
1. 直播里被追问最多的两个问题暴露了工业AI落地的真实瓶颈前阵子我做了一场关于工业AI机会的直播分享主题是《工业AI的下一个机会在哪》。本来准备了不少关于行业趋势、技术路线演进的内容结果聊着聊着弹幕里的话题越来越具体最后被反复追问的其实就两个问题第一你们做工业AI检测、服装检测这类应用用的是云联网还是单机的AI第二到底用什么样的模型才够用是不是必须上大模型这两个问题问得非常实在。坦白说这两个问题背后反映的焦虑恰恰是工业AI落地过程中最大的两道坎部署形态怎么选模型规模怎么定。很多企业不是不了解AI能干什么而是卡在这东西到底怎么放到我的产线上、用多大的代价才能跑起来这一步。直播间里我现场答复了一些内容但直播时间有限很多细节没法展开也来不及解释清楚为什么这么选。所以这篇回顾文章我把当时聊的内容结合后来查的资料、自己对行业的观察系统地梳理一遍。这篇文章不会有太多虚的行业愿景重点是围绕部署形态和模型选型两个话题讲透再聊聊我眼中工业AI真正的机会在哪里。适合正在评估是否要在工厂引入AI质检、或者已经在试点但被部署问题卡住的朋友阅读。围绕这两个问题我想先给出一个总体的判断工业AI和消费互联网AI最大的区别在于环境约束。消费互联网里你部署一个AI服务考虑的是并发量、弹性扩容、用户体验工业现场里你部署一个AI系统要考虑的是产线停机损失、断网容错、数据能不能出厂、设备换型速度。这种约束差异决定了工业AI的部署形态和模型选型不能简单套用互联网那套思路。2. 服装检测这类视觉检测到底该用云还是单机2.1 这个问题的本质算力放在哪数据去哪云联网还是单机这个问法其实默认了两种二元对立的部署方式一种是把图像数据传到云端去推理另一种是全部放在本地的一台电脑或服务器上跑完。但在实际工业项目里这不是二选一的问题而是要根据场景需求做拆分。先讲清楚两种模式的差异对比维度纯云联网模式纯单机模式推理时延高取决于网络百毫秒到秒级低毫秒级数据归属数据出工厂上云不出厂本地闭环算力扩展弹性云端可扩容受限受硬件采购限制网络依赖强依赖断网即停摆无依赖部署成本低门槛起步按量付费前期硬件投入高运维复杂度云端统一管现场多设备分散管典型适用场景小批量抽检、远程复判、新品打样高速产线全检、涉密产线拿服装检测举例。服装面料检测的工况非常典型产线速度飞快一卷布过去相机连续拍照瑕疵可能只有几毫米比如断纱、油污、破洞、色差。这种情况下你不可能把每张图像都传到云端等网络回来一个结果产线早就跑出去了。现场控制用的PLC在等你给信号你把次品标记出来可能还要联动后面的裁剪设备。这个链路里推理必须发生在本地时延要控制在毫秒级最好是几十毫秒以内。所以当时直播的回答很直接凡是产线全检、节拍快的场景用单机或者边缘设备做实时推理是唯一靠谱的方案。但单机不是老式的一台GPU服务器堆在机房里而是边缘计算设备比如工业AI盒、带GPU的工控机直接部署在产线一侧。2.2 产线部署的三大约束决定了不能无脑上云很多人不理解为什么工业场景不能直接上云我总结了三大约束这就是为什么的根源第一时延约束。服装产线的检测节拍可能是一分钟几十件甚至上百件折算下来单件处理时间只有几百毫秒甚至更短。云端推理的时延由网络往返、排队、计算三部分构成即便最优情况下也要几十毫秒到上百毫秒而且网络波动不可控。产线上的控制逻辑不会等你超时就是停机或者漏检。第二断网约束。工厂的网络环境远没有写字楼稳定。电磁干扰、交换机故障、运营商链路波动都会导致断网。如果推理逻辑完全依赖云端断网就是全线停产。实际上产线一旦停下来每小时的损失可能抵得上你省下的那点算力费用。第三数据主权约束。很多工厂对于产品图像出不出厂非常敏感尤其是代工厂图纸、面料、工艺都是商业机密。哪怕你只是说数据传到云上训练绝对保密客户心里那关也过不去。这不是技术问题是信任问题。当时直播间有观众追问那是不是就完全不用云了也不是。云的用武之地在于训练而非实时推理。用一个比较常见的架构来描述云端负责训练模型、持续迭代产线边缘设备负责实时推理只有边缘设备判断为疑似异常的图像片段才回传云端做二次复判或积累成训练数据。这样既保住了实时性又让数据量变得可控。2.3 云-边协同的落地结构才是工业视觉检测的主流我参与过的几个服装质检项目部署结构基本都是下面这张图的逻辑我不会画图但可以用文字描述清楚产线相机 → 本地工控机跑推理模型 → 输出信号给PLC/机械臂 → 异常图像片段回传 → 云端数据平台存储、标注、训练新模型 → 定期下发新模型到边缘设备。这套结构的好处很明确日常生产不依赖外网断了网产线照跑云端只接收少量异常样本带宽压力小模型可以持续迭代越用越准。具体到服装检测场景还要考虑一个换型问题。服装厂可能上午做纯色T恤下午换一批条纹衬衫。不同面料和花色的缺陷特征差异很大模型如果只有一个换型后误检率会明显上升。所以边缘设备上最好按品类维护多套模型通过产线MES系统或者扫码枪读取工单信息自动切换对应模型文件。这一步做得好不好直接影响项目长期运行的稳定程度。小结一句服装检测这类实时产线应用推理在边缘训练在云端这是目前工程上的最优解。至于云端用什么算力初期可以先用云服务器按需租用数据量大了再考虑私有化部署训练集群。3. 工业缺陷检测要用多大的模型才够用3.1 先泼一盆冷水大模型不是产线检测的必需品聊完部署形态直播间第二个高频问题就是用什么大模型。大模型这个词在2024年以后几乎成了AI的代名词很多企业主一听AI质检第一反应就是是不是要买大模型那套东西。但我要给一个反直觉的结论目前产线上99%的缺陷检测任务靠的不是大模型而是中小规模的专用模型。为什么因为缺陷检测本质上是视觉任务的子集用的是目标检测、图像分割、图像分类这类技术。以服装检测为例你要找的瑕疵就那几类破洞、油污、断纱、色差、跳针。这是一个限定域问题检测对象非常明确不需要模型有广泛的常识和推理能力只需要它在特定图像分布下精准地输出这是什么瑕疵、位置在哪里、置信度多高。这个场景下一个几十兆到几百兆的轻量化检测模型经过足够的标注数据训练精度完全可以做到99%以上。而大模型的参数量动辄几十亿甚至上千亿在产线边缘设备上跑不起来推理成本也高得离谱。拿大炮打蚊子得不偿失。我在直播间给了一个比较极端的比喻你请一个博士来产线上数螺丝他也能数清楚但成本太高、速度太慢不如一个经过训练的熟练工。大模型就是那个博士专用小模型就是那个熟练工。3.2 什么时候才真正需要大模型那是不是大模型在工业AI里就完全没用了也不是。大模型的价值不在实时检测环节而在三个辅助环节第一少样本的异常描述与分类。新的瑕疵类型在产线上出现时往往只有几张样本图。传统小模型需要攒够数据才能训练出新类识别能力而多模态大模型比如能理解图像的视觉语言模型可以用零样本或少样本的方式先给出一个粗分类描述帮你判断这像是油污还是水渍减少人工定性分析的时间。第二质检结果的解释与报告生成。传统模型输出的是一个检测框类别标签但产线管理者和客户更想知道这批布为什么出现这么多断纱是原料问题还是设备张力问题。大模型可以把检测结果汇总成自然语言报告并结合历史数据给出初步归因分析这是它擅长的。第三产线换型时的快速配置。新品类上线时老师傅知道要看哪些地方容易出瑕疵但要把这些经验转化为检测规则需要时间。大模型可以辅助工程人员根据面料描述和工艺参数快速生成初始的检测逻辑或标注建议。一句话总结大模型干的是理解的活小模型干的是检测的活。理解层的更新频率低、实时性要求不高可以放在云端检测层的实时性要求高、运行频率高放在边缘设备上跑。两者不是替代关系是分工关系。3.3 一个实用的工业视觉模型选型参考下面这个表是我在实际选型时参考的思路分享给各位任务类型推荐模型架构适用场景部署位置高速产线实时缺陷检测YOLO系列v8/v11、RT-DETR、轻量级SSD布匹、钢板、印刷品在线全检边缘盒子/工控机精细分割瑕疵轮廓精确提取DeepLabV3、U-Net变体、Mask R-CNN精密零件表面缺陷、半导体晶圆检测边缘或本地服务器低置信度/复杂样本二次判定云上大模型API视觉语言模型边缘输出低置信度的疑难样本复判云端API调用缺陷知识问答/报告生成大语言模型RAG检索质检报告、缺陷归因分析、培训辅助云端/私有化服务器这里要多说一句很多企业一上来就想用最先进的模型但先进不等于合适。选模型要看三个维度产线节拍要求多少毫秒、边缘设备的算力上限是多少、标注数据量能达到什么规模。一个规划良好的项目往往是从一个成熟的轻量模型起步在真实数据上迭代到稳定再去考虑更复杂的架构。相反一上来就跑大模型数据量和硬件投入都撑不住项目很容易死在半路上。3.4 大模型能力不足时靠数据闭环弥补直播间有人问如果手上数据特别少是不是大模型反而更合适这个问题问到了点子上。新产线、新品类确实可能只有几百张标注图。这种情况下大模型的零样本能力是一种补充手段但不能作为正式检测方案。以工业实践来说我建议分两步走第一步用预训练通用视觉模型比如在ImageNet或大规模工业数据集上预训练过的模型做迁移学习。哪怕是几千张图也能训出一个七八成可用的一代模型先用起来在产线上跑。第二步把产线上自动采集的异常样本持续回流到标注池人工复判后不断微调模型。这里有两个核心指标要盯误检率好品被错杀和漏检率坏品流出。这两个指标有矛盾——压低漏检率会导致误检率上升反之亦然。实际项目里要根据客户的容忍度设阈值比如服装行业对漏检零容忍那就要允许一定的误检后续再通过人工复检消化。这个数据闭环一旦转起来模型的精度会随着产线运行时间越涨越高。我见过最夸张的一个项目模型上线三个月后误检率比初始版本降低了60%全靠现场数据的持续打磨。这个过程中大模型的价值在于提供初始能力但最终的精度提升还是靠现场数据迭代。4. 从设备侧往上看工业AI的下一个机会到底在哪4.1 共识在形成机会不是替代人而是增强人聊完部署和模型回到标题本身工业AI的下一个机会在哪。这个问题的答案过去几年行业里有过不同的声音。最早大家认为是替代人工质检员后来发现产线的环境复杂度远超预期单纯替代的路线走不通。现在的共识逐渐统一为AI不是把人从产线上赶走而是把老师傅的能力复制出来让一个普通操作员也能做到老师傅的判断水平。以服装检测为例一个经验丰富的质检员能同时判断出面料的色差、纹理缺陷、缝制瑕疵甚至能凭手感判断布面张力的异常。这些能力很难写进传统机器视觉的规则里但可以通过深度学习模型从大量标注数据中学习。AI系统部署后老师傅的精力被释放出来去处理AI无法判断的疑难样本去做工艺改进而不是盯着一块布看八个小时。这种人机协作的模式才是工业AI最务实的落地形态。机会自然也在其中——谁能把这种协作模式做好让一线工人真正觉得工具好用谁就能在市场上站稳脚跟。4.2 机会之一把检测能力延伸到工艺优化目前大多数工业AI项目只做到检出缺陷但下一个机会在分析缺陷反推工艺。还是拿服装检测说当AI连续多批次检测出同样位置的破洞时这不是简单的质检问题而是设备张力设置、针号选择、布料进货批次的问题。把AI检测结果与MES系统里的工艺参数打通用数据分析建立缺陷-工艺参数之间的关联这才是工业AI从眼睛进化为大脑的关键一步。这个方向需要的不只是算法工程师还需要懂工艺、懂设备的复合型人才。谁先打通这个闭环谁就能从卖检测设备升级为卖工艺优化方案价值量完全不是一个层级。4.3 机会之二中小企业市场——被忽略的可负担AI大工厂上AI质检已经不算新闻但大量中小工厂依然在用最原始的人工目检。原因很简单买不起也用不起。市面上的方案要么是一体化设备价格高要么需要专职算法工程师维护中小企业养不起。所以我看好轻量级可负担AI这个方向——把算法封装成开箱即用的标准产品让客户插上电就能跑不需要懂AI只需要会看屏幕上的红色标记。这个市场看着单价低但量大而且一旦形成规模效应数据积累带来的壁垒会很深这是工业AI下一个很实在的机会点。4.4 机会之三更垂直的行业大模型别误会这里说的不是通用的千亿参数大模型而是能在某个细分行业真正用起来、能落地到产线的垂直模型。比如服装检测行业如果能做出一个涵盖面料、裁片、成衣全流程的质检模型并且在多个工厂验证过稳定性那比做一个通用视觉大模型有价值得多。垂直模型的核心竞争力是数据壁垒。你在这个行业里跑得越久积累的缺陷样本、工艺知识就越多后来者想追不是堆算力就能追上的。这个机会属于那些愿意沉下心在细分行业里深耕的团队而不是追逐热点、什么行业都做两下就走的团队。5. 一个值得关注的趋势AI质检与柔性生产的结合最后聊一个我在直播末尾提到、但没来得及展开的趋势——工业AI检测与柔性生产的结合。近两年服装、电子等行业面临的一个普遍挑战是小批量、多品种的订单越来越多。一个车间可能上午做500件A款纯色T恤下午切换成300件B款条纹衬衫。传统的检测设备最怕换型因为每换一个产品就得重新调试甚至需要工程师到现场重新配置参数。而基于AI的视觉检测系统天然具备软件换型的优势模型切换只是一次文件加载识别逻辑不需要物理调整配合自动化的送料和分拣设备整个产线可以在短时间内完成产品切换。这个趋势对部署架构和模型选型提出了新的要求边缘设备的存储要能装下多品类模型模型加载流程要自动化和产线MES系统要打通数据接口。一个能适应快速换型的AI质检系统在这个需求下就不再是质检工具而是柔性制造的基础设施。我说这是机会是因为绝大多数做AI质检的团队目前的注意力都还在检测精度本身还没有多少团队真正把换型效率当作核心卖点来打磨。越是这种供需错位机会越大。基于我个人的观察和做项目的体会工业AI的机会不是掌握在那个最先进算法手里而是掌握在那些能把算法稳稳当当放进行业场景、能解决产线上那些细碎但要命问题的团队手里。大模型也好、边缘计算也好都不能替代你对一个行业的理解。真正把设备、数据、场景、工艺串起来讲出一个让客户看得懂、用得动、算得过账的故事这才是下一轮竞争里最稀缺的能力。