ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI看不见的劳动:多模态数据采集与过程标注实战

AI看不见的劳动:多模态数据采集与过程标注实战 1. 一个被忽视的真相AI眼中的世界缺了一块前阵子跟几个做数据标注和模型训练的朋友吃饭席间有人抛出一个问题现在的大模型能写代码、能画图、能分析财报但它知不知道你楼下那家早餐店的包子是怎么从面粉变成成品的桌上沉默了几秒然后大家开始七嘴八舌。有人说AI可以看视频学习有人说可以靠传感器数据但聊到最后我们发现一个尴尬的事实人类劳动在AI的认知体系里几乎是隐形的。这个判断不是拍脑袋来的。你仔细想想互联网上关于“劳动过程”的数据有多少一个建筑工人怎么绑扎钢筋、一个裁缝怎么量体裁衣、一个厨师怎么控制翻勺的火候这些知识绝大多数存在于人的身体记忆和师徒传承里根本没有被数字化。AI能抓取到的是劳动的结果——一栋楼的照片、一件衣服的成品图、一道菜的摆盘照但劳动的过程那些手指的力度、身体的节奏、临场的判断在训练数据里几乎是一片空白。这就是“Human labour is largely invisible to AI”这个命题的核心。它说的不是AI笨而是我们的数据世界本身就系统性地忽略了劳动过程。这件事影响的不只是AI研究它直接关系到每一个靠手艺和实操吃饭的人——当AI越来越深地介入生产环节那些“看不见的劳动”会面临什么是会被更好地记录和传承还是被进一步边缘化我写这篇东西就是想把这个问题的来龙去脉拆开结合我自己在数据采集和模型训练中踩过的坑给做AI产品、做行业数字化、做技能传承的朋友一些实在的参考。2. 为什么劳动过程在数据世界里“查无此人”2.1 劳动的本质是身体性的而数据采集天然偏向符号化我们先从根子上说。人类劳动尤其是体力劳动和手艺劳动它的核心特征是具身性——知识存在于身体里通过肌肉记忆、触觉反馈、空间感知来调用。一个木工刨木头他不需要在脑子里默念“角度15度、力度3牛顿”他的手知道该用多大劲。这种知识叫隐性知识是波兰尼那个经典比喻说的“我们知道的比我们能说出来的多”。而数字世界是怎么记录东西的靠符号。文字、数字、图像、音频这些都是符号化的载体。问题在于隐性知识很难被符号完整捕捉。你可以拍一个木工刨木头的视频但视频里丢失了触觉信息、力反馈信息、木材纹理的细微变化信息。AI看这个视频能学到“手在动”但学不到“手为什么这么动”。我做过一个实验让团队用动作捕捉设备记录一个老师傅打磨玉器的过程。设备精度够高了吧每秒120帧手部关节角度精确到0.1度。但把数据喂给模型之后模型能复现动作轨迹却完全无法判断什么时候该换砂纸、什么时候该加水、什么时候力度要收。因为这些判断依赖的是师傅指尖的触感而触感没有被采集。这就是数据采集的维度缺失——我们采了“形”没采“感”。2.2 互联网的内容生产逻辑天然排斥劳动过程再往深一层看互联网上为什么劳动过程的内容少因为内容生产的激励机制不奖励过程。你发一个“十分钟学会换轮胎”的视频流量大概率不如“十分钟看完一部电影”。平台算法偏好的是高完播率、高互动率的内容而劳动过程往往冗长、重复、缺乏戏剧性。一个厨师炒一百盘同样的菜前九十九盘都是“无效素材”只有第一盘和第一百盘可能有看点。这就导致了一个恶性循环劳动过程内容少→AI训练数据里劳动过程样本少→AI对劳动过程的理解能力弱→基于AI的工具和产品对劳动过程支持差→劳动者更没动力去记录过程。我认识一个做非遗数字化保护的团队他们花了三年时间采集了上千小时的刺绣过程视频结果发现这些数据在公开互联网上几乎找不到因为平台不给流量创作者没收益最后只能躺在硬盘里。还有一个更隐蔽的问题劳动过程的知识产权归属模糊。一个师傅的独门手法拍成视频发出去别人学了去师傅的竞争优势就没了。所以很多真正有价值的劳动知识是被刻意保护起来的不会进入公共数据池。AI能学到的往往是那些已经被标准化、去技能化的劳动过程比如流水线拧螺丝因为这种过程不怕被学。2.3 标注体系的偏见AI只认“结果”不认“过程”就算我们采集到了劳动过程数据还有一个标注的坎。现在的AI训练尤其是监督学习极度依赖标注。标注什么标注结果。一张图里有猫标“猫”一段视频里有个人在走路标“行走”。但劳动过程的标注要复杂得多——你要标“手腕发力”“重心转移”“呼吸节奏”这些标注维度在现有的标注体系里根本没有标准。我参与过一个工业质检AI的项目目标是让模型判断工人操作是否规范。我们一开始让标注员标“动作是否正确”结果标注一致性极低不同标注员对同一个动作的判断差异超过40%。后来我们改成标“动作轨迹是否符合预设路径”一致性上去了但模型学到的只是“轨迹像不像”而不是“操作好不好”。因为“好”这个判断涉及太多隐性维度标注员自己也说不清。这里有个关键认知AI的“看不见”不是技术能力问题而是数据基础设施问题。我们建了一套以结果为导向的数据体系劳动过程在这个体系里没有位置。3. 看不见的劳动正在被AI以三种方式“误伤”3.1 自动化替代只替代“看得见”的部分留下更难的“看不见”部分很多人担心AI替代人类劳动但实际情况更微妙。AI替代的往往是劳动过程中已经被符号化、可量化的那部分。比如一个仓库拣货员他的工作包括“找到货架”“识别商品”“搬运”“扫码”“放置”。其中“识别商品”“扫码”是看得见的容易被自动化“找到货架”“搬运”“放置”涉及空间判断和身体协调反而更难替代。结果是什么劳动者的工作被“切片”了。容易自动化的部分被机器拿走剩下的部分变得更碎、更累、更难以形成完整技能。我见过一个物流仓库上了自动分拣线之后拣货员的工作变成了“处理机器分拣不了的异常件”。这些异常件之所以异常往往是因为包装破损、标签模糊、形状不规则处理起来比正常件麻烦十倍。工人的技能没有升级反而被降级成了“异常处理工”。3.2 绩效评估AI用“看得见”的指标衡量“看不见”的劳动第二个误伤来自绩效评估。现在很多企业用AI做绩效管理采集的指标是什么产出数量、完成时间、错误率。这些指标能反映劳动结果但反映不了劳动过程中的隐性付出。一个客服人员他花十分钟安抚一个愤怒的客户和花十分钟机械回复十个标准问题在AI的绩效系统里可能后者得分更高因为“处理量”更大。但前者的劳动价值——维护客户关系、避免投诉升级——在数据里是看不见的。我有个做呼叫中心的朋友他们上线了一套AI质检系统自动分析通话录音给客服打分。系统上线三个月后客服团队的整体满意度反而下降了。原因很简单客服们发现系统奖励的是“语速快、话术标准、通话时长短”而不是“真正解决问题”。于是大家开始追求“快速结束通话”把复杂问题推给下一环节。AI看不见“耐心倾听”和“共情回应”的价值因为它没有被标注为绩效指标。3.3 技能传承AI学不会的人也快忘了第三个误伤最深远。当AI成为主要的知识载体那些AI学不会的劳动技能会逐渐失去传承渠道。年轻人学手艺以前靠师傅带徒弟现在靠看视频、查资料。但视频和资料里没有的东西——比如手感、火候、时机——AI给不了人也给不了。我认识一个做传统木工的老先生他说现在来学木工的年轻人第一句话往往是“有没有教程”。他说“教程能教你锯直线但教不了你什么时候该换锯条。这个‘什么时候’我当年是看我师傅换了我才知道。现在没人看了因为大家都在看手机。”这句话让我想了很久。AI看不见的劳动不只是AI的问题它正在改变人类传承劳动的方式。当“可见”的知识被AI高效传播“不可见”的知识反而加速流失。4. 让劳动“可见”三条可落地的技术路径4.1 多模态采集把触觉、力觉、空间感纳入数据管道要让AI看见劳动第一步是采集更丰富的信号。传统的视频和图像不够需要引入多模态传感。具体来说至少包括力觉传感在工具或手套上安装力传感器采集施力大小、方向、持续时间。比如打磨、拧螺丝、揉面这些动作力觉数据是关键。触觉传感用触觉阵列传感器采集接触面积、压力分布、纹理变化。这对判断“手感”至关重要。惯性测量用IMU采集肢体加速度和角速度还原动作的动力学特征。眼动追踪记录劳动者在操作过程中的视线焦点和转移路径这能反映“注意力的分配”是隐性知识的重要维度。我参与过一个面点师技能数字化的项目我们在擀面杖上装了力觉传感器在案板下装了压力阵列在师傅头上戴了眼动仪。采集了三个月数据之后我们发现一个有意思的规律师傅在擀面时视线焦点不是固定在面团上而是在面团边缘和擀面杖之间快速切换。这个“切换频率”和面皮的均匀度高度相关。这个发现靠视频是绝对看不出来的。实操建议多模态采集的难点不在传感器本身而在时间同步。不同传感器的采样率不同力觉可能1000Hz视频只有30Hz眼动可能60Hz。必须做硬件级的时间戳对齐否则后期融合会出大问题。我们当时用了一个FPGA做硬件触发所有传感器共用一个时钟源才解决了这个问题。4.2 过程标注从“结果标签”转向“动作单元”采集了数据下一步是标注。传统的标注是给结果打标签现在需要给过程打标签。我推荐的做法是借鉴动作单元的思路把连续劳动过程切分成离散的动作单元每个单元标注其功能、力度、节奏、注意事项。具体操作流程动作分割用算法或人工把劳动过程切分成有意义的片段。比如“拿起工具”“定位”“施力”“检查”“调整”五个单元。单元标注对每个单元标注多个维度。以“施力”为例标注力度等级轻/中/重、施力方向、持续时间、身体姿态。关系标注标注单元之间的依赖关系。比如“调整”单元往往发生在“检查”单元发现偏差之后。质量标注标注这个动作单元的执行质量是“标准”“勉强”还是“错误”。这套标注体系我们在一家汽修厂试点过用来训练AI判断钣金修复操作是否规范。效果比传统的结果标注好很多因为模型能学到“哪个动作单元出了问题”而不是只判断“最终结果好不好”。4.3 仿真与迁移用数字孪生补足稀缺样本劳动过程数据有个天然问题样本稀缺。一个师傅一天可能只做几次高难度操作采集一年也攒不够训练数据。这时候需要数字孪生和仿真迁移来补足。具体做法是先基于采集到的真实数据在仿真环境里重建劳动场景。比如一个焊接场景仿真里可以调整电流、电压、焊速、角度、材料厚度等参数生成大量“虚拟焊接过程”。然后把这些虚拟数据与真实数据混合训练让模型学到更泛化的劳动过程理解能力。这里的关键是仿真参数的标定。仿真不能瞎设参数必须用真实数据反推。我们当时用了一个优化算法以真实采集的焊接电流和熔池形态为目标反向求解仿真里的热传导系数和材料参数。标定之后仿真数据的分布和真实数据接近了迁移效果才出来。技术路径核心解决的问题主要难点适用场景多模态采集数据维度缺失时间同步、传感器标定手工艺、精密操作过程标注标注体系缺失标注一致性、标注成本工业质检、技能培训仿真迁移样本稀缺参数标定、仿真真实性高风险、高成本操作5. 实操复盘一次劳动过程数字化的完整记录5.1 项目背景与目标设定去年我参与了一个陶瓷拉坯技艺的数字化项目。目标很明确把一位从业四十年的老师傅的拉坯过程完整记录下来训练一个AI模型能够判断拉坯过程中哪些动作会导致器型偏差。这个项目的难点在于拉坯是高度依赖手感的劳动泥土的湿度、温度、可塑性都在变化师傅的每一个动作都是实时调整的结果。我们设定的技术指标是采集至少200次完整拉坯过程每次过程包含视频、手部力觉、泥料湿度、转盘转速四路数据标注至少5000个动作单元模型对“器型偏差”的预测准确率超过85%。5.2 数据采集方案与现场踩坑采集方案我们改了三次。第一版方案是在师傅手上贴力觉传感器结果师傅说“贴了东西就不会拉了”数据全是废的。第二版方案是在拉坯机下面装压力板但压力板只能测总压力测不到手指的局部施力。第三版方案是定制了一副薄手套在指尖和掌心嵌入柔性力觉传感器厚度控制在0.5毫米以内师傅试了之后说“勉强能接受”。现场踩的坑更多。最大的坑是泥料湿度变化。我们一开始没有实时监测湿度结果发现同一批数据里前半小时的泥料湿度和后半小时差异很大导致模型学到的“施力模式”其实是湿度变化的混淆。后来加了一个湿度传感器每30秒采一次把湿度作为协变量纳入模型效果才稳定下来。还有一个坑是转盘转速的干扰。拉坯机的转速不是恒定的师傅会根据器型调整转速。我们一开始把转速当成固定值处理结果模型在转速变化时预测完全失效。后来把转速作为输入特征并且做了归一化才解决了问题。5.3 标注体系的设计与迭代标注体系我们迭代了四版。第一版是让师傅自己标标“这一步在干什么”。师傅标得很随意一致性很差。第二版是让三个标注员独立标然后取多数投票。一致性上去了但标注速度太慢标一次拉坯要花四个小时。第三版是先用算法做预分割标注员只做修正。速度提升到一小时但预分割的准确率只有70%修正工作量还是很大。第四版我们换了个思路让师傅和标注员一起标。师傅操作标注员在旁边问“这一步为什么这么做”“如果泥料干一点会怎样”。师傅边做边解释标注员记录。这样标出来的数据不仅有了动作标签还有了决策理由。这些理由后来成了模型解释性的重要来源。比如模型判断“器型会偏”它会输出“因为第37个动作单元的施力方向与泥料湿度不匹配”这个解释就是来自标注时师傅的原话。5.4 模型训练与效果验证模型我们用的是时空图卷积网络输入是四路数据的融合特征输出是器型偏差的预测。训练集用了180次拉坯过程验证集20次。最终模型在验证集上的准确率是87.3%比目标高了2.3个百分点。但更有意思的是错误分析。模型预测错的那些案例我们回看数据发现大部分是师傅“故意做错”的——他在尝试新的器型或者泥料本身有问题他在补救。这些“异常”过程在训练数据里很少模型没见过所以预测不准。这反过来印证了一个观点劳动过程中的“异常处理”是最难数字化的部分因为它依赖的是即时的、创造性的判断而不是标准化的动作。这个项目给我最大的教训是不要试图把劳动过程“标准化”。劳动的魅力恰恰在于它的灵活性和情境依赖性。AI要学的不是“标准动作”而是“在什么情境下做什么调整”。这需要完全不同的数据采集和标注思路。6. 常见问题与排查技巧实录6.1 采集阶段传感器干扰与数据质量问题一传感器影响操作这是最常见的坑。任何贴在身上的传感器都会改变劳动者的操作习惯。我的经验是传感器越轻、越软、越无感越好。如果实在做不到无感就要留出足够的适应期。我们当时让师傅戴着手套练了一周等他完全习惯了才正式开始采集。问题二数据漂移长时间采集会出现数据漂移。力觉传感器会温漂视频会有光照变化湿度传感器会受环境影响。解决办法是定期校准和采集参考信号。我们每采集一小时就让师傅做一个标准动作比如空手捏一下作为校准参考。问题三多设备同步失败多模态采集最怕时间不同步。我们踩过的坑是视频和力觉数据的时间戳差了200毫秒导致模型学到的“施力-动作”对应关系完全错位。后来用硬件触发解决了但前期浪费了两周数据。6.2 标注阶段一致性与成本控制问题四标注员不理解劳动过程标注员往往没有相关劳动经验标出来的东西“形似神不似”。解决办法是让标注员先体验。我们让标注员自己试着拉坯拉了半天拉不出一个像样的碗之后他们标注时明显更谨慎了。问题五标注成本失控过程标注比结果标注贵十倍不止。控制成本的关键是分层标注先粗标把明显无意义的片段剔除再精标只标关键动作单元。我们最后只精标了30%的数据模型效果已经够用了。6.3 模型阶段过拟合与泛化难题问题六模型在训练集上很好换个人就废这是劳动过程数据的通病。不同人的操作习惯差异太大模型容易过拟合到特定人的风格。解决办法是多主体采集和风格归一化。我们采集了三位师傅的数据用对抗训练让模型学“与风格无关”的特征。问题七模型无法解释判断依据工业场景下模型说“这个操作有问题”但不说为什么工人不会服气。解决办法是引入注意力机制和决策理由标注。让模型输出“哪个动作单元导致了判断”工人才能针对性改进。问题类型典型表现排查思路解决技巧传感器干扰操作变形、数据异常对比无传感器时的操作轻量化、适应期数据漂移模型效果随时间下降检查传感器基线定期校准、参考信号同步失败动作与信号错位检查时间戳对齐硬件触发、统一时钟标注不一致标注结果差异大计算标注者间一致性体验式培训、分层标注过拟合换人效果骤降交叉验证不同主体多主体采集、对抗训练解释性差工人不信任模型检查输出可解释性注意力机制、理由标注7. 这件事对做AI产品和行业数字化的人意味着什么7.1 产品设计从“替代人”转向“增强人”如果你在做AI产品尤其是面向工业、服务业、手工艺领域的产品我建议把思路从“替代人”转向“增强人”。AI看不见的劳动过程恰恰是人的核心价值所在。产品应该做的是放大这部分价值而不是试图用标准化动作去覆盖它。具体来说可以做实时过程反馈。比如在工人操作时AI通过多模态传感实时分析动作在关键节点给出提示“力度偏大”“角度偏了2度”“该换工具了”。这种产品不替代工人的判断而是辅助工人做得更好。我见过一个做焊接辅助的团队他们的产品就是在焊工操作时通过AR眼镜显示熔池温度和建议焊速焊工反馈很好因为“它不抢我的活它帮我干得更好”。7.2 数据战略把劳动过程数据当成核心资产如果你在做行业数字化我建议把劳动过程数据列为战略资产。现在大多数企业的数据战略关注的是交易数据、客户数据、设备数据劳动过程数据几乎没人管。但恰恰是这部分数据包含了企业最核心的隐性知识。我建议的做法是建立劳动过程数据采集的常态化机制。不是搞一次项目就完了而是把采集设备、标注流程、存储规范都固化下来让劳动过程数据像财务数据一样被持续记录。这件事短期看不到回报但长期价值巨大。等AI能力进一步渗透到生产环节谁有劳动过程数据谁就有训练行业模型的资本。7.3 技能传承用AI做“隐性知识的显性化”最后说回技能传承。AI看不见劳动但AI可以帮我们看见劳动。通过多模态采集和过程标注那些原本只存在于师傅身体里的隐性知识可以被部分显性化、可传承化。我见过一个做中医推拿数字化的项目他们用压力传感手套采集推拿师的手法把“揉”“按”“推”“拿”这些动作的力度、频率、轨迹都记录下来然后做成教学系统。学员戴上手套练习系统会实时反馈“力度不够”“频率太快”。这个项目的价值不在于AI替代推拿师而在于让推拿教学从“口传心授”变成了“数据辅助”。师傅的经验被部分保留下来了即使师傅不在了数据还在。这件事的深远意义在于当AI让劳动过程变得可见我们实际上是在为未来的劳动建立档案。一百年后的人回看我们这个时代他们不仅能看到我们生产了什么还能看到我们是怎么生产的。那些原本会消失的劳动细节被数据留住了。我个人在实际操作中的体会是做劳动过程数字化最难的不是技术而是让劳动者信任你。师傅们一开始都很警惕怕被“偷师”怕被“替代”。你得花大量时间跟他们泡在一起让他们明白你做的是记录和传承不是替代和剥夺。信任建立了数据才真实项目才做得下去。最后再分享一个小技巧如果你要开始做劳动过程采集别一上来就搞多模态。先用最简单的单路视频加上师傅的口述录音把过程跑通。等师傅习惯了被记录再逐步加传感器。我见过太多项目一上来就堆设备结果师傅不配合数据全是废的。慢就是快这句话在劳动过程数字化里特别成立。
返回列表