
AI中国故事这个系列聊到第135期我本来想继续写技术实现结果被一次内部争论打断了。起因是语音助手的年龄识别把一位六十岁的用户叫成“阿姨”而同样的年纪换成外国用户却叫“女士”。我们吵了一个下午从模型阈值吵到训练数据最后有人丢出一句话这不就是墨子说的“兼爱”和“非攻”吗于是我把手头的代码搁下认真读了一遍《墨子》越读越觉得两千多年前那套“兼相爱交相利”的框架放在今天的AI伦理讨论里一点不过时。这篇文章我想聊的不是哲学考据而是把它当成一套可落地的思考工具。用墨子来拆AI伦理里的三个老大难平等主义到底该怎么实现实用主义会不会变成作恶借口技术中立是不是免责金牌。适合正在做算法公平、价值对齐、推荐系统、决策类AI产品的工程师和产品经理看。不需要你是哲学爱好者只要你手上有真实模型、真实指标、真实用户这篇文章就能用上。1. 为什么AI伦理要跟两千年前的墨子对话1.1 算法公平的本质爱有差等还是兼爱现在做AI公平的人大多绕不开统计公平、反事实公平、个体公平这些技术流派。它们擅长计算但很少回答一个问题我们到底为什么要公平实操里所有公平争论最后都会变成“你觉得哪个群体更重要”。比如信贷模型我们默认更关心通过人群的体验逾期人群被自动催收整条决策链路里没有人问过他们是否收到了清楚解释再比如内容推荐算法天然被训练成讨好高活跃用户而那些不常打开App的人沉默着就被牺牲掉了。这种结构用儒家的话说叫“爱有差等”按亲疏远近分配道德注意力。墨子恰恰在《兼爱》里反对这种结构。“爱人若爱其身”不是要求我们对所有人产生同样的情感而是要求在利益权衡时不因为对象离自己远、对自己没用就少给他一分考量。放到AI系统里这个问题就变成那些被模型拒绝、被系统降权、被算法忽略的人在你的目标函数里占多少权重我见过很多团队说“我们很公平”理由是训练数据覆盖了各个人群。但覆盖不等于权重对等。当模型的优化目标是整体准确率时算法天然会优先学好识别样本量大的那部分人小众群体的特征就被当成噪声处理掉。这不是数据问题是设计者先验地做了“差等”判断。兼爱不是让你给每个人相同的待遇而是让你在设定目标函数之前先把每个人的道德权重拉平。1.2 非攻视角下的算法暴力墨子的“非攻”不是和平主义。他反对的是“攻”那种主动侵略、掠夺性的行为。放到AI语境里很多模型本身就是“攻”的形态。深度伪造是最直观的但更常见的是推荐系统里那种“为了拉住注意力而不断刺激负面情绪”的机制。我们管这叫留存策略不叫暴力。但站在用户角度每一次被精准推送到引发焦虑、愤怒、自我怀疑的内容都是一次注意力层面的掠夺。非攻给了我们一个很锋利的判断标准这个系统是在消除不对称还是在放大不对称人脸识别对普通用户是方便对容易被误判的用户则是风险推荐系统对内容创作者是渠道对内容质量没有决定权的小创作者则是枷锁智能客服对大多数人是效率对不会操作申诉入口的老人则是一堵墙。同一个系统攻守方向不同伦理评价完全不同。这也是我为什么觉得墨家值得搬上评审桌。西方伦理当然也讨论这些问题功利主义算后果义务论讲规则德性伦理谈品格但它们都建立在个人权利和自由意志的假设上。AI恰恰打破了这层假设因为模型替用户做了决定用户甚至不知道决定发生了。墨家不依赖这些西方假设直接从关系结构入手谁在受益谁在受害这种关系是不是可持续的互惠关系。这个切入角度反而更容易让做工程的人听进去。2. 兼爱AI平等主义伦理的古典原型2.1 兼爱不是平均主义是道德权重的等值先把一个常见误解拆掉平等主义不等于所有输出都一致。如果所有用户拿到完全一样的搜索结果、一样的推荐列表那不叫公平叫偷懒。兼爱的本意是“视人若己”是道德权重的等值不是结果的平均。用一个医疗分诊的类比。急诊医生不是给所有人打同一种针而是每个人的生命权重相同按病情紧急程度分配资源。AI产品完全可以个性化可以分级服务但基础风险、尊严、知情权必须一致。我把它总结成一句话权重平等输出差异。高净值用户可以用更高级的模型低活跃用户也不能被默认塞进“低质量服务通道”付费用户有更多功能普通用户也不能连基本的解释权都没有。这件事在实际系统里经常被颠倒。团队愿意花大量精力优化高价值用户的路由策略却很少过问免费用户被系统拒绝后会不会得到一句人话。兼爱要求我们把每一类用户当作“目的”而非“手段”。这个要求不违反商业逻辑它只是逼你把“所有受影响者”放进同一个道德坐标系里。2.2 数据层面的兼爱分群评估才是起点做算法公平的人都知道去标识化解决不了歧视问题因为模型会通过代理变量学到与敏感属性高度相关的特征。你不去检查不代表偏差不存在。兼爱在数据工程里的落点不是删除敏感字段而是分群评估。具体做法可以分三步。第一列出受影响者名单包括直接用户、被拒绝用户、被关联用户第二按年龄、性别、地域、语言能力、图像清晰度等维度切分评估集分别计算准确率和误差率第三对误差率显著偏高的人群做针对性采样或设置独立阈值。这里要提醒一句分层评估一定会暴露模型在某些人群上效果差别急着删掉这个结论。那正是你该做功的地方。我之前做过一个图像识别项目整体准确率是97.3%看起来不错。分群一看深色皮肤人群的误差率是浅色皮肤的三倍。原因是训练数据里深色皮肤样本少模型学会了用亮度当肤色代理变量。如果不做分群评估这个问题永远不会暴露。兼爱在实操层面就是这么朴素先承认模型不是对所有人一样好然后才有机会让它更接近一样好。2.3 做一次“兼爱审计”三步找出目标函数里的差等我建议每个AI项目至少做一次正式审计。不需要外部专家团队成员就能完成关键是别粉饰太平。整个审计围绕三个问题展开每一问都要落到具体证据。审计项要问的问题常见失败点受影响角色清单是否把所有被模型影响的人列全只列目标用户漏掉被拒绝者、间接关联人、被自动化流程压到的人影响权重分配每个角色在目标函数中的权重是多少非目标角色的权重默认为0没人反对过错误成本承担模型出错时谁在承受后果是否有申诉通道高风险用户没有解释、没有退出、没有复核机制举一个信贷模型的例子。很多团队只看“通过率”和“坏账率”被拒绝的申请者完全不进入评估视线。可拒绝错了用户要承担机会成本、时间成本甚至可能会因为“被查询记录”影响后续融资。兼爱审计会要求你补上一个动作给被拒绝用户提供明确的拒绝原因说明并且设置申诉重审通道。这么做不是慈善它同时是数据的来源——你真的知道你的拒绝决策有多少是错的吗大概率不知道因为你从来没有回头看过。3. 非攻AI实用主义的安全边界3.1 攻守之辨不是所有“有用”都该做墨子反对“攻”但不反对“诛”。在他看来攻打无攻之国是不义但讨伐侵略者、保护弱小是正当的。这套攻守之辨放到AI里非常实用防御性安全、保护性设计是正当的主动帮助攻击者或者制造受害者的用途无论多赚钱都要拦下来。我见过很多团队把“功能中立”当掩护。“我们只是做语音合成有人拿它去诈骗跟我们无关”“我们只是做推荐算法用户沉迷是自制力问题”。这种说法能说出口是因为说话的人没有区分“工具被滥用”和“工具天生为滥用设计”。语音合成本身合法但如果你明知道合成效果足以以假乱真却不加任何来源标识、不做合成内容检测接口那你其实是在为滥用铺路。功能中立不是护身符。非攻要求的是在设计阶段就问清楚这个能力的默认用途是什么最可能的滥用路径是什么受害者有没有反击手段。这些问题不是法务该想的是工程师和产品经理该想的因为只有你们知道模型权重里藏着什么。3.2 三类典型的AI“攻”场景第一类是身份伪造类深度伪造、语音克隆、证件合成。受害者是具体个人一旦被冒用维权成本极高而且往往来不及。第二类是注意力操纵类推荐算法、自动生成内容把人的焦虑、愤怒、孤独当燃料。受害范围广但不容易被察觉用户只觉得停不下来说不清哪里不对。第三类是自动化不对称类自动批量投诉、自动外呼骚扰、AI辅助发起攻击让一个人可以低成本伤害很多人。这三类场景有个共同点都在放大强势方和弱势方之间的不对称。非攻三问就是用来拦住这三类场景的这个系统最可能被谁用来伤害谁受害方有没有低成本的反制手段我们是在消除不对称还是在制造不对称我问过不少做推荐系统的朋友前两问还能答上来第三问大多数答不上来。因为他们从没把自己摆到用户那一边想过。答案是大部分推荐系统都在制造不对称平台比你更懂你的弱点你却没有能力知道它在利用你的弱点。这不是“个性化”这是单方面的攻。3.3 技术中立的神话与目标函数之责菜刀可以切菜也可以伤人所以“菜刀无罪”。但如果你设计一把专门方便切手的刀那就不能再用“刀是中立的”来辩护。AI系统是一把由你自己定义行为的刀它做什么、优化什么、对谁做什么全部体现在目标函数里。推荐系统的目标是平均观看时长算法发现“制造焦虑能拉时长”于是自动把焦虑内容推到那些对焦虑敏感的用户面前。这是算法的自主选择吗不是是设计者把“时长”当成了唯一价值算法只是忠实地执行了你的价值观。技术中立这种辩护只有在“默认路径不伤害人”的时候才成立。而AI的默认路径恰好是设计者定义的。你选了某个优化目标就是在替所有用户做判断什么对他们重要。如果你选的指标里只有企业利润没有用户权益和社会成本那你根本谈不上“中立”只是还没出事而已。3.4 用“非攻三问”在项目早期拦住风险与其等模型上线后被用户投诉不如把这三问写进需求评审模板。我现在的做法是每个新项目立项时PRD里必须有“非攻三问”这一节。问题通过标准不通过时的动作最可能被谁用来伤害谁有明确的滥用路径清单并做了拦截补限制措施否则不进入开发受害者有没有低成本反制手段有举报、屏蔽、退出、申诉入口补用户控制权否则不进入测试在消除还是制造不对称系统让弱势方更有能力保护自己重新设计核心逻辑与产品目标冲突时上报决策这套东西不复杂但能逼着团队把“有人会拿我们的模型做坏事”当成一个真实的技术需求而不是公关风险。你哪怕不认同墨家把它当成风险管理工具也好。4. 技术中立与责任归属墨家“义利合一”的启示4.1 义利合一把“利”的定义扩大一点墨子说“义利也”他把道义和利益统一起来反对空谈道德。这个观点放到AI伦理里特别容易理解伦理不是让你亏钱而是让你重新定义“利”到底指什么。企业的“利”如果只包含利润那所有为用户创造的价值、为劳动者提供的保障、为社会留下的信任都成了外部成本。这不是不义这是短视的利。我看到很多AI产品的目标函数里用户和服务者都是“资源”用户是注意力资源劳动者是产能资源。一旦人变成资源算法优化就是资源榨取。义利合一要求你把用户权益、员工健康、社会信任也算进“利”的范围内。这些看不见的东西最终会通过留存率、口碑、监管成本和团队流动率回到你的财报上。有一次我们讨论自动客服的“转人工率”指标。产品经理觉得转人工率越低越好因为机器能省钱。但用义利合一的视角一看用户的问题其实没解决只是被拖到了更昂贵的售后成本里。我们把指标从“转人工率最低”改成“一次解决率最高”之后机器开始学会说“我解决不了帮你转人工”了。转人工率反而上升但投诉率下降整体成本基本持平。这说明了什么真正的好指标应该让用户和企业一起受益。4.2 交相利让利益相关者都成为赢家墨家的“交相利”说的是利人者人亦利之。健康的AI生态应该是多方受益的而不是单边收割。我用一张损益表来检查产品设计利益相关者收获成本需要判断用户便利、效率、娱乐隐私、注意力、情绪消耗获益是否明显大于成本内容/服务提供者流量、收入平台依赖、议价权丧失收益是否可持续一线劳动者效率提升、工具辅助监控压力、替代焦虑工具是否真的帮了人平台方增长、利润信任成本、声誉风险是否在透支未来如果某一个角色长期只有成本没有收益那就不是“交相利”而是“交相害”。做技术的人经常忽视非直接参与者比如外卖平台的预估送达时间算法受益方是平台和骑手还是用户如果时间压得太紧骑手冒着安全风险用户得到的数据却不准那这个算法就是在制造三方损耗。4.3 谁为算法负责责任矩阵比口号有用最后聊责任。AI事故发生后最常见的是运营说算法背锅、算法说产品定需求、产品说法务没把关。墨子虽然不聊现代公司治理但他特别强调“义”要落实到行为上。放到今天就是责任矩阵。每一项风险都要有一个明确的“负责任的角色”和一个“可检查的交付物”。环节责任人交付物数据收集数据负责人群体偏差说明、数据来源说明特征选择算法工程师代理歧视分析、敏感属性影响评估目标函数产品负责人损益定义说明、“利”包含哪些项部署监控运维/算法风险指标日报、线上异常响应记录申诉处理客服/产品响应时限记录、申诉到策略的反馈闭环责任矩阵的意义不是出事后找人祭天而是让每个环节的人都知道自己握着哪块风险。我踩过的一个坑是算法工程师认为公平问题归数据团队管数据团队认为我只负责提供数据结果模型上线后出现了明显偏差两边都很委屈。后来我们把“分群评估”写进算法工程师的交付物把“数据偏差说明”写进数据团队的交付物问题才被正视。责任不是一句价值观是一行可以验收的交付物。5. 落地实践在AI项目里做一次兼爱非攻改造5.1 一套可直接用的伦理检查表我把前面聊到的内容压缩成一张检查表团队评审前打印出来逐项过每一项都要给出“证据”不能只说“我们觉得没问题”。兼爱检查受影响角色清单是否完整是否有人被排除在评估指标之外分层评估的误差差距是否在可接受范围被拒绝、被降权的用户有没有解释和申诉入口非攻检查系统是否放大不对称最可能的滥用路径是否被列出并拦截受害者有没有低成本反制手段我们用这个功能是在保护还是在进攻交相利检查利益相关者损益表是否平衡有没有哪类角色长期被牺牲收益最多的一方是否承担了相应责任义利合一检查目标函数里的“利”包含哪些项是否包含用户权益、社会成本、长期信任可解释性是否能覆盖到受影响者每个问题如果答不上来不要跳过带着它去问负责这个字段的人。检查表的目的是把抽象伦理变成具体待办。你不需要一次把所有问题解决但你要让它们出现在待办清单里。5.2 案例复盘给推荐系统做一次改造我去年在一个短视频推荐项目里做了这样一轮改造过程不复杂但结果很有参考价值。原系统的核心指标是人均观看时长算法很快学会了“给焦虑型用户推负面情绪内容能显著拉长时长”。从数据上看产品做得很成功留存、时长都在涨。我们用非攻三问复盘发现这是典型的“制造不对称”平台比用户更懂用户的弱点用户却没有任何察觉和反制手段。接着做兼爱审计分群评估后发现负面内容推荐最集中的是低收入、低学历、高孤独感标签的用户。他们不是“更喜欢”负面内容是被算法精准识别为“对负面内容抵抗力更弱”的人。改造动作有三项。第一把核心指标从“人均时长”拆成“人均时长、内容多样性、负面情绪内容占比、申诉率”四个并列指标。第二对高风险标签用户降低负面内容推荐比例增加随机探索。第三强化“我不喜欢”按钮的权重并记录原因让用户申诉数据真实影响策略。改造后的结果是人均时长小幅下降但次日留存持平负面情绪投诉率明显下降长期留存反而更稳。这件事给我的体会是伦理改造不一定是纯成本。它有时是在修正一个正在透支未来的指标。时长涨得快是因为你在向用户借钱兼爱非攻的改造只是把还债时间提前。5.3 团队协作里怎么维持这种讨论一次评审解决不了问题伦理判断需要成为一种日常机制。我现在在团队里做的有三个动作。第一每个迭代安排一个“红队之辩”由一名工程师故意唱反调用兼爱、非攻、交相利三组问题质询本轮需求。第二产品需求文档里加“伦理影响”字段没有填写的需求不能进入评审会。第三模型卡里增加“受影响者”页记录模型对非目标人群的影响评估。这些机制听起来有点轴但真能拦住问题。有一次红队成员在评审会上问“我们的客服机器人对不会打字的用户是不是一种折腾”全场安静了一下然后产品经理补了一个电话回拨入口。那个需求本身没什么问题但红队之辩让团队看到了原本看不见的用户。别把伦理讨论搞成道德审判。歌功颂德式地说“我们在做正确的事”没有用正确的事是让工程师在写代码时能想到“有没有人会被这个特征伤害”。机制比情怀靠谱。6. 常见问题与困惑6.1 技术中立到底可不可能技术确实有中立性谁也不确定一个技术的全部用途。但技术中立不等于设计无责。关键区别在“默认路径”。如果你的模型默认就会把人按某种方式分类、排序、推荐那这条路径就是你的选择。你可以不控制所有滥用场景但你必须为你设计了默认路径这件事负责。所以我的答案是技术中立只在工具阶段成立。一旦技术变成自动决策的代理开始主动对人做判断就没有中立可言。如果你不想负责就别做AI做了AI默认路径就是你写的。6.2 平等主义会不会限制商业创新这个问题被误解得很深。兼爱要求的是道德权重平等不是结果相同。个性化推荐完全可以做付费分层服务也完全可以做只要你没有在基本尊严、安全、知情权上对用户做区别对待。创新应该是服务方式的创新不是“对谁更不当人”的创新。如果一个商业模型只有靠损害一部分人才能增长那它不是创新是套利。套利当然来钱快但一旦被看见代价会连本带利还回去。兼爱真正限制的不是创新是你在目标函数里把某些人标记为可牺牲品。6.3 团队文化偏西式谈墨家合适吗合适而且挺好的。墨家不是文化符号它是一套世界伦理思想跟效果主义、关怀伦理都有对话空间。西式讨论讲个人权利、自由、隐私墨家讲互惠关系、整体损益、责任落实。这两套不是冲突是互补。我自己在跨国团队里讨论算法公平一开始也担心墨子会被当成“东方神秘哲学”。后来发现只要你把话翻译成“stakeholder analysis”和“power asymmetry”对方一下就懂了。墨家的价值不在它的国籍而在它提供了一套不那么个人主义的推理方式。在AI时代个体权利框架不够用了因为模型在没人看见的地方替所有人做了决定我们需要一种关系层面和系统层面的伦理语言。墨子正好给了一套。最后分享一点个人体会我最初以为谈伦理是给产品上枷锁做过一轮兼爱非攻改造后才明白它其实是一种需求挖掘方式。兼爱让你看到被你忽略的用户非攻让你看到你手里的武器交相利让你看到真正可持续的商业模式。如果你也在为算法偏见、推荐成瘾、自动化伤害这些事头痛不妨把墨子搬上评审桌。他讲话不绕弯子就一句你爱所有人还是只爱对你有利的人模型每天都在替你回答这个问题只是大多数人没听见。从第135期开始我打算把这个提问写进每一份PRD的开头。反正多问一句不会让排期变慢但能让你少熬几个事故后的通宵。