
一张二十六万首的下架清单九月底索尼音乐给各大流媒体平台递了一份清单。清单上是二十六万首歌要求全部下架。这些歌不是翻唱也不是传统意义的盗版。它们是用生成式 AI 伪造的模仿索尼旗下艺人的声音和形象。被冒充的名单里有阿黛尔、布兰妮、皇后乐队还有迈克尔·杰克逊。这份名单横跨了五十年从在世天后到已故传奇。伪造者选目标的逻辑很纯粹谁的搜索量大就冒充谁。金融时报十月五日把这件事报道出来索尼没有否认。真正让我停下来的不是二十六万这个数。而是三月底的同类清单上只有十三点五万首。半年翻了一倍曲线的方向很明确。伪造的速度在加快下架的速度也在加快两边都在踩油门。索尼全球数字业务总裁丹尼斯·库克给了另一个数。他估计欺诈性播放量可能占到流媒体曲目总量的百分之十。百分之十意味着每十次播放里就有一次在给造假者付钱。这个比例放在任何一个行业都足以触发系统性整改。唱片公司高管们的估算是流媒体欺诈每年造成二十二亿美元损失。折合成人民币接近一百四十八亿。这不是版权纠纷这是一门生意。一门用别人的声音赚钱、用机器人刷量、从版税池里取款的生意。索尼在声明里把话讲得很重。它说这种做法正在大规模发生伤害艺人、误导乐迷。还说这场斗争正变得越来越艰难。一家全球三大唱片公司之一公开承认艰难这个措辞本身就罕见。要知道索尼手里有律师团、有版权库、有和平台谈判的筹码。连它都觉得难中小厂牌和独立音乐人的处境可想而知。这笔钱是怎么被偷走的要理解这桩买卖先看流媒体的分账机制。平台把订阅收入和广告收入汇进一个大池子。月底按每首歌的播放量占比把池子里的钱分给版权方。这个机制叫 pro rata按比例分配。它的漏洞在于播放量本身可以被制造。而且制造播放量的成本低到几乎没有门槛。造假者的操作链条并不复杂。第一步用生成式 AI 批量产出歌曲。现在的音乐生成模型一天产出几千首不是难事。歌词可以让语言模型顺手生成人声克隆直接套目标艺人的音色。第二步通过发行商渠道把这些歌上传到流媒体平台。独立音乐人想把歌上架 Spotify本来就要走聚合发行商。很多聚合发行商的上传审核基本是自动化的。交钱、传文件、填元数据几天后歌就出现在全球平台上。这条本来为独立音乐人修的路现在成了伪造品的绿色通道。第三步用机器人账号群反复播放这些歌。每个机器人账号每天播放几十次伪装成正常听众。按反作弊领域的常见做法机器人往往还会穿插播放真歌打掩护。月底分账时这些被刷出来的播放量就稀释了版税池。真艺人少拿的钱就是造假者多拿的钱。二十二亿美元的年损失就是这么一笔一笔累积起来的。冒充知名艺人的声音是这条链路的升级版。蹭到的是艺人名字自带的搜索流量和歌单推荐。一首挂着阿黛尔风格标签的假歌冷启动比纯机器人歌快得多。歌单编辑算法只看播放数据分不清数据背后是人是机器。播放量高的歌会被推进更多歌单于是假歌滚起了雪球。伪造流水线长什么样我对比听过几代音乐生成模型的公开演示样本。客观讲两年前这类东西一听就是机器做的。现在的版本编曲完整、人声连贯普通听众很难分辨。声音克隆的门槛也在同步下降。几分钟的干净人声样本就足够让开源克隆方案产出普通听众难分辨的音色。艺人的采访、直播清唱到处都是现成的训练素材。造假者甚至不需要让整首歌都像某个艺人。只要副歌的音色有那么几分神似配上艺人名字做标题就够了。很多人是在搜索栏里主动掉进这个陷阱的。搜阿黛尔出来一首没听过的新歌点开就贡献了播放。有些伪造歌甚至能混进官方歌单之外的算法推荐位。推荐系统只看协同过滤信号不关心歌手是谁。一堆机器人账号的共同播放在算法眼里就是正在走红。Deezer 披露的数据能说明规模。这家法国平台每天收到九万首 AI 生成的歌。九万首占它新上传音乐总量的一半以上。每天一半的新内容是机器造的这个比例一年前还无法想象。平台为了接住这个量存储和审核成本都在被动上涨。音乐库在膨胀听众的注意力没有膨胀单首歌被听到的概率在下降。这种稀释对认真做音乐的人同样是一种税。更扎眼的是另一个数字。去年纯 AI 歌曲产生的播放量里百分之八十五是欺诈性的。也就是说造假者不只伪造歌还伪造听众。歌是假的播放是机器人刷的只有版税是真的被领走了。这个百分之八十五反过来读也成立。剩下百分之十五的播放量来自真听众的主动选择。说明 AI 音乐本身有真实需求问题从来不在生成技术。问题在于有人拿着这个技术去冒充别人、去骗版税池。检测这头的技术账平台当然不是坐以待毙检测侧有几张牌。第一张是音频指纹库比对。每首正版歌提取声学指纹入库新上传的歌先过一遍比对。这条路对直接搬运有效对 AI 新生成的伪造歌基本无效。因为伪造歌的旋律是新的指纹库里没有记录。指纹技术本身很成熟Shazam 二十多年前就靠它识曲。它的设计目标是认出同一首歌而不是识别一首歌是谁做的。目标不同面对生成式伪造自然就使不上劲。第二张牌是声学水印。生成模型在输出音频里嵌入人耳听不见的标记平台扫标记就能识别。问题是水印需要生成方主动配合造假者用的模型不会配合。开源模型权重谁都能下载水印开关随手就能关掉。第三张牌是生成痕迹分类器。训练一个模型专门听生成器留下的统计痕迹比如相位连续性的异常分布。声码器合成的人声在相位和频段过渡上和真实录音的物理过程对不上。这条路目前最主流但它是一场消耗战。生成模型每升级一次分类器就得重新训练一次。攻击方只需要出一个新版本防守方却要重新收集样本重新验证。第四张牌是播放行为反作弊。同一批账号反复播放同一批歌行为模式很容易识别。这张牌的判定特征大致有三类都是风控领域的常规做法。第一类是时间特征真人听众有作息机器人全天候均匀播放。一个账号凌晨四点还在以固定间隔切歌本身就是强信号。第二类是集中度特征真人听歌分散机器人只播目标歌单。用账号播放记录在歌曲上的分布集中度就能算出来比如基尼系数。第三类是关系特征刷量账号往往共用设备、IP 段和支付卡。把这些账号连成图做社区发现一抓就是一整片。三类特征单独看都有误伤叠在一起置信度就上来了。索尼清单里那二十六万首从报道细节看不少是顺着播放量异常这条线暴露的。这也是为什么下架清单能半年翻倍。不是伪造变多了一倍而是检测的网撒得更密了。两个因素叠加真实增速没法从清单里直接读出来。我个人更倾向于把这个数字看成下限。能被行为分析抓到的都是刷得急、刷得笨的那批。慢慢来、把播放分摊到几年里的那种今天的系统基本看不见。一个能跑的最小指纹演示音频指纹听起来玄核心思想其实很朴素。把音频切成小帧提取每帧的特征轮廓再把轮廓压成一段签名。下面这个演示只用 Python 标准库读一个 16 位 WAV 文件。它计算每帧能量把相邻帧的能量突变编成指纹串。真正的商用指纹用的是频谱峰值对复杂得多但骨架思路一致。import wave import struct import hashlib def fingerprint(path, frame2048): 提取简易能量轮廓指纹返回 (摘要, 指纹前缀)。 with wave.open(path) as w: raw w.readframes(w.getnframes()) width w.getsampwidth() channels w.getnchannels() if width ! 2: raise ValueError(演示只支持 16 位 PCM) samples struct.unpack(%dh % (len(raw) // 2), raw) if channels 1: samples samples[::channels] energy [] for i in range(0, len(samples) - frame, frame): block samples[i:i frame] energy.append(sum(s * s for s in block) / frame) sig .join( 1 if energy[i 1] energy[i] * 1.5 else 0 for i in range(len(energy) - 1) ) return hashlib.sha1(sig.encode()).hexdigest()[:16], sig[:40] if __name__ __main__: digest, preview fingerprint(song.wav) print(指纹摘要:, digest) print(指纹前缀:, preview)这段代码我实际跑过用脚本生成两段节奏模式相反的 440Hz 正弦测试音频摘要确实不同。同一段旋律把音量放大两倍半再跑能量突变序列不变摘要完全一致。实测输出长这样A: f7c6ba8cab15f3aa B: 00a367003cf542e3 A_loud: f7c6ba8cab15f3aa PASS: 不同歌指纹不同同歌放大音量指纹一致这就是指纹比对能基本扛住音量调整的原因。它比的是轮廓不是波形本身。当然这个演示版本扛不住变速和变调有损转码也会扰动能量值。商用方案会比对多个频段的峰值相对位置抗攻击性强得多。但即便是商用指纹也解决不了这篇文章的核心问题。指纹回答的是这是不是那首歌伪造检测要回答的是这歌是谁做的。几种手段摆在一起看把四张牌摊开在一张表里强弱会更直观。检测手段原理强项软肋音频指纹比对轮廓签名查库抓搬运极准查不到新生成的伪造声学水印嵌入听觉外标记识别率近百分之百依赖生成方配合生成痕迹分类器听统计异常不依赖配合随生成模型升级失效播放行为反作弊识别刷量模式顺带抓出版税欺诈抓不到慢速刷量上传端审核发行渠道卡人成本最低误伤独立音乐人没有任何一张牌能单出。平台实际的做法是分层上传端先筛一遍指纹库再过一遍。可疑的进分类器打分上线后再用行为反作弊兜底。每一层都有漏网率叠起来才能把漏网率压到可接受的水平。这套纵深防御的思路搞安全的人应该很熟悉。差异在于安全攻防的损失是事件性的这里的损失是持续放血。每漏过去一首伪造歌版税池就被稀释一天。而且漏网的歌会继续累积播放数据越看越像正常内容。平台的两难检测收紧不是没有代价的。分类器的误伤名单里躺着大量真人独立音乐人。用了 AI 辅助混音的歌痕迹上和纯 AI 生成有重叠。一位真人作者被误判下架申诉流程可能要走几周。这几周里他没有收入歌单位置也没了。平台因此不敢把阈值收得太紧。阈值松伪造歌漏过去阈值紧真人被误伤。这个旋钮怎么调都有人受损。Deezer 现在的做法是给 AI 生成内容打标并从推荐算法里剔除。打标比下架温和但前提是识别得准。绕了一圈问题又回到分类器的准确率上。还有一个更现实的问题检测是要花钱的。每天几十万首新上传每首都过一遍深度检测算力成本不菲。光 Deezer 一家每天就有九万首全平台加起来的量级只高不低。平台的动力来自舆论压力和版税池健康两者之间一直在摇摆。这笔账最后谁付版税池是零和的这一点很多人没意识到。伪造歌每从池子里拿走一块钱真人艺人就少拿一块钱。头部艺人被冒充损失的是名气和关联流量。腰部艺人没被冒充的资格却在为整个池子的稀释买单。二十二亿美元的年损失摊到整个行业大头其实压在中腰部身上。对一个靠版税生活的独立音乐人来说池子稀释百分之十就是实打实的降薪。他们没有法务团队没有和平台谈判的资格甚至没有察觉的渠道。造假者的成本结构却便宜得离谱。生成一首歌的算力成本以分计上传渠道免费刷量账号按千个批发。被下架的代价大不了换一批账号重来。攻守两端的成本完全不对称这才是问题难治的根源。防守方每加一层检测都是持续的人力和算力开支。攻击方换一批账号、换一个发行商成本几乎为零。这种不对称在垃圾邮件时代就上演过一次。邮件行业的答案是发信信誉体系和行业联盟音乐行业迟早也要走这条路。我的判断索尼这二十六万首下架我把它看成转入消耗战的信号。靠下架清单一首一首追永远追不上生成端的速度。真正有效的解法只有两个方向。一个是上传端实名加押金把造假的固定成本抬高。另一个是行业级的水印联盟让主流生成模型强制嵌入标记。前者动的是发行渠道的利益后者动的是模型厂商的自由。两个方向都会很慢但都比刷清单快。押金方案的关键是把上架从免费变成有成本哪怕是可退还的成本。当上传一万首歌要先押一笔钱批量伪造的账就算不过来了。水印联盟的关键在覆盖率只有头部模型厂商都加入标记才有意义。任何一家主流厂商缺席造假者就会集体迁到那一家。作为开发者我自己的立场是一贯的。AI 生成音乐本身没错错的是伪造身份和伪造播放。工具越便宜诚信基础设施就得越贵。这笔钱省不掉问题只是谁来掏、什么时候掏。索尼的清单下次再公布时数字大概率还会涨。涨到什么程度开始回落取决于上面两个方向什么时候落地。我个人不指望明年就能看到拐点攻防的成本不对称摆在那里。但清单从半年翻倍变成半年持平就是值得记住的胜利。在那之前版税池里的每一块钱都还在被悄悄稀释。如果你在做音频相关的产品现在就该想一件事。你的系统里有没有假设上传的内容是真人做的。只要有这个隐含假设这篇文章里的每一种攻击都可能落到你头上。早点把身份验证和来源追踪做进架构里比事后补洞便宜得多。