ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

斯坦福大学团队在Nature子刊发表大规模基准研究,系统测试了32款主流医学AI基础模型,覆盖41项临床任务,53个数据集

斯坦福大学团队在Nature子刊发表大规模基准研究,系统测试了32款主流医学AI基础模型,覆盖41项临床任务,53个数据集 小罗碎碎念文献来源Rohan Bareja, Francisco Carrillo-Perez, Yuanning Zheng, et al. A benchmark study of vision and pathology foundation models for computational pathology.Nature Communications, 2026, 17: 9012.研究团队斯坦福大学计算医学系、阿贡国家实验室数据科学与学习部、斯坦福大学生物医学数据科学系等机构。随着人工智能技术渗透进医疗领域计算病理学Computational Pathology, CPath给出了新的解题方向用AI模型自动分析数字化病理切片辅助医生完成肿瘤分类、分子标志物预测、预后评估等工作。短短数年间几十款AI基础模型相继问世有通用视觉模型有专门训练病理图像的专用模型还有能同时理解图像与文本的多模态模型。每家机构都在宣传自己的模型性能领先可行业始终缺少一份统一、客观的“成绩单”。到底哪种模型更适合病理任务模型参数越大、训练数据越多就一定越强吗在不同医院、不同染色标准的真实临床切片上模型还能保持稳定的表现吗这些问题直接决定了病理AI能不能真正落地临床、服务精准医疗。而近期发表在《Nature Communications》上的一项大规模基准研究第一次给整个领域交上了全面而系统的答卷。来自斯坦福大学、阿贡国家实验室等机构的研究团队对32款主流AI基础模型开展了迄今为止覆盖范围最广的系统性评测涵盖41项临床任务、53个数据集、超过17500张全切片图像彻底厘清了不同模型在计算病理学中的性能边界与适用场景。基准测试图a基准测试工作流程这是整个研究的实验流水线示意图清晰展示了从原始数据到最终任务输出的完整步骤数据输入汇总四大类病理数据集——TCGA癌症基因组图谱、CPTAC临床蛋白质组肿瘤联盟、外部基准数据集、域外临床数据集先统一做质量控制预处理与切块将超大尺寸的全切片病理图像切割成统一规格的小图像块Patch方便模型处理特征提取把图像块输入预训练好的基础模型提取图像的深层视觉特征向量特征聚合将同一张切片里所有图像块的特征聚合起来得到整张切片的整体特征表示下游任务基于聚合后的特征完成共41项临床任务包括肿瘤分期、组织学分型、病理分级、泛癌分类等。可以通俗理解为收集不同来源的“试卷”→裁剪成统一答题格式→让模型“读题提取考点”→汇总整张试卷的信息→最终完成诊断答题。图b / 图c模型整体性能分布TCGA vs 非TCGA这两张是模型性能散点图格式完全对应分别测试模型在「域内训练数据分布」和「域外泛化场景」下的表现纵轴16个Path-VM模型按平均AUROC从高到低排序越靠上整体越强横轴AUROC受试者工作特征曲线下面积0~1越靠右代表模型区分病变的能力越强每个彩色小点 该模型在某一个具体任务上的AUROC得分黑色菱形 该模型所有任务的平均AUROC横向误差线 均值的95%置信区间。基于19项TCGA任务的测试结果Virchow2、Prov-GigaPath、H-optimus-0、UNI、UNI2稳居第一梯队平均AUROC都达到0.82以上整体表现明显优于中下游模型。基于22项非TCGA任务含CPTAC、外部基准、临床域外数据的泛化测试头部梯队整体和TCGA高度一致Virchow2仍位列第一UNI、H-optimus-0紧随其后说明顶尖模型的跨数据集泛化能力稳定但具体排名有小幅波动体现了不同模型的泛化倾向性差异。图d / 图e模型“登顶”次数统计这两张图统计每个模型在所有任务中拿到单项第一名的次数更细致地展现模型的任务适配能力每行对应一组模型上头部梯队、中中游、下下游每个柱形对应一个任务的AUROC白色点为AUROC数值顶部深红色圆点代表该任务的最佳模型。19项TCGA任务中Virchow2在5项任务里排名第一是登顶次数最多的模型Prov-GigaPath、H-optimus-0、UNI2也各有多次登顶头部模型包揽了绝大多数单项第一。22项域外任务中Virchow2在6项任务里登顶H-optimus-0也在5项中排名第一相比TCGA头部模型的优势依然明显但单项第一的分布更分散体现了域外场景下任务的多样性。MedX知识岛在医工交叉研究中真正耗时的往往不是提出问题而是反复寻找可用数据、筛选开源代码、追踪论文资源并判断复现价值。MedX 知识岛将医学文献精读、近千条公开数据集索引、三千余个开源工具解读和公众号论文开放资源整合到同一平台。无论你正在准备课题选题、寻找医学影像数据、比较算法工具还是追踪论文中的代码与数据都可以通过分类筛选或智能问答快速获得相关线索减少无效搜索和复现试错。月卡适合短期集中查数与项目验证年卡还可解锁公众号论文库及更高的专业问答额度在校学生可申请青云计划免费体验一个月。现在注册并加入会员让每一次检索都更接近可执行的研究方案。一、基准测试的底层设计要得出客观可信的结论测试设计本身必须足够严谨。这项研究没有简单地跑几个任务比分数而是搭建了一套完整的基准测试框架从模型分类、测试场景到评估标准每一步都做了严格的控制确保所有模型站在同一起跑线上。清晰的模型分类体系研究首先按照训练数据领域和模态类型将32款模型划分为四大类既比综合实力也看类别差异通用视觉模型VM只在自然图片上完成预训练的纯视觉模型比如DINO、iBOT系列基础视觉能力扎实但没专门学过病理知识通用视觉语言模型VLM同时学习自然图片和对应文本的多模态模型比如CLIP、BLIP能同时处理视觉和语言信息病理专用视觉模型Path-VM专门在病理切片图像上预训练的视觉模型比如Virchow2、UNI、Prov-GigaPath天天和病理切片打交道病理专用视觉语言模型Path-VLM同时训练病理图像和医学文本的多模态模型比如CONCH、PLIP兼具病理视觉能力和文本理解能力。多层级的测试场景为了全面考察模型的真实能力研究没有只在常用数据集上“刷题”而是设计了“域内域外”“切片级Patch级”的多层测试体系。在数据集维度研究设置了四个梯度的测试环境TCGA数据集即癌症基因组图谱是病理AI领域最常用的公开数据集很多模型训练时都间接接触过其中的数据相当于“课本练习题”用来测试模型的域内表现CPTAC数据集临床蛋白质组肿瘤分析联盟的独立队列和TCGA同源但标注体系不同相当于“模拟考试题”外部基准数据集包含BRACS、BACH等8个公开挑战数据集都是独立标注的细胞级图像相当于“公开竞赛题”域外数据集来自斯坦福医院的真实临床数据以及NLST、DHMC等独立队列采集设备、染色流程都和主流训练数据存在差异相当于“真实临床实战题”。在评估粒度上研究同时设置了两种任务模式切片级任务针对整张病理切片给出诊断结果需要模型整合不同区域的信息对应病理医生通读整张切片的工作场景Patch级任务针对一小块细胞区域的图像做分类考验模型对细微形态特征的识别能力对应医生在高倍镜下观察细胞的场景。冻结特征与线性探测最能体现测试公平性的是研究采用了冻结特征提取线性探测的评估方案。简单来说就是把所有模型的预训练参数全部“冻住”不允许针对具体任务再做调整只在模型提取的特征之上加一个简单的线性分类器来完成任务。这种设计最大程度排除了训练策略、调参水平的干扰让不同架构、不同训练方式的模型可以公平对比。二、32款模型实测的核心发现基于这套严谨的测试框架研究团队得出了一系列扎实的结论既印证了行业的部分共识也打破了很多流传已久的认知误区。专用模型各有所长先看最受关注的病理专用视觉模型Path-VM的整体表现。在19项TCGA任务中Virchow2以平均AUROC 0.830的成绩位列第一AUROC即受试者工作特征曲线下面积满分1分数值越高代表模型区分病变的能力越强Prov-GigaPath0.829、H-optimus-00.824、UNI0.824、UNI20.824紧随其后构成了稳定的第一梯队。在更考验泛化能力的非TCGA任务中排名出现了小幅波动Virchow2依然以0.836的平均AUROC守住第一UNI上升到第二H-optimus-0第三。但整体来看头部五款模型始终稳居前列没有出现“域内称霸、域外拉胯”的崩塌情况。值得注意的是通过严格的统计检验发现这五款头部模型之间的整体性能差异并没有统计学意义。换句话说顶尖病理专用视觉模型的综合能力处在同一水平线只是在不同癌种上各有擅长Prov-GigaPath在乳腺癌、膀胱癌任务上表现突出Virchow2在前列腺癌、结肠癌上更精准UNI在脑癌任务中更有优势。切片级相近Patch级见真章如果说整体成绩反映了综合诊断能力那切片级和Patch级的对比则暴露了模型不同维度的实力差异。在14项非TCGA切片级任务中排名前五的模型平均AUROC都在0.74到0.76之间差距非常小统计上没有显著差异。这就好比看整张病历做诊断资深医生之间的水平差距并不大都能给出相对可靠的结论。但到了8项Patch级的外部基准任务上差距立刻拉开了Virchow2以平均AUROC 0.962遥遥领先和其他四款头部模型都拉开了统计学上的显著差距。这说明在识别细胞层面的精细形态特征上Virchow2的视觉表征能力确实更胜一筹。研究同时发现切片级表现好的模型Patch级表现通常也不差但相对排名会发生变化。这也给行业提了个醒不能只用切片级任务评价模型细节识别能力同样是临床应用的关键指标。专用模型的优势到底在哪很多人默认“专门训练的肯定比通用的强”但研究给出的答案其实很微妙病理专用视觉模型Path-VM的排名整体更靠前在各类任务中占据了接近一半的前十席位但和通用视觉模型VM的整体性能并没有统计学上的显著差异。可以用医生的类比来理解通用视觉模型就像全科医生见识过各种类型的图像基础视觉能力很强遇到特定病理任务也能发挥不错的水平病理专用模型就像专科医生天天和病理切片打交道对病理特征更熟悉发挥更稳定、更不容易出错。在大多数常规病理任务上两者没有质的差距但专科模型的一致性和稳健性更好。而病理专用视觉语言模型Path-VLM的表现就不尽如人意了整体显著落后于纯视觉的Path-VM。哪怕是表现最好的CONCH和TITAN也只在少数肺部任务上能进入第一梯队。研究分析这主要是因为高质量的病理图像-文本配对数据非常稀缺多模态训练反而稀释了视觉特征的学习效果。大模型≠强性能在AI领域“越大越强”几乎是一种默认共识——参数越多、训练数据越多模型能力就越强。研究团队分别从模型大小和预训练数据量两个维度做了系统分析模型大小维度在TCGA任务上大模型确实比小模型表现好尤其是多分类任务提升明显但到了CPTAC数据集提升就非常有限到了完全域外的临床数据集模型大小和性能几乎没有相关性。数据量维度同样TCGA任务上训练数据越多效果越好但超过中等规模后收益就开始递减到了域外数据集数据量的增加几乎带不来性能提升。简单来说“堆参数、堆数据”的红利只在和训练数据分布相似的场景里有效一旦遇到全新的临床场景规模带来的优势会迅速消退。真正决定模型泛化能力的不是数据的数量而是数据的组织多样性和质量。模型集成的互补效应既然单个模型各有优劣那把它们组合起来会不会更强研究团队用排名前五的模型构建了一个晚期决策集成的融合模型——每个模型单独给出预测最后用多数投票的方式汇总出最终结果。结果显示在TCGA任务上融合模型的累计平衡准确率达到了0.702超过了表现最好的单个模型Virchow20.696。在非TCGA任务上融合模型也能稳居第二保持了很强的泛化能力。更有价值的是组织层面的互补性不同模型在不同癌种上各有所长CONCH在肺癌上表现最强Virchow2在结肠癌和前列腺癌领先H-optimus-0在泛癌任务上更优。融合模型刚好能把这些优势整合起来在乳腺癌和泛癌任务上表现尤其突出。这就像临床的多学科会诊每个专家擅长的领域不同凑在一起就能给出更稳妥、更全面的诊断意见。三、基准测试指引的行业未来这场大规模基准测试绝不仅仅是给模型排个名次那么简单。它更像给整个计算病理学领域做了一次全面的“体检”既看清了当前技术的真实水平也指出了未来的发展方向。首先它直接打破了行业的几个认知误区不要再盲目追求更大的模型和更多的数据与其无限制堆规模不如优化训练数据的组织多样性和质量不要迷信多模态概念至少在纯分类诊断任务上高质量的纯视觉模型依然是更优的选择也不要指望有一个“万能模型”能搞定所有病理任务不同癌种、不同粒度的任务对应的最优模型是不一样的。对于临床应用落地来说这项研究也给出了非常实用的参考如果是做常规的切片级诊断筛查多款头部模型都能胜任可以根据常见癌种选择对应的优势模型如果是做细胞级的精细分析比如病变区域的细节识别Virchow2这类Patch级能力强的模型更合适如果是部署到不同机构、面对多样本的复杂临床场景集成模型能提供更稳健的表现。展望未来计算病理学还有广阔的探索空间多模态模型虽然目前整体表现一般但它具备结合医学文本知识、解释诊断结果的潜力未来随着高质量图文配对数据的积累很可能实现突破而针对特定癌种、特定任务的轻量化专用模型也会是临床落地的重要方向。更重要的是当行业有了客观的基准体系就能从“自说自话”的宣传转向“同台竞技”的进步集中精力解决真正的核心问题而不是在营销话术上内卷。当病理AI不再是模糊的概念而是有了清晰的能力边界和适用场景它才能真正走进病理科成为医生的得力助手。它不会取代病理医生但它能把医生从重复繁重的阅片工作中解放出来把更多精力放在复杂病例的判断和患者的治疗方案上。而这正是人工智能赋能精准医疗的真正意义。医学AI交流群目前小罗全平台关注量120,000交流群总成员4000大部分来自国内外顶尖院校/医院期待您的加入由于近期入群推销人员较多已开启入群验证扫码添加我的联系方式备注姓名-单位-科室/专业即可邀您入群。
返回列表