ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

晶圆测试实战:从探针卡到良率报表的完整链路与避坑指南

晶圆测试实战:从探针卡到良率报表的完整链路与避坑指南 晶圆测试这活儿说它是芯片制造里最“磨人”的环节之一一点都不夸张。我在封测厂和设计公司两边都待过见过太多人把 wafer sort 简单理解成“拿探针扎一下、测完打点、算个良率就完事”。真到产线上一个 touchdown 的稳定性、一张探针卡的针痕、一次 shared bus DFT 的时序违例都能让整批 wafer 的良率数据变得没法看。这篇就按我自己的实操经验把从探针卡上机到最终良率报表这条链路拆开讲重点放在那些文档里不写、但现场一定会遇到的问题上。1. 先搞清楚 wafer sort 到底在测什么1.1 它和 final test 的分工边界很多人刚入行会混淆 wafer sortCPChip Probing和 final testFT。简单说wafer sort 是在晶圆还没切割、封装之前用探针卡直接扎在 die 的 pad 上做电性测试final test 是封装成成品之后再做一遍。两者不是重复劳动而是各有侧重。wafer sort 的核心目的有三个第一把坏 die 提前挑出来避免坏 die 流到封装环节白白浪费封装成本——封装一颗芯片的成本往往比 die 本身还贵这一步的经济意义极大第二给良率统计提供最原始的数据让工艺、设计、测试三方都能看到问题第三对某些功能做早期筛选比如开短路、漏电、基本功能。而 final test 更关注封装引入的缺陷、更完整的 AC 参数、以及最终出货规格。所以 wafer sort 的测试项通常偏“快、准、狠”不会把所有功能都测一遍而是用最少的测试时间覆盖最高的缺陷逃逸率。1.2 一次 touchdown 里发生了什么探针卡压下去再抬起来这叫一个 touchdown。这一个动作里其实发生了一连串事情探针针尖刺破 pad 表面的氧化层建立低阻接触测试机ATE通过探针卡给 die 加电、加信号die 返回响应ATE 判定 pass/fail然后探针抬起wafer 移动一个 step准备下一个 die。听起来简单但每个环节都有坑。比如针尖刺破氧化层的力度不够接触电阻就大测出来的漏电流偏高好 die 被误判成坏 die力度太大pad 被扎穿反而造成不可逆损伤。这个力度靠的是 probe card 的 overdrive 和 planarity 控制后面会细讲。1.3 为什么 DFT 在 wafer sort 里越来越关键早些年 wafer sort 主要靠功能向量和简单的 DC 测试。但现在芯片越来越复杂pad 数量有限测试时间预算又卡得死纯功能测试根本跑不完。这时候 DFTDesign for Testability就成了主力。DFT 的核心思路是在芯片设计阶段就埋好“测试专用”的电路让测试机用很少的 pin、很短的时间就能覆盖大量内部逻辑。scan chain、boundary scan、MBIST内存自测都是常见手段。而最近热词里提到的 shared bus DFT本质上是把多个测试访问通道共享一条总线进一步压缩 pin 数和测试时间。这个后面单独开一节讲。2. 探针卡wafer sort 里最容易被低估的一环2.1 探针卡选型cantilever 还是 vertical探针卡主要分两大类悬臂式cantilever和垂直式vertical。选哪个不是拍脑袋要看 pad pitch、pad 数量、测试频率和寿命要求。类型适用场景优点缺点Cantileverpad pitch 较大、低频、小 pin 数成本低、维修方便针尖易磨损、高频性能差、planarity 难控Verticalfine pitch、高频、高 pin 数接触稳定、高频好、寿命长成本高、维修周期长我个人的经验是如果 pad pitch 小于 80μm或者测试频率上到几百 MHz 以上基本就别考虑 cantilever 了直接上 vertical。否则你会被接触不良和信号完整性问题折磨到怀疑人生。2.2 针痕probe mark控制好 die 和坏 pad 的分界线针痕是探针在 pad 上留下的痕迹。它既是接触良好的证明也可能是损伤的来源。产线上对针痕有明确规格深度、面积、位置都有要求。控制针痕的关键参数有几个Overdrive探针压过 pad 表面的额外行程。太小接触不良太大损伤 pad。一般根据针尖形状和 pad 材质来定常见范围是 50~100μm。Planarity整张探针卡所有针尖是否在同一平面。planarity 差有的针压得深、有的压得浅良率数据就会飘。针尖形状锥形、楔形、平头不同形状对 pad 的损伤和接触电阻影响不同。提示针痕验收一定要在显微镜下看而且要抽多个 site、多个 touchdown 后的样本。只看第一下没意义探针磨损是渐进的。2.3 探针卡的清洁与维护周期探针卡用久了针尖会沾上 pad 材质的残留物比如铝、铜氧化物接触电阻上升。这时候需要做清洁常见方式是磨针用专用磨针板或者化学清洗。维护周期没有统一标准取决于测试量、pad 材质、针尖材质。我的做法是每测一定片数就记录一次接触电阻趋势一旦发现某几个 pin 的接触电阻明显上升就安排清洁。不要等到良率掉了才动手那时候已经误判了一批 die。3. 测试程序与 DFT 的配合shared bus DFT 实战拆解3.1 测试程序的基本骨架一个 wafer sort 测试程序通常包含这几块接触测试continuity、开短路测试open/short、漏电测试leakage、功能测试functional、DFT 测试scan/MBIST、以及最后的打点inking 或 map 输出。顺序很重要。接触测试必须放最前面因为如果接触不良后面所有测试结果都不可信。我见过有人把功能测试放前面结果接触不良导致大量误判白白浪费几个小时。3.2 shared bus DFT 到底解决了什么问题传统 scan 测试每个 scan chain 可能需要独立的输入输出 pin。当 chain 数量多、pin 数有限时就出现瓶颈。shared bus DFT 的思路是多条测试访问通道共享一组总线通过地址或控制信号来切换当前访问哪条通道。这样做的好处很直接pin 数减少测试机资源占用降低同时因为总线复用测试向量可以更紧凑。但代价是控制逻辑变复杂时序收敛更难。实操中要注意几点总线冲突多个通道同时驱动总线会打架必须保证任意时刻只有一个驱动源。这靠控制逻辑和测试协议来保证。时序余量共享总线意味着信号路径更长、负载更重setup/hold 余量会被吃掉。做 timing closure 时要留足 margin。测试覆盖率的验证共享之后某些故障模式可能被掩盖必须用 fault simulation 重新确认覆盖率没有掉。3.3 DFT 测试向量在 ATE 上的加载与调试DFT 向量通常由 EDA 工具生成格式可能是 STIL、WGL 或直接转成 ATE 专用格式。加载到 ATE 之后第一件事是做 simulation vs. silicon 的比对。我常用的调试流程是先在少量 die 上跑 DFT 向量看 pass/fail 分布。如果 fail 集中先怀疑向量本身或时序问题而不是芯片问题。用 ATE 的波形抓取功能看关键信号的时序是否和仿真一致。逐步调整 timing set找到稳定窗口。这个过程很耗时间但省不得。DFT 向量一旦有问题整批良率数据都是错的。4. 良率统计数字背后的真相4.1 良率是怎么算出来的最基础的良率 pass die 数 / 总 die 数。但实际产线上这个数字要细分Gross die一片 wafer 上理论可用的 die 总数。Tested die实际测到的 die 数边缘不完整的 die 可能不测。Pass die测试通过的 die 数。Yield Pass / Tested。但光看总良率没意义必须看空间分布。同样 90% 的良率一种是随机散布的 fail一种是集中在 wafer 边缘或某个区域两者的工艺含义完全不同。4.2 wafer map 的解读fail pattern 会说话Wafer map 是把每个 die 的测试结果画在晶圆坐标系上。常见的 fail pattern 有几类边缘 fail通常是工艺均匀性问题比如光刻、刻蚀在边缘的控制差。中心 fail可能是旋涂、CMP 等中心相关工艺问题。条纹状 fail往往和扫描方向、某个设备腔体有关。随机点 fail可能是颗粒污染或随机缺陷。整片 fail先查测试本身探针卡、程序、接触问题都可能。我处理过一批边缘 fail 特别严重的 wafer最后查到是某台刻蚀机的边缘气流控制漂了。如果只看总良率根本发现不了。4.3 良率统计中的常见陷阱第一个陷阱是误判。接触不良、程序 bug、探针卡问题都会造成假 fail。所以看到良率异常第一步永远是确认测试系统本身没问题。第二个陷阱是bin 定义混乱。不同测试项 fail 会打到不同 bin如果 bin 定义不清晰后续分析就没法做。建议在程序开发阶段就把 bin 表定死并且文档化。第三个陷阱是忽略测试顺序的影响。某些测试项会改变 die 状态比如写入操作如果顺序不对后面的测试结果就不可信。5. 从数据到行动良率提升的闭环5.1 数据采集与 SPC 控制良率数据不是测完就完了要进 SPC统计过程控制系统。关键指标包括总良率、各 bin 占比、接触电阻趋势、测试时间趋势。SPC 的核心是设控制限一旦某指标超出控制限就报警。但控制限不是拍脑袋定的要基于历史数据统计出来。我见过有人把控制限设得太松报警了也没人管最后良率掉了才发现。5.2 和工艺、设计团队的联动良率问题很少是测试单独能解决的。测试能提供的是数据但根因往往在工艺或设计。所以测试团队要能把 wafer map、bin 分布、fail pattern 翻译成工艺或设计能听懂的语言。比如“边缘 fail 集中”这种描述工艺团队一听就知道去查边缘相关设备“某个 scan chain 集中 fail”这种设计团队会去查那条 chain 的时序或物理布局。5.3 持续改进的实操建议建立 fail pattern 库把历史问题和对应的根因、解决方案记录下来下次遇到类似 pattern 能快速定位。定期 review 探针卡状态和测试程序版本避免因为维护不到位造成数据漂移。对 DFT 向量做定期回归尤其是设计改版之后确认覆盖率没有退化。良率会议不要只报数字要带 wafer map 和趋势图让讨论有依据。6. 几个我踩过的坑和现场经验第一个坑是探针卡 planarity 没校准就上机。当时赶进度觉得差不多就行结果测出来良率比预期低了好几个点排查了半天才发现是 planarity 问题。后来养成习惯每次换卡或长时间停机后先做 planarity 检查。第二个坑是DFT 向量和 ATE timing 不匹配。仿真里跑得好好的向量上机就 fail。后来发现是 ATE 的 timing set 没有完全按照仿真条件设置边沿位置差了一点在高速下就出问题。解决办法是严格对齐仿真和 ATE 的时序定义并且留足 margin。第三个坑是良率数据没有及时进 SPC。有一批 wafer 良率缓慢下降但因为没设趋势报警等发现的时候已经测了好几批。后来把关键指标都加了趋势监控问题能在早期被发现。第四个坑是bin 定义和封测厂不一致。我们内部定义的 bin 和封测厂用的 bin 表有差异导致数据对不上。后来统一了 bin 表并且每次程序更新都同步确认。这些坑说起来都不复杂但现场就是会反复出现。核心还是那句话wafer sort 不是孤立的一步它上接工艺、下接封装中间还牵着设计和测试。任何一个环节没对齐数据就不可信。最后分享一个我自己的习惯每次看到良率异常先别急着下结论按“测试系统 → 探针卡 → 程序 → 芯片”这个顺序排查一遍。大部分时候问题出在前三个而不是芯片本身。这个顺序能帮你省下大量无效的失效分析时间。
返回列表