ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

机器学习训练秘籍(Machine Learning Yearning 中文版)实战:误差分析中并行评估多个改进想法

机器学习训练秘籍(Machine Learning Yearning 中文版)实战:误差分析中并行评估多个改进想法 文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载在《机器学习训练秘籍》Machine Learning YearningAndrew Ng 著的「基础误差分析」章节中如何从一堆候选改进方向里选出最有价值的那一个是每个机器学习团队都要面对的决策难题。本文以该仓库中 _docs/Basic Error Analysis/ch15.md 为核心系统讲解在误差分析时并行评估多个想法的完整实操方法如何用一张误分类样本电子表格同时度量多个错误类别如何从占比数据反推每个改进方向的理论收益上限以及如何在浏览样本的过程中动态发现新的错误类别。读完本文你将掌握一套可直接复制的、以数据驱动的项目优先级排序流程。为什么需要并行评估从单点误差分析到多想法决策在进入 ch15 之前先回顾它的前一篇 ch14误差分析根据开发集样本评估想法。ch14 解决的是单个想法值不值得做的问题收集 100 个被误分类的开发集样本人工查看并统计其中狗的比例——如果只有 5% 的误分类图像是狗那么无论怎么改进这个方向最多只能消除 5% 的误差这就是该改进方案的上限而如果 50% 的误分类图像是狗同样的投入就可能把整体误差从 10% 降到 5%。然而现实中的团队往往同时持有多个想法比如改进猫检测器时你可能同时想修正算法将狗误分类为猫的问题修正算法将大型猫科动物如狮子、黑豹等下文简称大猫误分类为家猫的问题改善系统在模糊图像上的表现还有其他更多候选方向。ch15 的核心主张是上述想法可以以并行的形式进行评估。与其逐个方向串行试错每个方向都要投入数周开发时间不如一次性、低成本地把所有候选方向放在同一张误差分析表里横向对比用同一批误分类样本同时度量各方向的潜在收益。这延续了 ch13快速构建并迭代你的第一个系统 所倡导的先快速构建雏形、再用误差分析识别最有前景方向的方法论——并行评估正是这套方法论在多想法优先级排序场景下的落地工具。核心实操误分类样本电子表格的构建方法并行评估的标准做法是创建一个电子表格一边查看被误分类的 100 个开发集样本一边完善表格内容同时留下能够帮助记忆特定样本的备注。具体操作步骤从开发集中取出被算法误分类的样本即造成系统误差的样本为每个候选改进方向错误类别建立一列如狗大猫模糊逐张人工查看样本在命中类别对应的单元格打勾在备注列记录该样本的典型特征帮助日后回忆与聚类分析全部样本查看完毕后统计每个类别占全体误分类样本的比例。为了说明这一过程ch15 给出了一个仅含四个样本的小型开发集的电子表格示例图像狗大猫模糊备注1√不常见的美国比特犬2√3√√狮子雨天在动物园拍摄的图片4√树木后的美洲豹占全体比例25%50%50%注意上表中的两个关键设计备注列是不可省略的信息维度。单靠勾选无法解释为什么这个样本难分备注如不常见的美国比特犬狮子雨天在动物园拍摄的图片能把抽象的类别统计还原为具体、可讨论的失败模式后续设计针对性方案时也更有依据。一个样本可以同时命中多个类别。表格中图像 3 的大猫与模糊列都被勾选——它既是狮子大猫类别又拍摄于雨天、画面模糊模糊类别。因此表格底部的百分比加起来可能不是 100%这是正常现象不必为了凑整而强行把样本归入单一类别。动态发现新类别浏览样本带来的启发虽然你在开始统计前可能已经事先规定了一些类别狗、大猫、模糊但在逐张浏览图像的过程中你很可能会受到启发并发现一些新的类别。ch15 给出的例子是浏览图片时发现经过 Instagram 滤镜处理过的图片在识别时明显造成了额外误差此时就可以在电子表格中加入一个新的 Instagram 列。这说明误差分析不是一次性的静态填表而是一个边浏览、边归纳、边扩展的动态过程。手动查看误分类样本并思考人类如何或是否能正确分类这些样本将帮助你发现新的类别以及对应的解决方案。例如如果存在某种方式能够撤销 Instagram 的滤镜效果并恢复到原始图片那么 Instagram 类别就具备了实际可操作的改进途径。这并不意味着你只能局限于那些已有改进途径的类别这一过程的核心目的是培养你对潜在可改进方向的敏感度让新想法有机会在数据层面被量化验证而不是只停留在直觉层面。从误差占比到决策100 个样本后的优先级判断假设你已检查了 100 个开发集的误分类样本并得到了下面的表格图像狗大猫模糊备注1√不常见的美国比特犬2√3√√狮子雨天在动物园拍摄的图片4√树木后的美洲豹............占全体比例8%43%61%现在你可以做出清晰的量化判断对于狗的误分类问题项目最多可以改进 8% 的误差——即使用最理想的方法彻底解决狗这一类错误整体精度的提升也被限制在 8% 以内对于大猫和模糊类别潜在收益则大得多分别对应 43% 和 61% 的误差空间。因此你更有可能挑选大猫或模糊这两个方向之一优先处理。如果你的团队有足够的人力并行处理多个方向则可以要求一部分成员处理大猫类别另一部分成员处理模糊类别——这正是并行评估从决策层面自然延伸出的并行分工。值得强调的是这里的百分比与 ch14 中5% 上限的推理逻辑完全一致类别占比即该改进方向的理论收益上限。8% 的狗类别意味着哪怕付出一个月工作量精度提升空间也很有限而 61% 的模糊类别则意味着这个方向有六倍于前者的改进空间等待挖掘。误差分析的边界它不产生数学公式ch15 在结尾给出了一个重要的方法论提醒误差分析并不会产生一个明确的数学公式来告诉你什么任务的优先级最高。占比数据只是决策的必要输入而非充分条件你还需要考虑在不同类别上的预期进展某些类别如模糊虽然占比高但可能缺少成熟的技术手段实际能消除的误差比例要打折扣解决每个类别所需的工作量有些类别可能几行预处理代码就能显著改善另一些则可能需要数周的数据清洗或模型改造。换句话说最终优先级是潜在收益 × 实现概率 ÷ 投入成本的综合权衡占比表格解决的是收益上限这一项其余维度仍需团队结合自身能力判断。与相邻章节的衔接完整的基础误差分析工具箱ch15 属于本仓库Basic Error Analysis章节ch13–ch19的一环与之配套的内容共同构成完整的基础误差分析方法论ch14误差分析根据开发集样本评估想法单点想法的收益上限估算是并行评估的推理基础ch16清洗误标注的开发集和测试集样本在误差分析表格中新增误标注列跟踪标签质量问题并说明何时值得修正标签、修正时必须保持开发集与测试集分布一致ch17将大型开发集拆分为两个子集专注其一 与 ch18Eyeball 和 Blackbox 开发集该设置多大当开发集足够大时将用于人工检查的样本划入 Eyeball 开发集、用于自动评估与调参的样本划入 Blackbox 开发集避免人工检查导致过拟合ch19小结基础误差分析对整套流程的浓缩回顾。ch15 的电子表格方法正是上述流程中人工检查 Eyeball 开发集误分类样本这一环节的标准落地形式。在仓库中查阅与验证本文对应的原始文档位于仓库的 _docs/Basic Error Analysis/ch15.md该文件属于 Jekyll 文档站点的一部分章节导航由 _data/docs.yml 定义其中Basic Error Analysis分组按顺序收录了 ch13–ch19 共 7 篇文档ch15 位于该分组第 3 篇站点构建配置见 _config.yml采用markdown: kramdown与highlighter: rouge构建collections.docs将_docs目录中的章节输出为站点页面permalink 形如/docs/ch15/仓库根目录提供了 Gemfile 与 Gemfile.lock如需本地预览可在仓库根目录执行bundle install与bundle exec jekyll serve后通过浏览器访问本地站点查看各章节渲染效果仓库为只读镜像请勿修改其中文件。综上ch15 提供了一套低成本、可量化、可并行的多想法评估流程一张电子表格、100 个误分类样本、几列勾选与备注就能把凭直觉选方向转化为按数据排优先级这正是误差分析在工程实践中最具性价比的用法。赞分享文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载相关推荐cnn-benchmarks项目架构解析模块化设计如何支持多硬件测试cnn benchmarks项目架构解析模块化设计如何支持多硬件测试 cnn benchmarks是一个专注于主流CNN模型性能测试的开源项目通过模块化设计人工智能AI Agent工具调用AI 技能MCP 服务网页爬虫机器学习训练秘籍吴恩达《Machine Learning Yearning》中文版完整指南机器学习训练秘籍吴恩达《Machine Learning Yearning》中文版完整指南 《机器学习训练秘籍》Machine Learning Yearn文档教程机器学习训练终极指南Andrew Ng《Machine Learning Yearning》中文版完全指南想要在机器学习领域快速取得突破性进展吗Andrew Ng的《Machine Learning Yearning》中文版为你提供了一套完整的机器学习训练策略指南文档教程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表