
文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载本文聚焦《Machine Learning Yearning机器学习训练秘籍》中学习曲线解读的进阶场景当训练误差与开发误差同时出现在一张图上时如何通过两者的相对位置与间隙准确区分算法处于高偏差欠拟合、高方差过拟合还是偏差方差双高状态。读完本文你将掌握一套可复用的诊断流程先绘制学习曲线再依据两条曲线的走势与间距判定误差来源最后选择加数据或改模型的正确行动方向。一、回顾学习曲线是什么为什么不能只看开发误差在进入本章其它情况之前有必要先回顾学习曲线的基本绘制方法详见 ch28 与 ch29。绘制学习曲线需要设置不同大小的训练集分别运行算法。例如有 1000 个样本可以分别用 100、200、300……1000 个样本训练然后得到开发集误差随训练集规模变化的曲线。核心观测结果有两个开发集和测试集误差通常随训练集规模增大而下降训练误差往往会随之上升——因为样本越少算法越容易记住训练集训练错误率可以低至 0%样本越多训练集本身越难被完全拟合例如 100 个样本中可能混有模糊、误标注的样本。把两条曲线画在同一张图上并叠加一条代表期望错误率如人类水平错误率、产品体验所需错误率的参考线就构成了完整的诊断工具。训练误差曲线的作用尤为关键它比开发误差曲线更平滑、更易外推能帮你判断继续加数据到底有没有用详见 ch30。二、第一种情况低训练误差 高开发误差 高方差第一种需要解读的情况如上图所示蓝色训练误差曲线相对较低红色开发误差曲线比训练误差高得多。结论很明确偏差很小但方差很大。算法已经能很好地在训练集上拟合却没有成功泛化到开发集上——这正是典型的过拟合overfitting信号。此时添加更多的训练数据是有望奏效的因为它可能有助于缩小开发误差与训练误差之间的差距。这背后的直觉是方差来自模型对特定训练样本的过度记忆扩大数据规模能让模型学到更普适的规律从而压低开发集上的误差。三、第二种情况高训练误差 更高的开发误差 偏差方差双高第二种情况更为棘手如上图所示训练误差很大比期望性能水平高得多远离绿色参考线开发误差比训练误差还要大。此时结论是学习算法同时存在明显的偏差和方差。它不仅没能拟合好训练集高偏差而且从训练集泛化到开发集的能力也很差高方差。这种状态与 ch21 中训练错误率 15%、开发错误率 30%的例子完全对应估算偏差约 15%、方差约 15%。由于分类器既过拟合又欠拟合过拟合/欠拟合这类单一标签很难准确描述它。针对这种双高状态你必须同时寻找减少偏差和减少方差的方法既要在训练集上做得更好如加大模型规模又要提升泛化能力如增加数据、正则化单方面行动都无法解决全部问题。四、两种情况的解读依据与决策逻辑把两种情况并排对比可以提炼出两条普适的解读规则观测到的曲线形态诊断结论优先行动方向训练误差低开发误差远高于训练误差低偏差、高方差过拟合增加训练数据缩小两条曲线间的差距训练误差高开发误差更高高偏差 高方差同时降低偏差如扩大模型与方差如增加数据、正则化其背后的推理来自 ch20 对偏差、方差的非正式定义偏差≈ 算法在训练集上的错误率方差≈ 算法在开发/测试集上的表现低于训练集的程度。再结合 ch22 的更精细分解——将总误差拆分为最优错误率不可避免偏差、可避免偏差训练误差与最优错误率的差值和方差开发误差与训练误差的差值——可以更精确地定位改进空间当可避免偏差大时优先加大模型规模当方差大时优先增加数据量详见 ch23。需要特别注意的是开发误差曲线通常严格位于训练误差曲线之上。因此只要训练误差已经高于期望性能水平通过加数据让开发误差降到期望值以下就基本没有可能——这正是高偏差学习曲线见 ch30给出的关键结论。而 ch31 的两种情况正好覆盖了训练误差低与训练误差高这两种截然不同的起点形成完整的诊断闭环。五、实操补充绘制学习曲线时的噪声与成本控制学习曲线解读的前提是曲线本身可信。结合 ch32实际绘制时有两点值得注意小样本下的噪声处理只用 10 个随机样本训练可能恰好抽到糟糕子集含模糊或误标注样本也可能抽到特别棒的子集导致训练/开发误差随机波动。当训练集偏向某个类如 80% 负样本、20% 正样本或类别很多时抽到非代表性子集的概率更大。两种解决方案一是做多次随机有放回抽样如 3–10 批 10 样本训练多个模型后取平均误差二是选取平衡子集让每个类的样本比例尽量接近原始训练集的总体比例。注意只有当曲线确实嘈杂到看不清趋势时才需要这些技巧——训练集超过 10000 个样本且类别分布不倾斜时通常不需要。计算成本控制绘制学习曲线可能需要训练多个模型如 10 个不同规模的模型。小数据集训练快得多因此可以用 1000、2000、4000、6000、10000 这样的非线性间隔替代线性均匀间隔1000、2000……10000既能看清趋势又避免不必要的算力开销。只有训练额外模型的计算成本足够重要时这种技术才有意义。六、小结一套完整的偏差/方差诊断流程结合 ch28 至 ch32 五章内容可以归纳出如下端到端诊断流程设定期望错误率人类水平、产品体验所需水平或基于经验的主观预期绘制学习曲线用递增的训练集规模训练多个模型同时记录训练误差与开发误差并叠加期望性能参考线解读曲线形态训练误差低而开发误差高 → 高方差加数据训练误差高、开发误差更高 → 偏差方差双高需双管齐下训练误差高而两条曲线贴近 → 高偏差应优先改模型详见 ch30采取行动高可避免偏差时加大模型规模注意配合正则化高方差时增加数据量详见 ch23。学习曲线的价值在于它能在你投入数月收集训练数据之前提前告诉你加数据这条路是否值得走。而 ch31 给出的两种典型形态正是帮助你在最短时间内完成这条路径判断的核心工具。赞分享文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载相关推荐Astryx 主题所有权与物化Materialization系统规格Follow/Own 生命周期、Detach/Freeze 与可验证的原子写入Astryx 主题所有权与物化Materialization系统规格Follow/Own 生命周期、Detach/Freeze 与可验证的原子写入 本指南文档教程Forza Painter专业车辆涂装转换工具在《极限竞速》中的高效应用Forza Painter专业车辆涂装转换工具在《极限竞速》中的高效应用 Forza Painter是一款专为《极限竞速地平线》系列游戏设计的专业车辆涂装转游戏开发图像处理Devanagari_PP-OCRv5_mobile_rec_onnx错误排查指南常见问题与解决方案大全Devanagari_PP OCRv5_mobile_rec_onnx错误排查指南常见问题与解决方案大全 想要快速解决Devanagari文字识别模型部署中的上一篇Android投屏控制高效办公指南3分钟上手跨平台无线操控方案下一篇无线投屏与跨设备控制的开源解决方案QtScrcpy全指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考