
《深度学习》期末练习题 | 简答题第4篇 —— YOLOv5 核心考点精讲前言本篇是《深度学习》期末练习题简答题系列的第4篇聚焦于目标检测领域的经典模型YOLOv5。我们将按照题号顺序逐题进行原题 → 答案 → 解析的详细讲解帮助大家深入理解 YOLOv5 的预测输出格式、核心设计思想以及损失函数组成。期末备考的同学请收藏本文反复研读 第16题YOLOv5 预测框输出格式 原题YOLOv5 对每个预测框的输出格式一般为[ x , y , w , h , c o n f i d e n c e , c l a s s _ p r o b s ] [\boldsymbol{x},\ \boldsymbol{y},\ \boldsymbol{w},\ \boldsymbol{h},\ \boldsymbol{confidence},\ \boldsymbol{class\_probs}][x,y,w,h,confidence,class_probs]请简述每一项含义。 答案输出项含义x xx预测框的中心点横坐标y yy预测框的中心点纵坐标w ww预测框的宽度h hh预测框的高度c o n f i d e n c e confidenceconfidence置信度框内包含物体的概率以及定位准确性的综合度量c l a s s _ p r o b s class\_probsclass_probs框内物体属于各个类别的概率 解析YOLOv5 的每个预测框本质上输出一个向量可以将其分为两大部分来理解① 定位信息( x , y , w , h ) (x, y, w, h)(x,y,w,h)这四项描述了预测框在图像中的位置和大小( x , y ) (x, y)(x,y)并不是左上角坐标而是预测框的中心点坐标。这种表示方式相比左上角右下角如x m i n , y m i n , x m a x , y m a x x_{min}, y_{min}, x_{max}, y_{max}xmin,ymin,xmax,ymax更加直观也更有利于梯度回传。( w , h ) (w, h)(w,h)是预测框的宽高。在实际网络中YOLOv5 通常对w , h w, hw,h进行了归一化处理相对于输入图像尺寸或 anchor 尺寸使训练更加稳定。拓展在 YOLOv5 的实际实现中( x , y , w , h ) (x, y, w, h)(x,y,w,h)并非直接输出原始值而是经过偏移量offset和缩放编码后的值解码时需要结合 anchor 和 grid cell 信息还原为真实坐标。② 置信度c o n f i d e n c e confidenceconfidence置信度的定义可以理解为c o n f i d e n c e P ( O b j e c t ) × I o U p r e d t r u t h confidence P(Object) \times IoU_{pred}^{truth}confidenceP(Object)×IoUpredtruth即该框包含物体的概率与预测框和真实框的 IoU交并比的乘积。它同时衡量了有没有物体和框得准不准两个维度。③ 分类概率c l a s s _ p r o b s class\_probsclass_probs表示在该框确实包含物体的前提下物体属于各个预定义类别的条件概率分布。例如在 COCO 数据集上c l a s s _ p r o b s class\_probsclass_probs是一个80维向量每个维度对应一个类别的预测概率。 第17题YOLO 与两阶段检测方法的核心区别 原题简述 YOLO 相比于之前的两阶段目标检测方法最核心的区别。 答案YOLO 将目标定位和分类统一在一个网络中完成无需生成候选区域Region Proposals。 解析要深入理解这道题我们需要对比两阶段Two-Stage和单阶段One-Stage两种目标检测范式① 两阶段方法如 R-CNN 系列两阶段方法的检测流程分为两步输入图像 → [第一阶段] 生成候选区域Region Proposals → [第二阶段] 对每个候选区域进行分类和边框回归第一阶段使用 RPNRegion Proposal Network或 Selective Search 等方法从图像中生成数百到数千个可能包含物体的候选框。第二阶段对每个候选框分别进行特征提取、分类和位置修正。⚠️缺点两阶段方法虽然精度较高但由于需要逐一处理候选区域计算冗余大推理速度慢难以满足实时检测需求。② YOLO单阶段方法YOLOYou Only Look Once的核心思想是将目标检测视为一个端到端的回归问题直接在输入图像上一次性预测所有目标的位置和类别。输入图像 → [单一网络] → 直接输出所有预测框的 (x, y, w, h, confidence, class_probs)无需候选区域生成省去了 Region Proposal 步骤大幅减少计算量。全局推理YOLO 在预测时看到的是整张图像能更好地利用全局上下文信息减少背景误检。速度极快YOLOv5 在 GPU 上可达数百 FPS非常适合实时检测场景。③ 对比总结对比维度两阶段方法Faster R-CNNYOLO单阶段候选区域✅ 需要生成❌ 不需要网络结构两阶段串联单阶段端到端检测速度较慢快实时精度较高略低但差距不断缩小小目标检测较好相对较弱总结一句话YOLO 最核心的创新在于将检测统一为一次前向传播的回归任务摒弃了耗时的候选区域生成步骤实现了速度与精度的良好平衡。 第18题YOLOv5 损失函数的三大组成部分 原题YOLOv5 的损失函数由边界框损失CIoU Loss、置信度损失Binary Cross-Entropy、分类损失Binary Cross-Entropy三部分组成请分别简述其作用。 答案损失组成作用边界框损失CIoU Loss用于衡量预测框与真实框的位置、尺寸和形状差异使定位更准确置信度损失BCE用于判断网格内是否包含物体评估预测框的置信度分数分类损失BCE用于判断框内物体的类别是否正确 解析YOLOv5 的总损失函数可以表示为L t o t a l λ b o x ⋅ L b o x λ o b j ⋅ L o b j λ c l s ⋅ L c l s \mathcal{L}_{total} \lambda_{box} \cdot \mathcal{L}_{box} \lambda_{obj} \cdot \mathcal{L}_{obj} \lambda_{cls} \cdot \mathcal{L}_{cls}Ltotalλbox⋅Lboxλobj⋅Lobjλcls⋅Lcls下面逐一深入分析三个组成部分① 边界框损失 —— CIoU Loss传统的 IoU Loss 仅考虑预测框和真实框的重叠面积存在以下问题当两个框不重叠时IoU 0梯度为零无法优化。无法区分不同对齐方式如中心点对齐 vs. 边对齐。YOLOv5 采用的CIoU LossComplete IoU Loss在 IoU 的基础上同时考虑了三个几何因素L C I o U 1 − I o U ρ 2 ( b , b g t ) c 2 α v \mathcal{L}_{CIoU} 1 - IoU \frac{\rho^2(b, b^{gt})}{c^2} \alpha vLCIoU1−IoUc2ρ2(b,bgt)αv项含义1 − I o U 1 - IoU1−IoU重叠面积损失ρ 2 ( b , b g t ) c 2 \frac{\rho^2(b, b^{gt})}{c^2}c2ρ2(b,bgt)中心点距离惩罚ρ \rhoρ为欧氏距离c cc为最小包围框对角线α v \alpha vαv宽高比一致性惩罚v vv衡量预测框和真实框的宽高比差异 CIoU Loss 使得预测框在中心点位置、框的大小、宽高比三个维度上同时向真实框逼近回归速度更快、定位更精准。② 置信度损失 —— Binary Cross-EntropyBCE置信度损失本质上是一个二分类问题该预测框对应的 anchor 是否负责检测某个真实目标。正样本负责检测目标的 anchor目标置信度为 1负样本不负责检测任何目标的 anchor目标置信度为 0使用二元交叉熵BCE损失L o b j − ∑ [ y i log ( y ^ i ) ( 1 − y i ) log ( 1 − y ^ i ) ] \mathcal{L}_{obj} - \sum \left[ y_i \log(\hat{y}_i) (1 - y_i) \log(1 - \hat{y}_i) \right]Lobj−∑[yilog(y^i)(1−yi)log(1−y^i)]注意YOLOv5 在计算置信度损失时采用了正负样本加权策略对正样本和负样本赋予不同的权重以缓解正负样本极度不平衡的问题。③ 分类损失 —— Binary Cross-EntropyBCE分类损失用于衡量预测类别与真实类别之间的差异。YOLOv5 使用多个独立的二元分类器每个类别一个 BCE而非传统的多分类 Softmax即L c l s − ∑ c 1 C [ y c log ( y ^ c ) ( 1 − y c ) log ( 1 − y ^ c ) ] \mathcal{L}_{cls} - \sum_{c1}^{C} \left[ y_c \log(\hat{y}_c) (1 - y_c) \log(1 - \hat{y}_c) \right]Lcls−c1∑C[yclog(y^c)(1−yc)log(1−y^c)]为什么用多个 BCE 而不是 Softmax因为使用独立的 BCE 允许一个目标同时属于多个类别多标签分类具有更强的灵活性。这也是 YOLOv5 相比早期 YOLO 版本的一个改进点。④ 三者协同工作总损失 边界框损失框得准不准 置信度损失有没有物体 分类损失是什么类别三者各司其职、相互补充共同驱动网络在定位精度、目标召回率和分类准确率上达到最优。 本篇总结题号核心考点关键词16YOLOv5 预测框输出格式x , y , w , h x, y, w, hx,y,w,h, 置信度, 分类概率17YOLO vs 两阶段方法的核心区别单阶段、端到端、无候选区域18YOLOv5 损失函数的三大组成CIoU Loss、BCE置信度、BCE分类系列导航《深度学习》期末练习题 | 简答题第1篇《深度学习》期末练习题 | 简答题第2篇《深度学习》期末练习题 | 简答题第3篇《深度学习》期末练习题 | 简答题第4篇本篇持续更新中欢迎关注 收藏 点赞三连支持如有任何问题或建议欢迎在评论区留言讨论 祝大家期末考试顺利