
这一周因为手头有几个检测项目在改版我像往常一样把arxiv上新挂出来的目标检测相关论文粗过了一遍整理区间是2026.08.30到2026.09.05。看完之后最大的感受是目标检测这个方向已经不只是“用一个网络框出物体”这么简单了从通用检测器的增量改进到小目标、无人机视角、水下、三维点云这些细分场景再到和视觉语言模型结合的多模态检测几乎每个角落都有人在推进。这篇文章就把我这周比较关注的几个方向、对应的技术细节以及我自己在项目里踩过的坑一起整理出来给同样在做目标检测项目的朋友做个参考。1. 这周的目标检测热点分布与趋势观察1.1 从“通用检测”向“专用场景”倾斜这周过论文的时候第一个直观感觉是纯粹做通用目标检测器结构创新的论文变少了反而是带着具体场景背景的工作在增加。过去两年大家习惯性地看YOLO又出了哪个版本、DETR系又改了什么query设计但这一周刷下来真正让我停下来细读的反而是那些回答“某个具体场景到底该怎么检测”的文章。这个变化其实很符合行业规律。通用检测器在COCO、VOC这类标准数据集上已经卷到一个相对成熟的水平继续在主干网络或者FPN结构上做小改动的边际收益正在快速下降。相比之下无人机俯拍视角、水下声呐与光学图像、遥感卫星图、工业质检、医疗影像这些场景对检测器的要求完全不一样目标尺度极小、背景极度复杂、训练数据稀缺、类别分布极不均衡。于是“特殊场景下的检测”成了这周论文的集中发力点。我在整理的时候把论文分成几类方便自己后面跟踪方向关注重点实际场景通用检测器改进注意力机制、训练策略、数据增强常规视觉项目、安防、工业小目标检测P2层检测头、切图策略、尺度增强无人机、遥感、体育赛事三维/点云目标检测体素化、BEV表示、多模态融合自动驾驶、机器人、仓储多模态/视觉语言检测开放词汇、指代检测、文字坐标输出图文检索、智能助手数据集与评测新数据集构建、标注质量分析鸟类监测、水下生态、农业1.2 一个值得留意的信号检测和“理解”开始绑定这周有一类论文我觉得特别值得单独拿出来说就是把目标检测和大语言模型或者视觉语言模型绑在一起的工作。以前我们做检测输出就是一个类别标签加一个边界框坐标流程到这就结束了。但最近很多论文开始把检测当作“视觉理解”的前置步骤先框出目标再让模型描述目标属性、判断目标关系、回答关于目标的问题。这种转变在实际项目里也有明显体现。比如安防场景客户不再满足于“画面里出现了一个人”而是希望检测系统回答“这个人在做什么、手里拿了什么、有没有异常行为”。这种需求如果用传统检测器硬做本质上只是在堆类别但往多模态方向走检测模型就需要具备更强的语义能力。这也是我这周花了比较多时间读多模态目标检测相关论文的原因。2. YOLO系和Transformer系通用检测器仍然是论文底盘2.1 YOLO目标检测流程从yaml配置文件到训练评估这周关于YOLO的论文还是不少虽然结构大改的不多但很多工作都把改进点放在训练流程上。这就引出一个老生常谈但非常重要的问题YOLO项目的配置和流程到底怎么搭才能稳定复现。目前在YOLO系列里尤其是ultralytics的YOLOv8和YOLOv11整个目标检测流程被封装得相当简洁但越简洁越容易让人忽略关键步骤。我自己在项目里反复确认过的一套流程是这样的数据准备把标注转成YOLO格式即每个目标一行class_id x_center y_center width height坐标全部归一化到0到1之间。这里我踩过最大的坑是坐标没有归一化就直接开训结果模型损失直接爆掉。编写数据集yaml指定train和val的路径、类别数量nc、类别名称names。这个文件看起来简单但路径写错是最常见的报错点。模型选择根据任务复杂度决定用n、s、m、l、x哪个尺寸。配置训练超参数batch size、epochs、学习率、权重衰减、数据增强参数。训练与评估训练过程会输出loss曲线和验证集指标通过计算mAP等目标检测评价指标来判断是否收敛。这个流程里最容易被低估的是yaml配置文件的作用。很多人以为它就是写个路径和类别名实际上在YOLOv8里模型结构本身也可以用yaml定义。如果你要改骨干网络、改检测头、加注意力模块都是通过修改模型yaml来实现的。这里补充一句yolo3目标检测时期的配置思路其实也是这样只是那时候结构更硬编码一些到了v8时代配置化已经非常彻底。2.2 给YOLOv8加小目标检测头一种常见改法这周的论文里关于小目标的讨论特别多而yolov8小目标检测头也是一个高频关键词。很多人直接问“v8怎么检测小目标”我在这里把常见的做法说清楚。默认情况下YOLOv8的检测头接在P3、P4、P5三个特征层上对应stride分别是8、16、32适合检测中等和较大的目标。小目标由于像素少经过多次下采样后特征几乎消失所以一个很自然的思路就是在更浅、分辨率更高的特征层上增加一个检测头。具体到ultralytics的实现里你需要在模型yaml的head部分手动添加一个基于P2层stride为4的检测头同时把对应的通道数、检测层数配好。以c2f模块为例增加P2头大致流程是在backbone输出部分保留P2层特征而不是只取P3/P4/P5。在head部分新增一个检测分支输入P2特征图输出小目标的框和类别。重新调整各检测头的anchor或anchor-free参数保证尺寸匹配。这个改法能显著提升小目标召回但也有代价P2层特征图尺寸大计算量会明显上升而且容易出现大量重复框。如果项目跑在嵌入式设备上需要权衡算力。我个人的建议是先试P3/P4/P5三个头的默认结构把小目标检测头作为调优阶段的手段而不是一开始就加上。2.3 Transformer检测器这周的新意说完了YOLO系来看看Transformer目标检测。这周关于DETR系的工作给我的整体印象是大家不再纠结于“transformer到底能不能做检测”这种问题而是把精力放在训练收敛速度和query设计上。早期的DETR收敛慢是出了名的主要原因是匈牙利匹配带来的训练不稳定。后续的Deformable DETR通过可变形注意力大幅提升了收敛速度而DINO这类工作进一步加入了denoising training让模型在训练初期就能获得更稳定的匹配信号。这周看到的几篇论文基本也是在query初始化、注意力mask、正负样本分配这几个点上下功夫。从实际项目体验来说如果数据量不大我建议别贸然上纯Transformer检测器RT-DETR这类混合架构会更省心。但如果你想在论文里找启发点Transformer系仍然是值得持续跟踪的方向因为它在端到端检测和去除NMS这条路线上代表着一个很明确的趋势。3. 小目标、无人机和水下场景越难论文越多3.1 小目标检测为什么难小目标检测是这周论文里出现频率极高的关键词背后其实是很硬核的困难目标在图像里只占据几十个像素甚至几个像素卷积下采样几轮之后特征彻底糊掉标注和检测都靠肉眼硬找。以COCO的定义为例小于32x32像素的目标就算小目标。但在无人机和遥感场景里32x32已经算大的了大量目标甚至不到8x8像素。小目标检测困难的核心在于信息量不足可提取的外观特征非常有限。正负样本极度不均衡一张大图里小目标数量可能极少。标注框本身存在偏移。几个像素的偏差在普通目标上无所谓在小目标上就是几十个百分点的IoU变化。我在项目里真实遇到过这类情况后来用了多层特征融合加高分辨率输入才把召回拉起来。但要提醒的是直接把原图resize到更大尺寸并不一定有效因为显存撑不住而且单纯的resize不会增加信息量。更实用的做法是切图训练或多尺度训练。3.2 不同场景的数据集差异这周论文里另一个高频词是数据集构建特别是无人机目标检测和水下目标检测这两个方向。这里我顺便把几个常见公开数据集列入表格方便刚开始做项目的朋友选型场景常见数据集特点无人机/遥感VisDrone、DOTA、xView、AI-TOD目标密集、尺度极小、视角俯拍水下URPC、UODD等光照差、对比度低、生物形变鸟类监测主要在自有数据上构建集群遮挡、背景复杂、姿态多变“鸟类目标检测的数据集”这个点也很典型。很多人想做鸟类监测但公开可用的检测级数据很少很多论文里的鸟类检测数据集是自己在监控视频上标注的。即便像CUB-200-2011、NABirds这类经典数据集更多也是面向细粒度分类而不是检测。所以如果你的项目是鸟类检测我的建议是先明确任务到底是“框出鸟在哪里”还是“识别鸟的种类”这会直接影响数据集选型和标注策略。3.3 处理小目标的几个实操建议结合这周的论文和我自己的项目经验处理小目标检测有几个可复用的做法采用切图策略。把大图切成若干有重叠的子图每个子图单独训练相当于用空间换尺度。使用多尺度训练。输入尺寸在一定范围内动态变化能让模型适应不同尺度目标。尝试在损失函数里给小目标更大的权重或者使用更细粒度的回归损失。关注评估指标里的小目标AP。如果AP_small始终很低说明模型对小目标基本没有学习到有效特征而不是简单调参就能解决。数据增强里加入马赛克、拷贝粘贴等策略把训练集中稀疏的小目标复制粘贴到其他图像中缓解样本不足问题。这些方法不是互相排斥的通常要组合使用。我在实际项目中验证过切图加多尺度训练小目标AP一般能提升三到五个点代价是训练时间变长推理时也需要做拼图后处理。4. 三维目标检测与点云3D检测自然延伸4.1 点云3D目标检测的技术路线这周三维目标检测方向的论文数量也很稳定主要集中在自动驾驶和机器人场景。点云3D目标检测的技术路线大致可以分为三类。第一类是point-based方法直接对原始点云做处理。这类方法理论上能保留最完整的几何信息但是点云数量庞大直接计算开销很高代表性思路有PointNet等。第二类是voxel-based方法把空间体素化后用稀疏卷积处理。体素化之后计算效率高是工业界的主流选择比如VoxelNet、SECOND以及后续的CenterPoint系列。这类方法的关键在于体素大小和特征提取网络的设计太大丢失细节太小计算爆炸。第三类是BEV视角方法把三维空间投影到鸟瞰图然后在二维空间里做检测。这个思路的好处是能复用大量2D检测技术雷达点云、摄像头图像都可以通过特征投影统一到BEV空间然后做多模态融合。从我这周看到的论文趋势来看point-based和voxel-based的边界在模糊很多工作都在做混合结构核心诉求是在效率和精度之间找平衡点。4.2 从2D检测迁移到3D检测要注意什么很多做2D目标检测的朋友开始接触点云3d目标检测时会下意识地把2D的思路搬过去但有三个坑值得提前说。第一3D标注成本远比2D高。2D只需要画框3D需要标注位置、尺寸、朝向角还要保证点云和图像同步。如果项目预算有限建议先评估是否真的需要3D检测还是可以用单目3D方案替代。第二评估指标不一样。3D检测常用mAP但还会按距离分档评估近处目标和远处目标的精度要分开看。只看整体mAP很容易掩盖远距离漏检的问题。第三数据格式和预处理完全不同。点云数据涉及去地面、滤波、聚类、体素化、坐标变换等步骤任何一个环节出问题都会影响最终检测结果。建议先跑通一个CenterPoint或PointPillars的开源实现再逐步替换自己的数据而不是从零开始搭管线。5. 多模态目标检测当检测遇见视觉语言模型5.1 先说说我理解的多模态目标检测多模态目标检测这周也被很多人提起它其实是一个很宽泛的概念。狭义来看多模态可以指同时使用图像和点云、图像和文本、图像和音频做检测广义来看现在只要检测模型接入了语言指令或开放词汇能力大家都习惯叫它多模态目标检测。这周有几个方向值得关注。一个是开放词汇检测模型不再局限于训练时的固定类别而是可以检测任意自然语言描述的物体这背后依赖图像和文本的特征对齐。另一个是指代检测比如用户说“左边穿红色衣服的人”模型要能从这句话里理解位置和属性约束再定位到具体目标。这两类工作都和qwen-vl这类视觉语言模型有关系。我自己在实际项目中试过用视觉语言模型做“描述性检测”。比如监控场景里传统模型只能输出“人”“车”这样的固定类别但换到VLM方案之后可以用自然语言来描述目标属性再用grounding方式输出bbox。这种灵活度对长尾场景特别有价值。5.2 Qwen-VL这类模型里的坐标和位置编码热词里有个非常具体的问题qwen-vl目标检测用的绝对位置吗这个问题属于原理细节我把我的理解整理一下。像Qwen-VL这类视觉语言模型做目标检测或者说grounding任务时一般会把边界框表示成文本片段。具体来说模型把原图分成固定网格比如448x448然后对每个网格坐标做离散化编码再以文本token的形式预测出“左上角坐标”和“右下角坐标”。这里使用的坐标本身通常是归一化或离散化后的绝对像素坐标。相对于原图尺寸这就属于“绝对位置”坐标表示。但要注意这和模型内部注意力机制使用的位置编码不是一回事。Transformer内部的位置编码可以有绝对位置编码、相对位置编码、旋转位置编码RoPE等多种方案。很多视觉语言模型在视觉编码器和语言解码器里用的是二维RoPE通过旋转矩阵注入位置信息。所以如果严格回答“用没用绝对位置”要分两层看框坐标输出是绝对坐标但网络内部的位置编码未必是简单的绝对位置编码。这个细节在调试模型的时候会起作用。如果你发现模型给出的坐标有系统性偏移比如总往左上角偏一点那往往是对齐阶段的数据格式和推理阶段的尺寸处理不一致导致的和位置编码的关系反而不大。5.3 用VLM做检测时怎么设计训练数据如果你想把多模态目标检测落到自己的数据集上数据格式是个关键问题。以常见做法为例训练数据大致长这样[ { image: xxx.jpg, conversations: [ { user: 请找出图中所有红色的杯子, assistant: 好的box(x1,y1,x2,y2)/boxbox(x3,y3,x4,y4)/box其中一共有两个红色的杯子。 } ] } ]坐标建议按原图宽高归一化到0到1000之类的整数范围避免精度太低。训练的时候损失主要计算两部分文本token的交叉熵损失以及框坐标token的回归损失。很多视觉语言模型框架都支持这种多模态训练但需要自己写数据解析和坐标转换逻辑。这一块如果以前只做过纯检测上手会有一点门槛但收益也明显类别扩展不需要重新训练检测头只要换自然语言描述就行。这也是我判断未来目标检测项目会越来越多往这个方向走的原因。6. 目标检测评价指标训练过程中真正要盯的东西6.1 一套评价标准怎么拆开看目标检测训练过程中评价标准是一个绕不开的话题。这周也有不少论文在讨论评价指标本身这说明大家越来越意识到指标设计对模型优化方向的影响。目标检测里最常用的一级指标是mAP。但mAP有好几种算法理解它们对我来说还是踩过不少坑。PASCAL VOC时代的mAP默认IoU阈值是0.5也就是预测框和真实框的IoU大于0.5就算正样本。COCO的mAP更进一步计算IoU从0.5到0.95每隔0.05取一个阈值再把十个阈值下的AP求平均记为mAP0.5:0.95。这个指标对框的定位精度要求更高也更接近真实项目里的体感。如果进一步拆分AP还分为小目标AP、中目标AP、大目标AP对应COCO里的AP_small、AP_medium、AP_large。你在论文里经常看到某个方法说“对小目标提升明显”一般展示的就是AP_small这个维度。除了AP系列AR平均召回率也是一个重要参考。有些任务宁可误报也不允许漏报那就要重点看AR。实际工程里还会综合看F1分数和推理帧率FPS在边缘设备上往往比零点几个点的AP更关键。6.2 训练时如何判断模型是否在变好很多新人训练检测模型喜欢一直盯着loss曲线loss降了就高兴loss不降就焦虑。实际上loss下降和指标变好并不总是同步的。我习惯在训练启动后同时观察几个数值训练loss、验证集mAP50、验证集mAP50-95。如果mAP50在涨但mAP50-95一直不动说明模型的分类和粗定位能力还行但精确定位能力不足这时候要检查回归损失和IoU损失是否被合理加权。如果loss在降但mAP完全不动要警惕过拟合或正负样本分配失衡。另外一个很常见的坑是类别不均衡。比如某个类别在数据集里占90%模型只要把所有目标都预测成这个类别mAP50可能依然不低但mAP50-95和AP_small会很难看。所以评价目标检测模型一定要拆开看每个类别的AP不能只看总mAP。7. 我用什么方法整理arxiv论文流程、工具和笔记模板7.1 我的周报流程既然这篇标题是arxiv论文整理最后我还是把自己整理论文的方法分享出来给也想做定期跟踪的朋友参考。每周固定花一个晚上把arxiv上目标检测相关的论文过一遍看起来工作量很大但如果流程固定其实只需要一个小时左右。我的流程大致是先进arxiv官网用目标检测、object detection、yolo等关键词搜最近一周的新论文按时间排序。先只看标题和摘要快速排除掉与手头方向无关的论文。这里有个小技巧如果看到arxiv:2406.09246这种具体编号可以直接在arxiv官网搜索框里输入编号能立刻打开对应论文页面不用到处翻链接。对留下的论文再看作者团队、是否开源、是否有代码链接。没有代码的论文如果不是思路特别有启发一般先放一放。最后把值得细读的论文下载下来按方向放进本地文件夹读的时候做笔记。7.2 笔记模板和追踪技巧我自己的论文笔记模板很简单但很有效字段说明论文编号方便回查一句话贡献用一两句话概括作者做了什么核心方法大致的技术路线和模块设计实验结果在什么数据集上比哪些方法高多少可借鉴点对当前项目有参考价值的细节是否复现标记要不要跑代码验证追踪论文的另一个技巧是用表格维护一个“本周关注清单”把论文编号、方向、阅读状态、复现优先级都列进去。专栏文章就是表格的升级版整理成带个人理解的方向总结。这样做几个月后你对领域脉络的把握会远超零散刷论文的时候。最后再分享一个我自己的习惯不要只盯arxiv上新挂出的论文也要往回追一两年前的经典工作。很多这周的新论文核心思想其实在更早的工作里就已经有了只是换了个场景、换了个数据集。先吃透经典再看新工作效率会高非常多。