返回报告库

AI / Technology

用 Transformer 实现端到端目标检测

关于这篇论文的三个关键问题

用 Transformer 实现端到端目标检测 解决了什么问题?

一个集合没有天然顺序:交换两个预测的位置,答案仍应相同。与此同时,模型若对同一只狗输出五个近似框,也不能算五次正确。直接集合预测因此要同时解决两个问题:损失函数不能依赖输出顺序,并且每个真实目标必须获得唯一预测。早期方法往往依赖自回归模型或仍需 NMS;DETR 的目标是让模型一次并行给出结果,且不靠检测专用后处理。论文,第 2–4 页

用 Transformer 实现端到端目标检测 的核心结论有哪些证据?

作者在 COCO 2017 验证集上与经过加强的 Faster R-CNN 比较。使用 ResNet-50 时,DETR 与 Faster R-CNN-FPN+ 都达到 42.0 AP;DETR 的参数量为 41M、速度 28 FPS,对方为 42M、26 FPS。差异集中在物体尺度:DETR 的 APL 61.1,比 53.4 高 7.7;但 APS 20.5,比 26.6 低 6.1。换成 ResNet-101 与 DC5 高分辨率特征后,最佳 DETR 变体达到 44.9 AP,但速度降至 10 FPS。论文,第 9 页,表 1

阅读 用 Transformer 实现端到端目标检测 时最需要注意什么局限?

论文还展示了扩展性:在预训练 DETR 上增加 mask head,可统一处理全景分割;作者报告 COCO test 上达到 46 PQ。不过,这属于附加任务的可扩展性证据,不等于检测主结果在所有数据集或部署环境中都成立。论文,第 14–17 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro