超越YOLOv10/11、RT-DETRv2/3!中科大D-FINE重新定义边界框回归任务

简介: 中科大研究团队提出了一种新型目标检测器D-FINE,通过重新定义边界框回归任务,实现超越YOLOv10/11和RT-DETRv2/3的性能。D-FINE采用细粒度分布细化(FDR)和全局最优定位自蒸馏(GO-LSD)技术,显著提高了定位精度和检测速度。在COCO数据集上,D-FINE-L/X分别达到54.0%/55.8%的AP,并在NVIDIA T4 GPU上以124/78 FPS运行。

在计算机视觉领域,目标检测一直是研究的热点。近年来,基于深度学习的目标检测算法取得了显著的进展,其中YOLO系列和DETR系列算法尤为突出。然而,这些算法在边界框回归任务上仍存在一定的局限性。为了解决这一问题,中科大的研究团队提出了一种名为D-FINE的新型目标检测器,该检测器通过重新定义边界框回归任务,实现了超越YOLOv10/11、RT-DETRv2/3的性能。

D-FINE的核心思想是将边界框回归任务从预测固定坐标转变为迭代地细化概率分布。具体而言,D-FINE由两个关键组件组成:细粒度分布细化(FDR)和全局最优定位自蒸馏(GO-LSD)。

FDR通过将回归过程从预测固定坐标转变为迭代地细化概率分布,提供了一种细粒度的中间表示,从而显著提高了定位精度。与传统的边界框回归方法相比,FDR能够更准确地捕捉目标的位置和形状信息,从而提高检测性能。

GO-LSD是一种双向优化策略,它通过自蒸馏将细化后的分布中的定位知识传递给较浅的层,同时简化了较深层的残差预测任务。这种双向优化策略不仅提高了模型的定位能力,还减少了模型的计算复杂度,从而实现了速度和精度的平衡。

为了验证D-FINE的性能,研究团队在COCO数据集上进行了实验。实验结果表明,D-FINE-L/X在COCO数据集上分别达到了54.0%/55.8%的AP,并在NVIDIA T4 GPU上以124/78 FPS的速度运行。当在Objects365数据集上进行预训练时,D-FINE-L/X的性能进一步提升,分别达到了57.1%/59.3%的AP,超越了所有现有的实时检测器。

此外,研究团队还对D-FINE在不同DETR模型上的性能进行了评估。结果表明,D-FINE能够显著提高各种DETR模型的性能,最高可提升5.3%的AP,且额外参数和训练成本几乎可以忽略不计。

D-FINE的优势主要体现在以下几个方面:

  1. 定位精度高:通过重新定义边界框回归任务,D-FINE能够更准确地捕捉目标的位置和形状信息,从而提高检测性能。
  2. 速度与精度平衡:通过引入轻量级优化和双向优化策略,D-FINE在保持高精度的同时,实现了较快的检测速度。
  3. 通用性强:D-FINE能够显著提高各种DETR模型的性能,具有广泛的应用前景。

然而,D-FINE也面临一些挑战:

  1. 计算复杂度:尽管D-FINE通过轻量级优化和双向优化策略减少了计算复杂度,但在实际应用中,仍需要考虑计算资源的限制。
  2. 数据依赖性:D-FINE的性能高度依赖于训练数据的质量和数量。在实际应用中,如何获取高质量的训练数据是一个重要的问题。
  3. 模型泛化能力:尽管D-FINE在COCO和Objects365等数据集上表现出色,但在其他数据集上的性能仍有待验证。

论文地址: https://arxiv.org/abs/2410.13842

目录
相关文章
|
1天前
|
存储 运维 安全
云上金融量化策略回测方案与最佳实践
2024年11月29日,阿里云在上海举办金融量化策略回测Workshop,汇聚多位行业专家,围绕量化投资的最佳实践、数据隐私安全、量化策略回测方案等议题进行深入探讨。活动特别设计了动手实践环节,帮助参会者亲身体验阿里云产品功能,涵盖EHPC量化回测和Argo Workflows量化回测两大主题,旨在提升量化投研效率与安全性。
云上金融量化策略回测方案与最佳实践
|
3天前
|
人工智能 自然语言处理 前端开发
从0开始打造一款APP:前端+搭建本机服务,定制暖冬卫衣先到先得
通义灵码携手科技博主@玺哥超carry 打造全网第一个完整的、面向普通人的自然语言编程教程。完全使用 AI,再配合简单易懂的方法,只要你会打字,就能真正做出一个完整的应用。
3646 16
|
15天前
|
人工智能 自动驾驶 大数据
预告 | 阿里云邀您参加2024中国生成式AI大会上海站,马上报名
大会以“智能跃进 创造无限”为主题,设置主会场峰会、分会场研讨会及展览区,聚焦大模型、AI Infra等热点议题。阿里云智算集群产品解决方案负责人丛培岩将出席并发表《高性能智算集群设计思考与实践》主题演讲。观众报名现已开放。
|
7天前
|
自然语言处理 数据可视化 API
Qwen系列模型+GraphRAG/LightRAG/Kotaemon从0开始构建中医方剂大模型知识图谱问答
本文详细记录了作者在短时间内尝试构建中医药知识图谱的过程,涵盖了GraphRAG、LightRAG和Kotaemon三种图RAG架构的对比与应用。通过实际操作,作者不仅展示了如何利用这些工具构建知识图谱,还指出了每种工具的优势和局限性。尽管初步构建的知识图谱在数据处理、实体识别和关系抽取等方面存在不足,但为后续的优化和改进提供了宝贵的经验和方向。此外,文章强调了知识图谱构建不仅仅是技术问题,还需要深入整合领域知识和满足用户需求,体现了跨学科合作的重要性。
|
3天前
|
人工智能 容器
三句话开发一个刮刮乐小游戏!暖ta一整个冬天!
本文介绍了如何利用千问开发一款情侣刮刮乐小游戏,通过三步简单指令实现从单个功能到整体框架,再到多端优化的过程,旨在为生活增添乐趣,促进情感交流。在线体验地址已提供,鼓励读者动手尝试,探索编程与AI结合的无限可能。
|
1月前
|
存储 人工智能 弹性计算
阿里云弹性计算_加速计算专场精华概览 | 2024云栖大会回顾
2024年9月19-21日,2024云栖大会在杭州云栖小镇举行,阿里云智能集团资深技术专家、异构计算产品技术负责人王超等多位产品、技术专家,共同带来了题为《AI Infra的前沿技术与应用实践》的专场session。本次专场重点介绍了阿里云AI Infra 产品架构与技术能力,及用户如何使用阿里云灵骏产品进行AI大模型开发、训练和应用。围绕当下大模型训练和推理的技术难点,专家们分享了如何在阿里云上实现稳定、高效、经济的大模型训练,并通过多个客户案例展示了云上大模型训练的显著优势。
|
7天前
|
Cloud Native Apache 流计算
PPT合集|Flink Forward Asia 2024 上海站
Apache Flink 年度技术盛会聚焦“回顾过去,展望未来”,涵盖流式湖仓、流批一体、Data+AI 等八大核心议题,近百家厂商参与,深入探讨前沿技术发展。小松鼠为大家整理了 FFA 2024 演讲 PPT ,可在线阅读和下载。
3332 10
PPT合集|Flink Forward Asia 2024 上海站
|
20天前
|
人工智能 自然语言处理 前端开发
100个降噪蓝牙耳机免费领,用通义灵码从 0 开始打造一个完整APP
打开手机,录制下你完成的代码效果,发布到你的社交媒体,前 100 个@玺哥超Carry、@通义灵码的粉丝,可以免费获得一个降噪蓝牙耳机。
5914 16
|
3天前
|
消息中间件 人工智能 运维
12月更文特别场——寻找用云高手,分享云&AI实践
我们寻找你,用云高手,欢迎分享你的真知灼见!
417 36
|
1天前
|
云安全 人工智能 安全