【小样本图像分割-1】PANet: Few-Shot Image Semantic Segmentation with Prototype Alignment

简介: 本文介绍了ICCV 2019的一篇关于小样本图像语义分割的论文《PANet: Few-Shot Image Semantic Segmentation With Prototype Alignment》。PANet通过度量学习方法,从支持集中的少量标注样本中学习类的原型表示,并通过非参数度量学习对查询图像进行分割。该方法在PASCAL-5i数据集上取得了显著的性能提升,1-shot和5-shot设置下的mIoU分别达到48.1%和55.7%。PANet还引入了原型对齐正则化,以提高模型的泛化能力。


最近看SAM分割模型中多次提到了小样本图像的分割,为了能够搞清楚整个研究的思路,现在将小样本图像分割的论文内容做个笔记,用于备用。本次阅读的论文来自ICCV2019的一篇文章,用的是比较传统

文章的地址:论文地址

代码的地址:开源代码

摘要

尽管深度cnn在图像语义分割方面取得了很大的进步,但它们通常需要大量密集标注的图像进行训练,并且难以推广到看不见的对象类别。因此,开发了少量镜头分割,以学习仅从几个注释示例中执行分割。本文从度量学习的角度解决了具有挑战性的少镜头分割问题,并提出了一种新的原型对准网络PANet,以更好地利用支持集的信息。我们的PANet从嵌入空间内的一些支持图像中学习特定于类的原型表示,然后通过将每个像素与学习到的原型进行匹配,对查询图像进行分割。通过非参数度量学习,PANet提供了高质量的原型,这些原型对每个语义类都具有代表性,同时对不同的类具有区别性。此外,PANet还引入了支持和查询之间的原型对齐正则化。这样,PANet充分利用了来自支持的知识,并在少镜头分割上提供了更好的泛化。值得注意的是,我们的模型在PASCAL-5i上的1枪和5枪设置的mIoU得分分别为48.1%和55.7%,比最先进的方法分别高出1.8%和8.6%。

作者提出的方法

首先作者提出的网络结构称为PANET,这里作者的思路是首先利用支持集和查询集进行特征提取提取之后,用查询集的原始图像特征和MASK图像特征去预测查询集图像的mask,然后将查询集的mask作为标签,再去预测支持集的MASK,通过这样的作法,可以保证支持集和查询集的一致性,让网络的泛化性更好。

image-20240813234125866

我们的模型(PANet)的概述,用于少样本分割。PANet首先将支持和查询图像映射到嵌入特征中(分别为圆形和三角形),并学习每个类的原型(蓝色和黄色实圆)。然后通过将查询的特征与嵌入空间(虚线)内最近的原型匹配来执行查询的分割。PANet在训练过程中进一步引入了原型对齐正则化,通过从查询到支持(右图)反向执行几次分割来对齐嵌入空间中来自支持和查询图像的原型。带有虚线边界的分割掩码表示ground truth注释。

image-20240813234343843

在一个2-way 1-shot示例中说明作者方法的流程。在块(a)中,PANet执行支持查询的少样本分割。支持和查询图像嵌入到深层特征中。然后通过掩模平均池化得到原型。通过计算每个原型与查询特征在每个空间位置的余弦距离(图中cos)来分割查询图像。在分割结果和ground truth mask之间计算Loss Lseg。在块(b)中,提议的PAR通过执行查询到支持的少样本分割和计算LPAR损失来对齐支持和查询的原型。GT表示标签分割掩码。

2-way 1-shot表示的是有两个类,其中每个类只有一个样本。比如上面的图示中,两个类分别是马和人,马和人作在上面的支持集每个类别只有一张图像。然后作者希望做的事情是通过支持集中仅有的一个人和一个马的原始图像和mask作为支持集,通过计算相似度的方式,在查询集中同时分割出人和马。

本方法的一些效果

下面是作者给出的一些效果,从思路上看很新颖,但是从工业落地的角度来说,工业上更讲究的是准确率,这样的准确率我个人认为虽然节省成本,但是还是达不到目前工业的实际应用。

image-20240813235326826

另外作者还给出了一种有趣的实现方式,只通过简单的涂鸦方式的标记和边界框形式的标注也能在分割上表现出良好的性能。

image-20240813235523645

结论

提出了一种基于度量学习的小镜头分割方法。PANet能够从支持集中提取鲁棒原型,并使用非参数距离计算进行分割。利用提出的PAR,我们的模型可以进一步利用支持信息来辅助训练。在没有任何解码器结构或后处理步骤的情况下,我们的PANet大大优于以前的工作。

所以我个人认为,基于SAM模型的基础上继续改进应该可以得到足够经验的效果,在特定的数据集上。

目录
相关文章
|
2天前
|
编解码 Java 程序员
写代码还有专业的编程显示器?
写代码已经十个年头了, 一直都是习惯直接用一台Mac电脑写代码 偶尔接一个显示器, 但是可能因为公司配的显示器不怎么样, 还要接转接头 搞得桌面杂乱无章,分辨率也低,感觉屏幕还是Mac自带的看着舒服
|
3天前
|
存储 缓存 关系型数据库
MySQL事务日志-Redo Log工作原理分析
事务的隔离性和原子性分别通过锁和事务日志实现,而持久性则依赖于事务日志中的`Redo Log`。在MySQL中,`Redo Log`确保已提交事务的数据能持久保存,即使系统崩溃也能通过重做日志恢复数据。其工作原理是记录数据在内存中的更改,待事务提交时写入磁盘。此外,`Redo Log`采用简单的物理日志格式和高效的顺序IO,确保快速提交。通过不同的落盘策略,可在性能和安全性之间做出权衡。
1540 5
|
1月前
|
弹性计算 人工智能 架构师
阿里云携手Altair共拓云上工业仿真新机遇
2024年9月12日,「2024 Altair 技术大会杭州站」成功召开,阿里云弹性计算产品运营与生态负责人何川,与Altair中国技术总监赵阳在会上联合发布了最新的“云上CAE一体机”。
阿里云携手Altair共拓云上工业仿真新机遇
|
7天前
|
人工智能 Rust Java
10月更文挑战赛火热启动,坚持热爱坚持创作!
开发者社区10月更文挑战,寻找热爱技术内容创作的你,欢迎来创作!
578 22
|
3天前
|
存储 SQL 关系型数据库
彻底搞懂InnoDB的MVCC多版本并发控制
本文详细介绍了InnoDB存储引擎中的两种并发控制方法:MVCC(多版本并发控制)和LBCC(基于锁的并发控制)。MVCC通过记录版本信息和使用快照读取机制,实现了高并发下的读写操作,而LBCC则通过加锁机制控制并发访问。文章深入探讨了MVCC的工作原理,包括插入、删除、修改流程及查询过程中的快照读取机制。通过多个案例演示了不同隔离级别下MVCC的具体表现,并解释了事务ID的分配和管理方式。最后,对比了四种隔离级别的性能特点,帮助读者理解如何根据具体需求选择合适的隔离级别以优化数据库性能。
201 3
|
10天前
|
JSON 自然语言处理 数据管理
阿里云百炼产品月刊【2024年9月】
阿里云百炼产品月刊【2024年9月】,涵盖本月产品和功能发布、活动,应用实践等内容,帮助您快速了解阿里云百炼产品的最新动态。
阿里云百炼产品月刊【2024年9月】
|
10天前
|
Linux 虚拟化 开发者
一键将CentOs的yum源更换为国内阿里yum源
一键将CentOs的yum源更换为国内阿里yum源
578 5
|
23天前
|
存储 关系型数据库 分布式数据库
GraphRAG:基于PolarDB+通义千问+LangChain的知识图谱+大模型最佳实践
本文介绍了如何使用PolarDB、通义千问和LangChain搭建GraphRAG系统,结合知识图谱和向量检索提升问答质量。通过实例展示了单独使用向量检索和图检索的局限性,并通过图+向量联合搜索增强了问答准确性。PolarDB支持AGE图引擎和pgvector插件,实现图数据和向量数据的统一存储与检索,提升了RAG系统的性能和效果。
|
6天前
|
XML 安全 Java
【Maven】依赖管理,Maven仓库,Maven核心功能
【Maven】依赖管理,Maven仓库,Maven核心功能
233 3
|
9天前
|
存储 人工智能 搜索推荐
数据治理,是时候打破刻板印象了
瓴羊智能数据建设与治理产品Datapin全面升级,可演进扩展的数据架构体系为企业数据治理预留发展空间,推出敏捷版用以解决企业数据量不大但需构建数据的场景问题,基于大模型打造的DataAgent更是为企业用好数据资产提供了便利。
327 2