开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于双注意力机制的显著性目标检测方法

更新时间:2026-09-13
一种基于双注意力机制的显著性目标检测方法 专利申请类型:发明专利;
地区:海南-海口;
源自:海口高价值专利检索信息库;

专利名称:一种基于双注意力机制的显著性目标检测方法

专利类型:发明专利

专利申请号:CN202210626663.9

专利申请(专利权)人:海南大学
权利人地址:海南省海口市人民路街道人民大道58号

专利发明(设计)人:胡祝华,代雨桐,赵瑶池

专利摘要:本发明提供了一种基于双注意力机制的显著性目标检测方法:步骤1、使用数据增强技术扩充数据集;步骤2、将数据输入到包含有水平集注意力机制模块LSA(Level?SetAttention)、反向通道注意力机制模块R?CA(Reverse?ChannelAttention)、后向反馈与结构化损失的RCANet网络中进行训练并得到训练模型;步骤3、输入待检测数据到模型中得到显著性目标检测结果。利用本发明方法能够获得更丰富的语义信息,使得后续网络更好区分标签与背景,以较少的参数在深层网络获得位置信息,同时本发明方法可以细化轮廓,提取出更清晰的边界,使得网络整体性能提高。

主权利要求:
1.一种基于双注意力机制的显著性目标检测方法,其特征在于,其特征在于:包括以下步骤:步骤1、使用数据增强技术扩充数据集;
步骤2、将数据输入到包含有水平集注意力机制模块LSA(Level?SetAttention)、反向通道注意力机制模块R?CA(Reverse?ChannelAttention)、后向反馈与结构化损失的RCANet网络中进行训练并得到训练模型,其特征在于:水平集注意力机制模块LSA(Level?SetAttention)包括:使用正向和反向两种方式得到主干网络特征图的权重,两者进行加权获得处理后的特征图;
fgmp=MLP(GMP(finput))(1)
fgap=MLP(GAP(finput))(2)
C×H×W
其中,C、H、W为维度,finput∈R 为输入特征,MLP表示多层感知机,使用三个卷积层实C×HW C×HW现,fgmp∈R 表示输入特征经过MLP后的全局最大池化特征,fgap∈R 表示输入特征经过MLP后的全局平均池化特征,GMP和GAP分别表示全局最大池化操作和卷积平均池化操作;
fgap_out=concat{Softmax(Unsqueeze(fgap))+(1?Unsqueeze(Sigmoid(fgap)))}(3)fgmp_out=concat{Softmax(Unsqueeze(fgmp))+(1?Unsqueeze(Sigmoid(fgmp)))}(4)fout=concat(fgap_out+fgmp_out)(5)其中,Unsqueeze(.)表示解压缩操作,concat(.)表示concatenation操作,Softmax(.)表示Softmax函数,Sigmoid(.)表示Sigmoid函数,fgap_out与fgmp_out表示使用正向与反向两种方式得到的两组输出特征,fout为最终的特征输出;
反向通道注意力机制模块R?CA(Reverse?ChannelAttention)包括:首先将获得的高维度特征取负向,得到标签与背景相反的二值图,再通过与低维度特征进行像素乘积得到混合特征;随后将混合特征通过一组卷积操作后与输入的高维特征进行像素加,得到反向注意力机制处理后的特征;最后将该特征输入到通道注意力机制模块中,利用全局最大池化和全局平均池化操作并使用同一个MLP模块将二者得到的特征进行相加,再与原来的混合特征进行像素乘积得到最终的输出;
结构化损失包括:在BCE的基础上添加新的权重算子F?measure,F?measure是显著性目标检测中的重要指标,基于这一指标提出了F?measure的损失算子;
其中,γ是超参数,αij是经过计算得到的权重值,l∈{0,1}表示两种标签,即背景和标签, 和 是图像中位置(i,j)的像素的预测和真实值,Ψ表示模型的所有参数,表示预测概率;
F?measure是准确率(Precision)和召回率(Recall)的加权调和平均,新的P和R公式为:其中,P和R是准确率与召回率的近似结果;
所以权重F?measure算子的损失为:
2
其中,β是关于F?measure的超参数;ε是一个非常小的超参数,防止损失为0的情况;
因此,结构化损失函数为:
Lloss=Lwbce+Floss(10)
可以得到最终结构化损失函数;
步骤3、输入待检测数据到模型中得到显著性目标检测结果。
2.根据权利要求1所述的方法,其特征在于,步骤2所述方法还包括:RCANet网络的总体结构中,网络从backbone获得了4个通道数统一为64的特征层,且每个特征层都接入LSA模块;最深的特征层即第4层分为三个分支,一个分支作为输出;一个分支进行上采样操作传递给浅层特征;最后一个分支与其他三层进行后向反馈特征融合,融合后的各层特征通过3个R?CA模块得到最终的输出,RCAnet网络模型共5个输出,结构化损失函数用于监督五个层级的输出,不断地细化轮廓,提升整体的模型性能。
3.根据权利要求1所述的方法,其特征在于,步骤2所述方法还包括:RCA模块嵌入到层级的特征融合中时,高维特征和低维特征通过两组卷积操作后输入到RCA中,RCA获得的输出再进行像素加得到混合特征,依次通过两组卷积分别得到层级输出和传递给浅层网络的特征,层级输出即为每层的输出,将这一部分的模块命名为层级特征混合模块CrossFusion(CF)。
4.根据权利要求1所述的方法,其特征在于,步骤2所述方法还包括:后向反馈将获取的特征中前三层的特征分别进行上采样操作,并进行特征融合操作将最深层的位置信息传递给浅层特征。 说明书 : 一种基于双注意力机制的显著性目标检测方法技术领域[0001] 本发明涉及深度学习和目标检测领域,具体说,涉及一种基于双注意力机制的显著性目标检测方法。背景技术[0002] 显著性目标检测是图像分割领域中的一项重要任务。通过显著性目标检测可以有效地忽略图像中的背景信息和冗余信息,减少后续的计算量,对计算机视觉任务如目标识别,跟踪等具有预处理作用。深度学习的蓬勃发展也为显著性目标检测带来许多新的挑战。目前深度学习为显著性目标检测方向带来了很大的进步,但仍需关注的如何在多尺度特征提取中更有效的提取信息。空洞卷积和特征金字塔常常被应用于多尺度特征提取中,前者可以扩大感受野,后者可以进一步获得更多尺度的特征信息。众所周知,虽然空洞卷积与多尺度特征融合有着上述优点,但是缺点也很明显:从backbone提出到的特征层,常常加入空洞卷积与多尺度融合的模块,但是对于浅层特征,计算效率很低,导致模型沉重,拖慢整体模型的速度。[0003] 现今在许多研究在最深层处使用空洞卷积和特征金字塔,既可以获取网路深层的位置信息,由一定程度上避免使用过多的模型参数。近年来,也有许多结合注意力机制的显著性目标检测方法。对于多层金字塔和空洞卷积的方法,这些方法虽然有效,但是多尺度的简单相加求和,过于冗余。发明内容[0004] 本发明的目的是一种基于双注意力机制的显著性目标检测方法,本发明方法针对当前在浅层网络中使用空洞卷积,导致分辨率增高,模型速度下降以及模型轮廓不清的问题,提出了一种水平集注意力机制模块与结构化损失并搭建了相关网络,利用该方法可以获取更丰富的语义信息进而更加注重整体,细化轮廓,在提升网络性能的同时降低了运算成本。[0005] 本发明的技术方案是提供一种基于双注意力机制的显著性目标检测方法,包括以下步骤:[0006] 步骤1、使用数据增强技术扩充数据集;[0007] 步骤2、将数据输入到包含有水平集注意力机制模块LSA(Level?SetAttention)、反向通道注意力模块R?CA(Reverse?ChannelAttention)、后向反馈与结构化损失的RCANet网络中进行训练并得到训练模型;[0008] 步骤3、输入待检测数据到模型中得到显著性目标检测结果。[0009] 进一步地,步骤2所述方法还包括:RCANet网络的总体结构中,网络从backbone获得了4个通道数统一为64的特征层,且每个特征层都接入LSA模块。最深的特征层分为三个分支,一个分支作为输出;一个分支进行上采样操作传递给浅层特征;最后一个分支与其他三层进行后向反馈特征融合。融合后的各层特征通过3个CF模块得到最终的输出。该网络模型共5个输出,结构化损失函数用于监督五个层级的输出,不断地细化轮廓,提升整体的模型性能。[0010] 进一步地,步骤2所述方法还包括:水平集注意力机制模块LSA(Level?SetAttention)使用正向和反向两种方式得到主干网络特征图的权重,两者进行加权获得处理后的特征图。[0011] fgmp=MLP(GMP(finput))(1)[0012] fgap=MLP(GAP(finput))(2)[0013] 其中,C、H、W为维度,finput∈RC×H×W为输入特征,MLP表示多层感知机,通过三个卷积C×HW C×HW层实现,fgmp∈R 表示输入特征经过MLP后的全局最大池化特征,fgap∈R 表示输入特征经过MLP后的全局平均池化特征,GMP和GAP分别表示全局最大池化操作和卷积平均池化操作。[0014] fgap_out=concat{Softmax(Unsqueeze(fgap))+(1?Unsqueeze(Sigmoid(fgap)))}(3)[0015] fgmp_out=concat{Softmax(Unsqueeze(fgmp))+(1?Unsqueeze(Sigmoid(fgmp)))}(4)[0016] fout=concat(fgap_out+fgmp_out)(5)[0017] 其中,Unsqueeze(.)表示解压缩操作,concat(.)表示concatenation操作,Softmax(.)表示Softmax函数,Sigmoid(.)表示Sigmoid函数,fgap_out与fgmp_out表示使用正向与反向两种方式得到的两组输出特征,fout为最终的特征输出。[0018] 进一步地,步骤2所述方法还包括:层级间特征融合模块RCA(Reverse?ChannelAttention)的详细操作为:首先将获得的高维度特征取负向,得到标签与背景相反的二值图,再通过与低维度特征进行像素乘积得到混合特征;随后将混合特征通过一组卷积操作后与输入的高维特征进行像素加,得到反向注意力机制处理后的特征;最后将该特征输入到通道注意力机制模块中,利用全局最大池化和全局平均池化操作并使用同一个MLP模块将二者得到的特征进行相加,再与原来的混合特征进行像素乘积得到最终的输出。[0019] 进一步地,步骤2所述方法还包括:RCA模块嵌入到层级的特征融合中获得CF模块,高维特征和低维特征通过两组卷积操作后输入到RCA中。RCA获得的输出再进行像素加得到混合特征,依次通过两组卷积分别得到层级输出和传递给浅层网络的特征,层级输出即为每层的输出。[0020] 进一步地,步骤2所述方法还包括:后向反馈将获取的特征中前三层的特征分别进行上采样操作,并进行融合操作将最深层的位置信息传递给浅层特征。[0021] 进一步地,步骤2所述方法还包括:结构化损失函数的计算包括:[0022] 本发明在BCE的基础上添加新的权重算子F?measure。F?measure是显著性目标检测中的重要指标,基于这一指标提出了F?measure的损失算子。[0023][0024] 其中,γ是超参数。αij是经过计算得到的权重值。l∈{0,1}表示两种标签,即背景和标签。 和 是图像中位置(i,j)的像素的预测和真实值。Ψ表示模型的所有参数,表示预测概率。[0025] F?measure是准确率(Precision)和召回率(Recall)的加权调和平均,新的P和R公式为:[0026][0027][0028] 其中,P和R是准确率与召回率的近似结果。[0029] 所以权重F?measure算子的损失为:[0030][0031] 其中,β2是关于F?measure的超参数。ε是一个非常小的超参数,防止损失为0的情况。[0032] 因此,结构化损失函数为:[0033] Lloss=Lwbce+Floss(10)[0034] 本发明的有益效果是:[0035] (1)本发明针对在显著性目标检测中浅层网络使用空洞卷积,导致分辨率增高,模型速度下降的问题,提出了水平集注意力机制模块,对backbone得到的特征进行处理,获得更丰富的语义信息,使得后续网络更好区分标签与背景,相较于融合空洞卷积的特征金字塔,能够以较少的参数情况下在深层网络获得位置信息。[0036] (2)本发明针对模型的轮廓不清的问题,为了更好地关注到局部与全局信息,提出了一种结构化损失。利用本发明提出的方法,可以细化轮廓,提取出更清晰的边界,使得网络整体性能提高。附图说明[0037] 图1是本发明一种基于双注意力机制的显著性目标检测方法的摘要附图;[0038] 图2是本发明实施例中RCANet整体网络结构图;[0039] 图3是本发明实施例中水平集注意力机制模块示意图;[0040] 图4是本发明实施例中反向通道注意力机制模块示意图;[0041] 图5是本发明实施例中层级特征模块的整体结构示意图;[0042] 图6是本发明实施例中PR曲线和F?measure曲线图;[0043] 图7是本发明实施例中本发明方法与表2中排名前6算法进行比较示意图。具体实施方式[0044] 以下将结合实施例和图1?7对本发明的构思、具体步骤及产生的技术效果进行清楚、完整的描述,以充分地理解本发明的目的、特征和效果。显然,所描述的实施例只是本发明的一部分实施例,而不是全部实施例,本领域普通技术人员根据这些实施方式所作的功能、方法、或者结构上的等效变换或替代,均属于本发明的保护范围之内。[0045] 在本发明的描述中,若干的含义是一个或者多个,多个的含义是两个以上,大于、小于、超过等理解为不包括本数,以上、以下、以内等理解为包括本数。如果有描述到第一、第二只是用于区分技术特征为目的,而不能理解为指示或暗示相对重要性或者隐含指明所指示的技术特征的数量或者隐含指明所指示的技术特征的先后关系。[0046] 本发明的描述中,除非另有明确的限定,设置、安装、连接等词语应做广义理解,所属技术领域技术人员可以结合技术方案的具体内容合理确定上述词语在本发明中的具体含义。[0047] 如图1所示,该实例提供的一种基于双注意力机制的显著性目标检测方法,包括以下特征:[0048] 步骤1、使用数据增强扩充数据集;[0049] 本发明实施例中,根据显著性目标检测常用评估数据集,选择了如下4个数据集对本发明中的网络进行性能评估:DUTS(Wang,L.,Lu,H.,Wang,Y.,Feng,M.,Wang,D.,Yin,B.,&Ruan,X.(2017).Learningtodetectsalientobjectswithimage?levelsupervision.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.136?145).)、HKUIS(Li,G.,&Yu,Y.(2015).Visualsaliencybasedonmultiscaledeepfeatures.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.5455?5463).)、PASCAL?S(Li,Y.,Hou,X.,Koch,C.,Rehg,J.M.,&Yuille,A.L.(2014).Thesecretsofsalientobjectsegmentation.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.280?287).)和DUT?OMRON(Yang,C.,Zhang,L.,Lu,H.,Ruan,X.,&Yang,M.H.(2013).Saliencydetectionviagraph?basedmanifoldranking.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.3166?3173).)。其中,DUTS是一个较大的数据集,包含了10553张训练图片和5019张测试图片。HKU?IS包含了4447张图片,该数据集的特点是显著性目标之间都是不相连的,多个目标中至少有一个目标接触了图像的边界,这将给模型带来了更多挑战性。PASCAL?S包含了850张图片,该数据集不具备中心先验,颜色先验等先验特性,通常包含多个目标,有较高的检测难度。DUT?OMRON包括5168个复杂且具有挑战性的图像,内容种类繁多。该数据集中的图像具有一个或多个显著对象和复杂背景。本发明实施例中使用水平翻转、随机裁剪和多尺度输入图像填充数据集并输入到网络中进行训练。[0050] 步骤2、将使用数据增强后的数据输入到包含有水平集注意力机制模块LSA(Level?SetAttention)、反向通道注意力模块R?CA(Reverse?ChannelAttention)与结构化损失的RCANet网络中进行训练并得到训练模型;[0051] 如图2中所示,提出的RCANet网络的从backbone获得了4个特征层。为了便于后续的计算,将通道都统一到了64。每个特征层都接入本发明提出的水平集注意力机制模块。最深层,也就是第4层特征层分为三个分支,一个分支作为输出,即out5;一个分支进行上采样操作传递给浅层特征;左侧箭头表示与其他三层进行特征融合。该操作将第5层特征分别对应前面的3个特征层分别上采样到对应的大小后进行融合。融合后的各层特征通过3个CF模块(CrossFusion)得到最终的输出。该网络模型共5个输出。图中下方5个深色模块即为输出。LSA模块的作用在于对从backbone得到的特征处理,获得更多的语义信息,不使用空洞卷积可以不降低模型的速度。RCA模块用于将层级之间的特征进行融合,将上下文信息传递给浅层特征。结构化损失函数用于监督五个层级的输出,不断地细化轮廓,提升整体的模型性能。[0052] 在水平集注意力机制模块水平集注意力机制模块LSA(Level?SetAttention)的设计中,受到水平集方法(Hu,P.,Shuai,B.,Liu,J.,&Wang,G.(2017).Deeplevelsetsforsalientobjectdetection.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.2300?2309).)的启发,本发明使用正向和反向两种方式得到从主干网络特征图的权重,两者进行加权获得处理后的特征图。如图3中所示,GMPC×H×W和GAP分别代表全局最大池化和全局平均池化操作。设输入的特征为finput∈R 然后对其进行一次压缩,受到自注意力机制的启发,本发明考虑进行通道的压缩,即将输入finput进行C×HW压缩,压缩为fsqueeze∈R 。由GMP和GAP作为两个分支,每个分支的压缩特征fsqueeze通过两个MLP获得权重。如下式所示:[0053] fgmp=MLP(GMP(finput))(1)[0054] fgap=MLP(GAP(finput))(2)[0055] 其中,fgmp表示输入特征经过MLP后的全局最大池化特征。fgap表示输入特征经过MLP后的全局平均池化特征。GMP和GAP分别表示全局最大池化操作和卷积平均池化操作。[0056] MLP表示多层感知机,通过三个卷积层实现,本发明实施例中MLP为64通道,调整到16通道,再转换为64通道。另外由于压缩了维度,本发明实施例中使用1维卷积,这样可以提升运算效率。同时受水平集思想的启发,获取内外的能量泛函,所有正向能量泛函用softmax代表,负向能量泛函用1减去sigmoid获得的权重代表。如图中所示,在进行运算时,正向能量权重即softmax分支需要先进行解压缩恢复为3个维度,即C×HW转换为C×H×W,再通过softmax函数计算。负向能量权重即sigmoid分支经过sigmoid函数后在进行解压缩。将上述得到的两组特征进行concatenation操作。同时将最大池化分支和平均池化分支获得的特征进行融合得到最终的特征再进行一次concatenation操作获得最终权重输出。与输入特征finput进行相乘得到输出,该过程如公式:[0057] fgap_out=concat{Softmax(Unsqueeze(fgap))+(1?Unsqueeze(Sigmoid(fgap)))}(3)[0058] fgmp_out=concat{Softmax(Unsqueeze(fgmp))+(1?Unsqueeze(Sigmoid(fgmp)))}(4)[0059] fout=concat(fgap_out+fgmp_out)(5)[0060] LSA用于处理backbone获取的特征,由实验数据来看,这时模型的预测结果还很粗糙,对于层级间的特征融合不能是简单的concatenation操作,本发明提出了Reverse?ChannelAttention模块。[0061] 对于层级间特征融合模块RCA(Reverse?ChannelAttention)受F3Net(Wei,J.,Wang,S.,&Huang,Q.(2020,April).受F3Net:fusion,feedbackandfocusforsalientobjectdetection.InProceedingsoftheAAAIConferenceonArtificialIntelligence(Vol.34,No.07,pp.12321?12328).)和ReverseAttention(Chen,S.,Tan,X.,Wang,B.,Lu,H.,Hu,X.,&Fu,Y.(2020).Reverseattention?basedresidualnetworkforsalientobjectdetection.IEEETransactionsonImageProcessing,29,3763?3776.)的启发,考虑在层级之间加入反向注意力机制处理层级特征,并将处理后的特征输入到一个通道注意力机制中,并将其嵌入到层级之间的特征融合中,本发明将其命名为Reverse?ChannelAttention(RCA)。如图4所示,高维度特征取负向,得到标签与背景相反的二值图,再通过与低维度特征进行像素乘积得到混合特征。将混合特征通过一组卷积操作后与输入的高维特征进行像素加,这样得到了反向注意力机制处理后的特征。如图中所示将该特征输入到通道注意力机制模块中,利用全局最大池化和全局平均池化操作并使用同一个MLP模块将二者得到的特征进行相加,再与原来的混合特征进行像素乘积得到最终的输出。[0062] 层级关系如图5中所示,将上述RCA模块嵌入到层级的特征融合中。高维特征和低维特征通过两组卷积操作后输入到RCA中,RCA获得的输出再进行像素加得到混合特征,依次通过两组卷积分别得到层级输出和传递给浅层网络的特征。层级输出即为每层的输出,即图1中的out4,out3等。此时网络的整体结构已经趋于确定了,但是本发明考虑再加入深层网络的位置信息,这样对于网络对于检测显著性的位置会有一定的提升,所以本发明提出了后向反馈。[0063] 如图2所示,最深层特征引出箭头将获取的特征按照前三层的特征分别进行上采样操作,并进行融合操作。这样将最深层的位置信息传递给浅层特征有利于网络对于目标位置的判断。[0064] 使用BCE损失只关注了像素点之间的关系,对于显著性目标检测网络的性能提升十分有限,针对此本发明提出了结构化损失函数。[0065] F3Net中作者提出了对BCE和IOU分区域加权,获得各个未知的权重,提升了BCE和IOU的全局性。由于BCE和IOU损失是逐像素的,对图像的整体感知较差,对整个损失函数加权固然是十分有效的。BCE与IOU的作用较为相似。本发明在BCE的基础上添加新的权重算子F?measure。F?measure是显著性目标检测中的重要指标,基于这一指标,提出了F?measure的损失算子。F3Net中权重bce损失为:[0066][0067] 其中,γ是超参数,本发明实施例中为5。αij是经过计算得到的权重值。l∈{0,1}表示两种标签,即背景和标签。 和 是图像中位置(i,j)的像素的预测和真实值。Ψ表示模型的所有参数, 表示预测概率。[0068] F?measure是准确率(Precision)和召回率(Recall)的加权调和平均。本发明在计算二者的时候使用了上述F3net提出的加权方式。那么新的P和R公式:[0069][0070][0071] 其中,γ,αij, 和 与权重bce中的参数意义一样。上述公式中的P和R是准确率与召回率的近似结果。[0072] 所以提出的权重F?measure算子的损失为:[0073][0074] 其中,β2是关于F?measure的超参数,本发明实施例中设置为0.3。P和R分别代标准确率和召回率近似值。ε是一个非常小的超参数,用于防止出现损失为0的情况,本发明实施例中设为1e?8。[0075] 综上所述,本发明提出的结构化损失函数为:[0076] Lloss=Lwbce+Floss(10)[0077] 步骤3、输入待检测数据到模型中得到显著性目标检测结果。[0078] 与其他最先进的显著目标检测方法一样,性能评价使用了三个流行的标准,即准确率和召回率曲线(表示为PR曲线)、F?measure(Yang,C.,Zhang,L.,Lu,H.,Ruan,X.,&Yang,M.H.(2013).Saliencydetectionviagraph?basedmanifoldranking.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.3166?3173).)和平均绝对误差(MAE)。另外,在与其他先进方法比较时,本发明实施例中提供了S?measure(记为Sm)和E?measure(记为Em)。上述指标可以在文献(Borji,A.,Cheng,M.M.,Jiang,H.,&Li,J.(2015).Salientobjectdetection:Abenchmark.IEEEtransactionsonimageprocessing,24(12),5706?5722.)(Fan,D.P.,Gong,C.,Cao,Y.,Ren,B.,Cheng,M.M.,&Borji,A.(2018).Enhanced?alignmentmeasureforbinaryforegroundmapevaluation.arXivpreprintarXiv:1805.10421.)获得更多的详细信息。[0079] 准确率?召回率曲线(简记为PR曲线)已经广泛应用于显著性目标检测算法中来验证算法的性能。在召回率相同的情况下,准确率越高代表模型性能越好。首先使用[0,255]区间内256个不同的阈值对待评价显著图进行二值化分割,通过计算真值图G与分割后的显著图M的差异性来计算不同阈值下的准确率和召回率,以召回率为横坐标,准确率为纵坐标连接所有点绘制得到相应的准确率?召回率曲线图。准确率和召回率的计算公式分别为:[0080][0081] PR曲线的数值高低可以衡量模型的好坏,但是在整个区间内,准确率和召回率通常不会一直保持最高。随着阈值的变化,准确率和召回率呈现出相反的变化趋势,因而F?measure曲线也经常被用来平衡考虑两者之间的相对重要性,给出直观的对比结果,F?measure的计算公式如下所示:[0082][0083] 其中,β是平衡因子,用来强调准确率的重要程度。一般情况下β2=0.3。另外基于F?measure有其他几个评价标准。weightF?measure(Margolin,R.,Zelnik?Manor,L.,&Tal,A.(2014).Howtoevaluateforegroundmaps?.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.248?255).)(wfm)是通过引入加权精度来衡量准确性和加权召回率来衡量完整性来计算的。MaxF?measure(MaxF)表示为F度量曲线中的最大值。[0084] 为了判别一个模型对于所有的预测像素的精度,研究者们提出使用像素累积误差的评价方法,即评价绝对误差MAE(MeanAbsoluteError)。其计算公式如下:[0085][0086] 其中,W,H分别代表图像的宽度和高度,S(x,y)代表像素点(x,y)在S中的取值。[0087] 在数据集的使用上,DUTS中的训练集用于训练RCANet,上述其他数据集用于评估RCANet。数据增强后,将Resnet?50用于该网络的骨干提取网络,同时使用Resnet50采样到的4个特征层用于以后的训练,浅层的数据由于噪声太多,计算量的性价比不高,本发明实施例中不使用第1层。Resnet?50主干的最大学习率设置为0.005,其他部分设置为0.05。采用预热和线性衰减策略调整学习速率。整个网络使用随机梯度下降(SGD)进行端到端的训练。动量和权重衰减分别设置为0.9和0.0005。Batch_Size设置为64,最大epoch也设置为32。本发明实施例中使用Pytorch1.4来实现模型。显卡使用的是TeslaV100,在测试期间,将每个图像的大小调整为352x352,然后将其提供给提出的网络,以便在没有任何后处理的情况下预测显著图。[0088] 在提出水平集损失的过程中,本发明实施例对水平集注意力机制做了一系列的调整,许多文献中指出,全局平均池化对于网络的深层更有效,对此本发明实施例中的实验中结合全局最大池化比较后选择了现在的全局池化和平均池化构成水平集注意力机制的前级输入,如表1所示,[0089] 对比实验的baseline为在原有的u型结构加入模块,损失函数使用BCE损失,在此基础上进行水平集注意力机制模块的对比实验。对于表中数据,2max?2avg表示由Resnet?50获取的前两层特征使用了全局最大池化,后两层使用了全局平均池化作为水平集注意力机制的输入级。依次类推,其他组分别代表在不同层级进行修改输入级,2max?2ls表示在最后两层特征层的水平集注意力机制的输入级设为提出的水平集注意力机制。同理,3max?ls是前三层更改为全局最大池化,最后一层改为提出的水平集注意力损失。由实验结果可以看出,通过3max?avg和max?3avg两组数据可以看出,深层网络全局平均池化(avg)效果会更好;通过2max?2ls和3max?ls两组,减少ls模块(即LSA)造成mae和F?mean下降;最后一行u+rca+ls组说明ls的确有效,另外也可通过消融实验说明该模块的有效性。[0090] 表1水平集注意力机制模块调整对比实验[0091][0092][0093] 另外,本发明方法与现有的一些优秀的注意力机制模块进行对比。SE(Hu,J.,Shen,L.,&Sun,G.(2018).Squeeze?and?excitationnetworks.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.7132?7141).),BAM(Park,J.,Woo,S.,Lee,J.Y.,&Kweon,I.S.(2018).Bam:Bottleneckattentionmodule.arXivpreprintarXiv:1807.06514.),CBAM(Woo,S.,Park,J.,Lee,J.Y.,&Kweon,I.S.(2018).Cbam:Convolutionalblockattentionmodule.InProceedingsoftheEuropeanconferenceoncomputervision(ECCV)(pp.3?19).)和GC(Cao,Y.,Xu,J.,Lin,S.,Wei,F.,&Hu,H.(2019).Gcnet:Non?localnetworksmeetsqueeze?excitationnetworksandbeyond.InProceedingsoftheIEEE/CVFInternationalConferenceonComputerVisionWorkshops(pp.0?0).)四种注意力机制进行比较,如表2所示,可以看出本发明方法的注意力机制在显著性目标检测中的表现更为优异。本发明实施例在DUTS和DUT?ORMON数据集上使用本发明方法提出的网络结构和提出的损失函数,将所有的水平集注意力机制,更换为要对比的注意力机制模块。[0094] 表2与4种注意力机制的对比[0095][0096] 对于损失函数,本发明实施例在DUTS上做了3组对比实验。如表3所示,网络模型固定为本发明提出的最终的网络结构。第1行为使用BCE损失,第二行使用权重损失。可以看出权重BCE损失可以显著地提高各指标。第3行为使用权重F?measure,可以看到权重F?measure是有效的,大大提高了F?measure的指标。最后是两种损失结合后的结果,各指标都有所提高。[0097] 表3四组损失函数的消融实验[0098][0099] 如表4所示,第一行没有使用任何模块,baseline使用了U型结构和跳跃连接的网络结构。第二行表示加入了水平集注意力机制。指标有了很大提升。第三行表示在baseline基础上加入水平集注意力机制和反向通道注意力机制r?ca模块后的结果。第四行表示表示继续加入提出的结构化损失。第五行表示继续加入本发明提出的后向反馈。[0100] 表4网络各部分模块消融实验[0101][0102] 在本发明实施例中将本发明方法与之前12种最先进的方法进行比较,即BDMP(Zhang,L.,Dai,J.,Lu,H.,He,Y.,&Wang,G.(2018).Abi?directionalmessagepassingmodelforsalientobjectdetection.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.1741?1750).)、PAGR(Zhang,X.,Wang,T.,Qi,J.,Lu,H.,&Wang,G.(2018).Progressiveattentionguidedrecurrentnetworkforsalientobjectdetection.InProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition(pp.714?722).)、EGNet(Zhao,J.X.,Liu,J.J.,Fan,D.P.,Cao,Y.,Yang,J.,&Cheng,M.M.(2019).EGNet:Edgeguidancenetworkforsalientobjectdetection.InProceedingsoftheIEEE/CVFinternationalconferenceoncomputervision(pp.8779?8788).)、BASNet(Qin,X.,Zhang,Z.,Huang,C.,Gao,C.,Dehghan,M.,&Jagersand,M.(2019).Basnet:Boundary?awaresalientobjectdetection.InProceedingsoftheIEEE/CVFconferenceoncomputervisionandpatternrecognition(pp.7479?7489).)、HRSOD(Zeng,Y.,Zhang,P.,Zhang,J.,Lin,Z.,&Lu,H.(2019).Towardshigh?resolutionsalientobjectdetection.InProceedingsoftheIEEE/CVFInternationalConferenceonComputerVision(pp.7234?7243).)、AFNet(Feng,M.,Lu,H.,&Ding,E.(2019).Attentivefeedbacknetworkforboundary?awaresalientobjectdetection.InProceedingsoftheIEEE/CVFconferenceoncomputervisionandpatternrecognition(pp.1623?1632).)、F3Net(Wei,J.,Wang,S.,&Huang,Q.(2020,April).F3Net:fusion,feedbackandfocusforsalientobjectdetection.InProceedingsoftheAAAIConferenceonArtificialIntelligence(Vol.34,No.07,pp.12321?12328).)、GateNet(Zhao,X.,Pang,Y.,Zhang,L.,Lu,H.,&Zhang,L.(2020,August).Suppressandbalance:Asimplegatednetworkforsalientobjectdetection.InEuropeanconferenceoncomputervision(pp.35?51).Springer,Cham.)、ITSD(Zhou,H.,Xie,X.,Lai,J.H.,Chen,Z.,&Yang,L.(2020).Interactivetwo?streamdecoderforaccurateandfastsaliencydetection.InProceedingsoftheIEEE/CVFConferenceonComputerVisionandPatternRecognition(pp.9141?9150).)、MINet(Pang,Y.,Zhao,X.,Zhang,L.,&Lu,H.(2020).Multi?scaleinteractivenetworkforsalientobjectdetection.InProceedingsoftheIEEE/CVFconferenceoncomputervisionandpatternrecognition(pp.9413?9422).)、RAS?v2(Chen,S.,Tan,X.,Wang,B.,Lu,H.,Hu,X.,&Fu,Y.(2020).Reverseattention?basedresidualnetworkforsalientobjectdetection.IEEETransactionsonImageProcessing,29,3763?3776.)、DNTN(Fang,C.,Tian,H.,Zhang,D.,Zhang,Q.,Han,J.,&Han,J.(2021).Denselynestedtop?downflowsforsalientobjectdetection.arXivpreprintarXiv:2102.09133.)。为了公平比较,本发明实施例中使用论文中各位作者提供的显著性图用于评价。4个数据集上的P?R曲线和F?measure曲线如图6所示。可以看到,本发明方法在所有情况下都优于其他方法。此外,将本发明方法与表5中4个数据集上的avgF(Achanta,R.,Hemami,S.,Estrada,F.,&Susstrunk,S.(2009,June).Frequency?tunedsalientregiondetection.In2009IEEEconferenceoncomputervisionandpatternrecognition(pp.1597?1604).IEEE.)、wfm、Fmax、F?measure和MAE等方面与其他最先进方法进行了比较。从该表中可以看出,本发明方法在大多数情况下排名第一。[0103] 表5与其他12种SOTA方法的五项指标的比较,其中红,绿,蓝分别表示指标的前三名。Fmax,Fmeasure,wfm,Fmean都是越好,mae越低越好。[0104][0105] 如图6中所示,本发明实施例在4个流行的数据集上与其他先进的12种算法进行比较,由F?measure曲线可以看出本发明方法的模型在该指标上都好于其他算法。[0106] 如图7所示,在表4中本发明实施例选取了算法在各数据集上优秀的6种算法DNTN、ITSD、F3Net、RASv2、MINet、和BASNet进行可视化比较。从第三行,可以看出本发明方法的模型可以更好的注意物体,主要是由于水平集注意力机制和前文提到的后向反馈的作用,可以给整个网络提供丰富的位置信息。第七行图片可以看出,本发明方法的模型在注意两个较远的目标时,可以同时兼顾到一些SOTA方法往往由于距离原因无法注意到多个物体。在第八行,对于多目标包含邻近的物体时,本发明方法也可以较好的识别。最后一行,本发明方法在对于远距目标时,仍能保持一定的精度将目标分辨出来。[0107] 对于本领域技术人员而言,显然本发明不限于上述示范性实施例的细节,而且在不背离本发明的精神或基本特征的情况下,能够以其他的具体形式实现本发明。因此,无论从哪一点来看,均应将实施例看作是示范性的,而且是非限制性的,本发明的范围由所附权利要求而不是上述说明限定,因此旨在将落在权利要求的等同要件的含义和范围内的所有变化囊括在本发明内虽然上面结合本发明的优选实施例对本发明的原理进行了详细的描述,本领域技术人员应该理解,上述实施例仅仅是对本发明的示意性实现方式的解释,并非对本发明包含范围的限定。实施例中的细节并不构成对本发明范围的限制,在不背离本发明的精神和范围的情况下,任何基于本发明技术方案的等效变换、简单替换等显而易见的改变,均落在本发明保护范围之内。

专利地区:海南

专利申请日期:2022-06-04

专利公开日期:2024-11-22

专利公告号:CN115019063B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载