产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:一种基于ViT的海上小目标检测方法
专利类型:发明专利
专利申请号:CN202410520403.2
专利申请(专利权)人:浙江海洋大学
权利人地址:浙江省舟山市定海区临城街道海大南路1号
专利发明(设计)人:潘宝峰,祝贵兵,史慧敏,朱凡,支宏扬
专利摘要:本发明属于海上交通智能感知领域,公开了一种基于ViT的海上小目标视觉检测方法,包括:步骤1,选择海上目标数据集,对海上目标数据集进行预处理;步骤2,构建海上小目标检测模型;步骤3,对海上小目标检测模型进行训练、测试、验证,得到最优的海上小目标检测模型;步骤4,将待检测的海上小目标图像传入优化后的海上小目标检测模型中进行小目标检测。本发明采用ViT方式提取图像特征,通过其层次化的Transformer结构能够有效地捕捉不同尺度的特征,这使得它在处理远距离小目标或近距离大目标时都能表现出色;本发明提出基于预测位置信息与分数信息的样本输入权重动态更新策略(PRD),以实现小目标的精确检测。
主权利要求:
1.一种基于ViT的海上小目标视觉检测方法,其特征在于,包括以下步骤:步骤1,选择海上目标数据集,对海上目标数据集进行预处理,并将其划分为训练集、测试集和验证集;预处理包括:S1,对海上目标数据集进行多种数据增强,扩充数据集样本;
S2,用Copy?paste方法,增加小目标样本数量,具体包括:S201,提。捍永┏浜蟮氖菁醒∪“煌I夏勘甑耐枷,这些图像具有不同的环境条件;
S202,小目标截。憾許201选取的图像进行目标检测和分割,将小目标对象从其原始背景中分离出来,得到纯净的小目标对象图像;
S203,背景图像选择:从其他数据源中选取一些只包含水面背景的背景图像,这些背景图像也具有不同的环境条件,以增加数据的多样性;
S204,小目标对象粘贴:将S202提取出的小目标对象图像随机地粘贴到S203选取的背景图像上,生成新的合成图像,在粘贴过程中,对小目标对象图像进行随机变换,以模拟不同的视角和姿态;
步骤2,构建海上小目标检测模型,所述海上小目标检测模型包括Swin?Transformer、Dynamichead、PRD策略、DINO头部网络;用Swin?Transformer作为海上小目标检测模型的主干网络,提取特征图;用Dynamichead将图像特征进行特征融合;通过PRD策略,增强小目标样本权重;用DINO头部网络进行分类与回归;
所述Dynamichead的处理过程分为三个注意力计算过程,分别是尺度注意力、空间注意力和通道注意力,其计算过程为:W(F)=πC(πS(πL(F)·F)·F)·F
其中,W表示注意力计算函数,F代表输入的三维特征张量,πL、πS、πC分别指代特征图的层次、宽高乘积以及通道数,尺度注意力、空间注意力和通道注意力模块分别针对其特定的维度执行注意力操作;
所述PRD策略的流程包括:
S301,将特征图进行粗检测,生成若干的预检框B,作为后续精细检测的基。巳繁Tげ饪虻淖既沸,采用平滑L1损失函数LsmoothL1对其进行监督学习,该损失函数计算预测框B与真实标注框之间的差异,这一过程表示为:LsmoothL1(B,G)=∑i∈{x,y,w,h}smoothL1(Bi?Gi)其中,B表示预测框的坐标,G表示真实标注框的坐标,i表示坐标的各个维度,即中心点的(x,y)坐标和宽w、高h,Bi与Gi表示边界框的具体参数,平滑L1损失函数的具体形式可表示为:S302,按置信度选取其中TopK个预检框,并按照它们的位置生成特征权重增强掩码M,这一过程可以为:其中,i、j表示当前像素的位置,Mi,j表示图像中对应像素位置的权重,Bk表示预检框,指示函数IBK(x)表示当前位置是否在预检框BK内,若在则置为1,否则置为0;
S303,将特征权重增强掩码M归一化并作为权重调整特征,提升特征对预检框区域的响应,其过程可表示为:其中,Fm表示原始特征图,Fm'表示增强后的特征图,α为超参数,由检测结果设置,用于控制特征响应放大倍数,max(M)为特征权重增强掩码M中的最大值;
步骤3,通过训练集、测试集和验证集对海上小目标检测模型进行训练、测试、验证,得到最优的海上小目标检测模型;
步骤4,将待检测的海上小目标图像传入优化后的海上小目标检测模型中进行小目标检测。 说明书 : 一种基于ViT的海上小目标检测方法技术领域[0001] 本发明涉及海上交通智能感知领域,具体为一种基于ViT的海上小目标检测方法。背景技术[0002] 雷达和声呐等传统的船舶感知系统虽能实时监控海上环境,但在检测小型或部分浸没目标方面却表现不佳。此外,上述系统需要处理来自多种传感器的数据,这不仅增加了计算复杂性,也带来了数据融合过程中产生的时空对齐和误差校准问题。这些限制会影响船舶的操作效率和航行安全。[0003] 在小目标检测方面,现有方法面临的挑战包括目标的尺寸小、特征信息少、容易受到遮挡和环境因素影响等问题,传统的基于锚框的目标检测方法在处理小目标时,因锚框与目标尺寸和形状匹配度低与目标关注度较低,难以对小目标进行准确分类和定位。[0004] 本发明提出了一种基于ViT的海上小目标检测方法,该方法引入基于ViT的Swin?Transformer主干网络,通过滑动窗口机制,高效地提取图像中的细微特征和全局特征。进一步,针对锚框与目标尺寸和形状匹配度低与目标关注度较低问题,提出基于预测位置信息与分数信息的样本输入权重动态更新策略(PRD),提升模型对小目标的检测效果。发明内容[0005] 本发明的目的在于提供一种基于ViT的海上小目标检测方法,以解决上述背景技术中提出的问题。[0006] 为实现上述目的,本发明提供如下技术方案:[0007] 一种基于ViT的海上小目标视觉检测方法,包括以下步骤:[0008] 步骤1,选择海上目标数据集,对海上目标数据集进行预处理,并将其划分为训练集、测试集和验证集;[0009] 步骤2,构建海上小目标检测模型;[0010] 步骤3,通过训练集、测试集和验证集对海上小目标检测模型进行训练、测试、验证,得到最优的海上小目标检测模型;[0011] 步骤4,将待检测的海上小目标图像传入优化后的海上小目标检测模型中进行小目标检测。[0012] 进一步地,所述步骤1中的预处理包括:[0013] S1,对海上目标数据集进行多种数据增强,扩充数据集样本;[0014] S2,用Copy?paste方法,增加小目标样本数量,从而增强小目标权重。[0015] 进一步地,所述S2具体包括:[0016] S201,提。捍永┏浜蟮氖菁醒∪“煌I夏勘(如船只、浮标等)的图像,这些图像具有不同的环境条件(如光照、天气、水面纹理等);[0017] S202,小目标截。憾許201选取的图像进行目标检测和分割,将小目标对象从其原始背景中分离出来,得到纯净的小目标对象图像;[0018] S203,背景图像选择:从其他数据源中选取一些只包含水面背景的背景图像,这些背景图像也具有不同的环境条件,以增加数据的多样性;[0019] S204,小目标对象粘贴:将S202提取出的小目标对象图像随机地粘贴到S203,选取的背景图像上,生成新的合成图像。[0020] 进一步地,所述S204还包括:在粘贴过程中,对小目标对象图像进行一些随机变换,如缩放、旋转、翻转等,以模拟不同的视角和姿态。[0021] 进一步地,所述海上小目标检测模型包括Swin?Transformer、Dynamichead、PRD策略、DINO头部网络;[0022] Swin?Transformer作为海上小目标检测模型的主干网络,主要负责提取图像的特征。通过使用窗口化的自注意力机制,处理图像中的局部特征,并通过层次化的结构逐渐扩展感受野,以捕获更广泛的上下文信息。这种结构使得网络在处理不同尺寸的图像时更加灵活和高效;[0023] Dynamichead颈部网络用于在从主干网络提取的特征图之间建立连接,并进行特征融合。它动态地调整其模块的结构来适应不同的目标尺寸和形状,优化特征传递路径,从而提高模型对各种目标的检测精度。[0024] 通过PRD策略,引入预测位置信息和分数信息来动态更新样本输入权重,通过更合理的样本权重分配,增强小目标样本权重,进而实现更细致的小目标检测效果;[0025] DINOhead作为头部网络,负责目标的分类和边界框的精确定位,通过接收颈部网络Dynamichead输出的特征图,并通过一系列优化的网络层来判断每个候选区域的类别并精确计算其边界框的位置。[0026] 进一步地,所述Dynamichead的处理过程分为三个注意力计算过程,分别是尺度注意力、空间注意力和通道注意力,其计算过程为:[0027] W(F)=πC(πS(πL(F)·F)·F)·F[0028] 其中,W表示注意力计算函数,F代表输入的三维特征张量,πL、πS、πC分别指代特征图的层次、宽高乘积以及通道数,尺度注意力、空间注意力和通道注意力模块分别针对其特定的维度执行注意力操作。[0029] 进一步地,所述PRD策略的流程包括:[0030] S301,将特征图进行粗检测,生成若干的预检框B,作为后续精细检测的基。巳繁Tげ饪虻淖既沸,采用平滑L1损失函数对其进行监督学习,该损失函数计算预测框B与真实标注框之间的差异,这一过程表示为:[0031][0032] 其中,B表示预测框的坐标,G表示真实标注框的坐标,i表示坐标的各个维度,即中心点的(x,y)坐标和宽w、高h,Bi与Gi表示边界框的具体参数,平滑L1损失函数的具体形式可表示为:[0033][0034] 其中,if|x|<1表示x的绝对值小于1。[0035] S302,按置信度选取其中TopK个预检框,并按照它们的位置生成特征权重增强掩码M,这一过程可以为:[0036][0037][0038] 其中,i、j表示当前像素的位置,Mi,j表示图像中对应像素位置的权重,Bk表示预检框,指示函数 表示当前位置是否在预检框BK内,若在则置为1,否则置为0;[0039] S303,将特征权重增强掩码M归一化并作为权重调整特征,提升特征对预检框区域的响应,其过程可表示为:[0040][0041] 其中,Fm表示原始特征图,Fm'表示增强后的特征图,α为超参数,用于控制特征响应放大倍数,max(M)为特征权重增强掩码M中的最大值。[0042] 通过这一操作,将潜在目标区域的特征响应放大α倍,从而提升模型对潜在目标区域的关注度,有利于模型捕捉其特征和位置信息。[0043] 与现有技术相比,本发明的有益效果是:[0044] 1)本发明采用ViT(VisionTransformer)方式提取图像特征,通过其层次化的Transformer结构能够有效地捕捉不同尺度的特征,这使得它在处理远距离小目标或近距离大目标时都能表现出色;采用动态的注意力机制,这使得模型可以根据输入的数据动态调整其处理方式,从而提升模型的泛化性;[0045] 2)本发明用Dynamichead进行高效的特征融合,通过自注意力机制有效地提升了模型对不同尺度特征的鉴别能力;[0046] 3)本发明提出PRD策略,通过渐进检测的方式,有效提升了模型对小目标区域的关注程度,从而提升了小目标的检测效果。附图说明[0047] 图1是本发明流程图;[0048] 图2是本发明的海上小目标检测模型结构图;[0049] 图3是Copy?paste方法示意图;[0050] 图4是本发明中Swin?transformer主干网络结构图;[0051] 图5是本发明中Dynamichead网络结构图;[0052] 图6是本发明中PRD策略流程示意图;[0053] 图7是本发明中提出的海上小目标检测模型与基线模型检测效果对比图。具体实施方式[0054] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0055] 请参阅图1?图7,一种基于ViT(VisionTransformer)的海上小目标视觉检测方法包括以下步骤:[0056] 步骤1,选用公开的海上目标数据集,对海上目标数据集进行预处理,并将其划分为训练集、测试集和验证集。[0057] 预处理操作包括:[0058] S1,对海上目标数据集进行多种数据增强,扩充数据集样本;[0059] S2,用Copy?paste方法,增加小目标样本数量,从而增强小目标权重,具体包括:[0060] S201,提。捍永┏浜蟮氖菁醒∪“煌I夏勘(如船只、浮标等)的图像,这些图像具有不同的环境条件(如光照、天气、水面纹理等);[0061] S202,小目标截。憾許201选取的图像进行目标检测和分割,将小目标对象从其原始背景中分离出来,得到纯净的小目标对象图像;[0062] S203,背景图像选择:从其他数据源中选取一些只包含水面背景的背景图像,这些背景图像也具有不同的环境条件,以增加数据的多样性;[0063] S204,小目标对象粘贴:将S202提取出的小目标对象图像随机地粘贴到S203,选取的背景图像上,生成新的合成图像。[0064] 步骤2,构建海上小目标检测模型,海上小目标检测模型包括Swin?Transformer、Dynamichead、PRD策略、DINO头部网络。[0065] 步骤3,通过训练集、测试集和验证集对海上小目标检测模型进行训练、测试、验证,得到最优的海上小目标检测模型;[0066] 步骤4,将待检测的海上小目标图像传入优化后的海上小目标检测模型中进行小目标检测。[0067] 上述海上小目标检测模型的工作流程为:[0068] a,首先使用Swin?Transformer主干网络提取图像特征图在处理图像数据,通过PatchPartition层对图像进行划分,每个4×4的像素块被分割成单独的Patch,并在RGB通道上进行展开,形成4×4×3的通道数。接着,通过LinearEmbedding模块将这些通道转换为C个通道,然后通过两个Swin?TransformerBlock层进行特征提。沙醪降奶卣魍。之后,模型经过三个结构相同的Stage进行进一步处理,每个Stage都以PatchPartition层开始,对特征图进行下采样并调整通道数,随后通过若干Swin?TransformerBlock层处理,输出不同尺度的特征图。[0069] b,通过Dynamichead模块进行特征融合,Dynamichead的处理过程分为三个注意力计算过程,分别是尺度注意力、空间注意力和通道注意力,其计算过程可由如下公式表达:[0070] W(F)=πC(πS(πL(F)·F)·F)·F[0071] 其中,W表示注意力计算函数,F代表输入的三维特征张量,πL、πS、πC分别指代特征图的层次、宽高乘积以及通道数。尺度注意力、空间注意力和通道注意力模块分别针对其特定的维度执行注意力操作。[0072] c,通过PRD策略,增强小目标样本权重,流程具体包括:[0073] S301,将经主干网络和颈部网络处理过后的特征图进行粗检测,以生成若干的预检框B,作为后续精细检测的基础。为了确保预测框的准确性,采用平滑L1损失函数对其进行监督学习,该损失函数计算预测框B与真实标注框(ground?truth)之间的差异。这一过程可由下式表示:[0074][0075] 其中,B表示预测框的坐标,G表示真实标注框的坐标,i表示坐标的各个维度,即中心点的(x,y)坐标和宽w、高h,Bi与Gi表示边界框的具体参数,平滑L1损失函数的具体形式如下式所示:[0076][0077] 其中,if|x|<1表示x的绝对值小于1。[0078] S302,对于潜在的预检框B,按置信度选取其中TopK个,并按照它们的位置生成特征权重增强掩码M。这一过程可以由下式表示:[0079][0080][0081] 其中,i、j表示当前像素的位置,Mi,j表示图像中对应像素位置的权重,Bk表示预检框,指示函数 表示当前位置是否在预检框BK内,若在则置为1,否则置为0。[0082] S303,将特征权重增强掩码M归一化并作为权重调整特征,提升特征对预检框区域的响应,其过程可由下式表示:[0083][0084] 其中,Fm表示原始特征图,Fm'表示增强后的特征图,α为超参数,由检测结果设置,用于控制特征响应放大倍数,max(M)为特征增强掩码中的最大值。[0085] 通过这一操作,将潜在的目标区域的特征响应放大α倍,从而提升模型对潜在区域的关注度,有利于模型捕捉该区域的特征和位置信息。[0086] d,用DINO头部网络进行分类与回归。[0087] 本发明提出的海上小目标检测模型,在搭载NvidiaA40显卡的服务器上,小目标较多的海上目标检测数据集(WaterSurfaceObjectDetectionDataset)上平均检测精度相较于基线模型DINO提升了6.9%,小目标检测精度提升了5.9%,并在实际采集的复杂海上环境中可实现高查准率、高查全率的小目标检测结果,提升了模型的泛化性和鲁棒性。[0088] 在具体实施案例中,为验证本发明所提模型的有效性,将本发明模型与现有先进模型进行在相同的实验条件下进行比较,各项性能指标比较的结果如下表所示。[0089][0090][0091] 由上表可知,本发明所提模型在海上目标检测任务上,相比于其他几种先进的目标检测模型,都有显著的优势。与主流目标检测模型相比,本发明所提模型的mAP达到了89.5%,说明本发明所提模型相较于现有模型,在海上检测任务中的检测精度最高。同时,本发明所提模型在小目标检测任务上,也取得了最高的检测分数。本发明所提模型的AP_s为36.3%,领先其他主流模型,说明本发明是有效的。[0092] 本发明未详细说明部分属于本领域技术人员公开常识。尽管已经示出和描述了本发明的实施例,对于本领域的普通技术人员而言,可以理解在不脱离本发明的原理和精神的情况下可以对这些实施例进行多种变化、修改、替换和变型,本发明的范围由所附权利要求及其等同物限定。
专利地区:浙江
专利申请日期:2024-04-28
专利公开日期:2024-11-12
专利公告号:CN118505964B