开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于Mamba和协方差交互注意力的跨模态哈希学习方法

更新时间:2026-09-01
一种基于Mamba和协方差交互注意力的跨模态哈希学习方法 专利申请类型:发明专利;
地区:新疆-乌鲁木齐;
源自:乌鲁木齐高价值专利检索信息库;

专利名称:一种基于Mamba和协方差交互注意力的跨模态哈希学习方法

专利类型:发明专利

专利申请号:CN202410973522.3

专利申请(专利权)人:新疆大学
权利人地址:新疆维吾尔自治区乌鲁木齐市天山区胜利路666号

专利发明(设计)人:发明人:程述立,王刚,汪烈军,杜安钰,邹强

专利摘要:本发明公开了一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,主要涉及深度跨模态哈希检索领域;包括步骤:S1、将图像数据集及其所对应的类别标签信息分别对应分成:训练集、测试集和检索集;S2、对图像信息进行预处理;S3、构建基于斜方差特征融合与Mamba的深度跨模态哈希检索架构;S4、利用训练集,通过训练得到基于斜方差特征融合与Mamba的深度跨模态哈希检索模型;S5、将测试集和检索集图片输入经过训练的模型,分别得到测试集和检索集的哈希码;S6、取测试集测试最好的模型权重进行保存;本发明能有效学习不同模态之间的信息,能够有效提升模型在跨模态学习任务中的性能和泛化能力。

主权利要求:
1.一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,包括步骤:S1、将图像数据集及其所对应的类别标签信息分别对应分成三部分:训练集、测试集和检索集,其中,每个样本均包括一张图像及对应的文字描述,且训练集和测试集中每个类别取相同的样本数;
S2、对图像信息进行预处理,将图像裁剪成同一像素大。宰魑P褪淙耄
S3、构建基于斜方差特征融合与Mamba的深度跨模态哈希检索架构,包括CLIP特征提取骨干、Mamba斜方差交叉特征融合模块、哈希层和损失函数,其中,CLIP特征提取骨干采用ViT?B?32预训练权重,哈希层包括全连接层、层归一化层和激活函数tanh(·),损失函数包括代理损失和哈希中心平衡损失,CLIP特征提取骨干和Mamba斜方差交叉特征融合模块用于学习图像特征,哈希层用于学习哈:墓菇ú⒌玫绞淙胪枷竦墓希码,损失函数用来引导哈:挠呕较颍
S4、利用训练集,依据基于斜方差特征融合与Mamba的深度跨模态哈希检索架构,通过训练得到基于斜方差特征融合与Mamba的深度跨模态哈希检索模型;
S5、将测试集和检索集图片输入经过训练的基于频域解耦和视觉Mamba的深度哈希图像检索模型,分别得到测试集和检索集的哈希码,通过反向传播算法调整模型参数,利用验证集验证训练效果并保存最好的模型;
S6、取测试集测试最好的模型权重进行保存,并保存在测试集上表现效果最好的哈希码。
2.根据权利要求1所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,步骤S3中,使用CLIP框架作为特征提取网络,其中图片特征提取模块采用计算机视觉visiontransform框架,文本特征提取模块则选择transformer模块,且采用ViT?B?
32预训练模型。
3.根据权利要求1所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,步骤S3中,Mamba斜方差交叉特征融合模块由斜方差特征增强模块与Mamba特征融合模块一同构成,其中,斜方差特征增强模块由矩阵计算、张量操作与非线性函数的应用构成,Mamba特征融合模块采用选择性状态空间模型。
4.根据权利要求3所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,斜方差特征增强模的具体算法如下:斜方差特征增强模接收从特征提取模块的提取出的图像特征Fi与文本特征Ft,其中Fi与Ft的矩阵大小为N×D,N为样本数量,D为每个样本的特征数量,则有:计算样本嵌入总和:
构建相似度矩阵:
T
I=i1i1
T
T=t1t1
S=I?T
构建激活函数:
2
F=(1?tanh(S))·σ(S)·(1?σ(S))其中,其中 为Sigmoid()函数,而生成增强特征:
Ei=F⊙Fi+Fi
Et=F⊙Ft+Ft
其中,Ei为图像增强特征,Et为增强文本特征;
合并特征并进行输出:
R=[Ei,Et]。
5.根据权利要求3所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,首先通过CLIP框架提取多模态数据的底层特征,随后将这些特征向量进行拼接,获得融合特征,随后将融合特征送入Mamba特征融合模块中,在经过斜方差增强模块与Mamba特征融合模块后,对两种所提取的特征进行加权求和。
6.根据权利要求1所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,在步骤S3中,哈希层采用多层感知机作为哈希映射函数,哈希映射函数为:(2) (1) (1) (2)
Z=sign(W σ(W X+b )+b )其中,X是N×D的输入矩阵,N代表样本数量,D代表每个样本的维度;
σ是ReLU激活函数,即σ(x)=max(0,x);
(1) (2) (1) (2)
W ,W ,b 与b 皆为需要学习的参数,通过反向传播和优化算法调整,以最小化某种损失函数;
Sign函数用于将树枝转换为?1或+1的哈希码,即Z为N×H的输出矩阵,H为哈希码长度。
7.根据权利要求1所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,在步骤S3中,代理损失采用多模态多标签代理损失函数,损失函数为LPROXY,包括余弦距离、不相关代理距离与模态间无关损失,余弦距离:
其中,h是对应模型输出,p为对应真实标签;
不相关代理距离:
其中,threshold为一个阈值;
模态间无关损失:
其中,M代表模态间相关样本对的数量;
计算分别计算其损失:
其中,C代表该数据集所包含的种类的数量,D代表每个样本的特征数量;
故多模态多标签代理损失函数为:
8.根据权利要求7所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,在步骤S3中,哈希中心平衡损失包括中心损失、Q损失与平衡损失;
中心损失为:
其中,ui是对应模型第i个输出,ti是对应真实第i个标签,N则表示样本数目;
Q损失为:
平衡损失为:
LCMCBL=Limage+Ltext;
其中,Ltotal=sigmoid(η)(Lcenter+λ×LQ+Lbalance);
η为可学习参数其初始值为0.0001,λ为预先设置超参数其值为0.001,β为平衡权重其值为0.001。
9.根据权利要求8所述的一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其特征在于,在步骤S3中,损失函数为:Lfinal=LCMCBL+LPROXY。 说明书 : 一种基于Mamba和协方差交互注意力的跨模态哈希学习方法技术领域[0001] 本发明涉及深度跨模态哈希检索领域,具体是一种基于Mamba和协方差交互注意力的跨模态哈希学习方法。背景技术[0002] 随着智能通信技术的飞速跃进,各种数据的获取与分享变得前所未有的便捷,每一天都有成千上万的图文数据涌入各式存储系统。这一数据洪流对从庞杂信息中快速且精准提取有价值内容的能力提出了严峻考验,特别是在面对庞大的数据库时,传统依赖精确匹配的检索策略遭遇了“维度诅咒”难题,以及随之而来的巨大计算成本。[0003] 近些年来,深度学习的发展也进一步带动了跨模态哈希检索的发展,其中CLIP(ContrastiveLanguage?ImagePre?training)是一个突破性的深度学习框架,其设计目的是通过大规模的无监督学习来创建一个强大的跨模态理解系统。CLIP采用对比学习方法,通过学习如何区分不同的样本对来优化模型,在这个框架中,CLIP同时处理两种模态的数据:文本和图像。它通过从互联网上收集的大量配对的图像和描述性文本(如:图像标题、标签或描述)来训练模型。模型的目标是在给定一对图像和文本时,预测它们是否匹配,这个过程促使模型学习到高阶的语义关联。该框架包括一个图像编码器和一个文本编码器。图像编码器通常是基于VisionTransformer或卷积神经网络(CNN),负责将图像转换成高维向量;文本编码器通常基于Transformer架构,将文本序列转换为向量。这两个编码器分别对图像和文本进行编码,最后输出的向量应该在语义上相似的图像?文本对之间具有较高的余弦相似度,而不同语义的对则相似度较低。[0004] 现有的基于CLIP的跨模态哈希检索框架通常都是直接由CLIP对不同模态的数据进行提特征后送入损失模块,虽然CLIP框架有着天然的对齐功能,但这样让大家往往以为在经过CLIP框架后便不需要再进行模态间的特征学习,从而导致忽略模态间的潜在语义联系,这样不利于网络全面把握数据的全局语义信息,从而导致哈希码无法有效保持数据原始高维空间的相似结构;其次以往的工作通常使用成对损失或是三元组损失来进行相似度度量学习,由于它们一次只能拉近或推远一组正负样本,因此只能局部地捕捉数据的相似性,需要通过反复多轮的学习才能得到合适的哈:,学习效率低下其次目前的跨模态哈希检索框架仍存在收敛较慢,训练时间过长等问题,这一开销也给用户带来了大量不便。发明内容[0005] 本发明的目的在于解决现有技术中存在的问题,提供一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,能有效学习不同模态之间的信息,从而生成高质量的哈希码,可充分降低因单一模态信息限制导致的误判风险,确保模型输出准确性和鲁棒性,能够有效提升模型在跨模态学习任务中的性能和泛化能力。[0006] 本发明为实现上述目的,通过以下技术方案实现:[0007] 一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,包括步骤:[0008] S1、将图像数据集及其所对应的类别标签信息分别对应分成三部分:训练集、测试集和检索集,其中,每个样本均包括一张图像及对应的文字描述,且训练集和测试集中每个类别取相同的样本数;[0009] S2、对图像信息进行预处理,将图像裁剪成同一像素大。宰魑P褪淙耄籟0010] S3、构建基于斜方差特征融合与Mamba的深度跨模态哈希检索架构,包括CLIP特征提取骨干、Mamba斜方差交叉特征融合模块、哈希层和损失函数,其中,CLIP特征提取骨干采用ViT?B?32预训练权重,哈希层包括全连接层、层归一化层和激活函数tanh(·),损失函数包括代理损失和哈希中心平衡损失,CLIP特征提取骨干和Mamba斜方差交叉特征融合模块用于学习图像特征,哈希层用于学习哈:墓菇ú⒌玫绞淙胪枷竦墓希码,损失函数用来引导哈:挠呕较颍籟0011] S4、利用训练集,依据基于斜方差特征融合与Mamba的深度跨模态哈希检索架构,通过训练得到基于斜方差特征融合与Mamba的深度跨模态哈希检索模型;[0012] S5、将测试集和检索集图片输入经过训练的基于频域解耦和视觉Mamba的深度哈希图像检索模型,分别得到测试集和检索集的哈希码,通过反向传播算法调整模型参数,利用验证集验证训练效果并保存最好的模型;[0013] S6、取测试集测试最好的模型权重进行保存,并保存在测试集上表现效果最好的哈希码。[0014] 优选的,步骤S3中,使用CLIP框架作为特征提取网络,其中图片特征提取模块采用计算机视觉visiontransform框架,文本特征提取模块则选择transformer模块,且采用ViT?B?32预训练模型。[0015] 优选的,步骤S3中,Mamba斜方差交叉特征融合模块由斜方差特征增强模块与Mamba特征融合模块一同构成,其中,斜方差特征增强模块由矩阵计算、张量操作与非线性函数的应用构成,Mamba特征融合模块采用选择性状态空间模型。[0016] 优选的,斜方差特征增强模的具体算法如下:[0017] 斜方差特征增强模接收从特征提取模块的提取出的图像特征Fi与文本特征Ft,其中Fi与Ft的矩阵大小为N×D,N为样本数量,D为每个样本的特征数量,则有:[0018] 计算样本嵌入总和:[0019][0020][0021] 构建相似度矩阵:[0022] I=i1i1T[0023] T=t1t1T[0024] S=I?T[0025] 构建激活函数:[0026] F=(1?tanh(S)2)·σ(S)·(1?σ(S))[0027] 其中,其中 为Sigmoid()函数,而[0028] 生成增强特征:[0029] Ei=F⊙Fi+Fi[0030] Et=F⊙Ft+Ft[0031] 其中,Ei为图像增强特征,Et为增强文本特征;[0032] 合并特征并进行输出:[0033] R=[Ei,Et]。[0034] 优选的,首先通过CLIP框架提取多模态数据的底层特征,随后将这些特征向量进行拼接,获得融合特征,随后将融合特征送入Mamba特征融合模块中,在经过斜方差增强模块与Mamba特征融合模块后,对两种所提取的特征进行加权求和。[0035] 优选的,在步骤S3中,哈希层采用多层感知机作为哈希映射函数,哈希映射函数为:[0036] Z=sign(W(2)σ(W(1)X+b(1))+b(2))[0037] 其中,X是N×D的输入矩阵,N代表样本数量,D代表每个样本的维度;[0038] σ是ReLU激活函数,即σ(x)=max(0,x);[0039] W(1),W(2),b(1)与b(2)皆为需要学习的参数,通过反向传播和优化算法调整,以最小化某种损失函数;[0040] Sign函数用于将树枝转换为?1或+1的哈希码,即[0041] Z为N×H的输出矩阵,H为哈希码长度。[0042] 优选的,在步骤S3中,代理损失采用多模态多标签代理损失函数,损失函数为LPROXY;其包括余弦距离、不相关代理距离与模态间无关损失,[0043] 余弦距离:[0044][0045] 其中,h是对应模型输出,p为对应真实标签。[0046] 不相关代理距离:[0047][0048] 其中,threshold为一个阈值;[0049] 模态间无关损失:[0050][0051] 其中,M代表模态间相关样本对的数量;[0052] 计算分别计算其损失:[0053][0054][0055][0056] 其中,C代表该数据集所包含的种类的数量,D代表每个样本的特征数量。[0057] 故多模态多标签代理损失函数为:[0058][0059] 优选的,在步骤S3中,哈希中心平衡损失包括中心损失、Q损失与平衡损失;[0060] 中心损失为:[0061][0062] 其中,ui是对应模型第i个输出,ti是对应真实第i个标签,N则表示样本数目;[0063] Q损失为:[0064][0065] 平衡损失为:[0066] LCMCBL=Limage+Ltext;[0067] 其中,Ltotal=sigmoid(η)(Lcenter+λ×LQ+Lbalance);[0068][0069] η为可学习参数其初始值为0.0001,λ为预先设置超参数其值为0.001,β为平衡权重其值为0.001。[0070] 优选的,损失函数为:[0071] Lfinal=LCMCBL+LPROXY。[0072] 对比现有技术,本发明的有益效果在于:[0073] 本发明提供了一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,其中,Mamba斜方差交叉特征融合模块可以有效地利用不同模态间的信息进行特征融合与增强,而本文所提出的跨模态分类平衡损失很好地弥补了现有损失函数的不足。本发明的主要贡献如下:[0074] 1)本发明提出了一种基于CLIP的深度跨模态哈希检索网络,该网络能够有效学习不同模态之间的信息,从而生成高质量的哈希码。[0075] 2)本发明提供了一个Mamba斜方差交叉特征融合模块,可以有效对不同模态间信息进行融合与增强,其由Mamba特征融合模块与斜方差增强模块所构成。Mamba特征融合模块可利用本身对长序列数据处理的优势充分对不同模态特征进行融合,而斜方差增强模块利用矩阵计算、张量操作和非线性函数,轻量且无需额外参数,能有效融合图像和文本等不同模态信息,生成更全面、深入的特征表示。两者相结合可以充分降低因单一模态信息限制所导致的误判风险,确保模型输出准确性和鲁棒性。[0076] 3)本发明提供了一个新的跨模态分类平衡损失,该损失通过增强对标签信息的利用和优化多模态间的平衡,有效提升模型在跨模态学习任务中的性能和泛化能力。附图说明[0077] 图1是本发明的整体框架;[0078] 图2是Mamba斜方差交叉特征融合模块模型图;[0079] 图3是哈希映射函数的示意图。具体实施方式[0080] 下面结合具体实施例,进一步阐述本发明。应理解,这些实施例仅用于说明本发明而不用于限制本发明的范围。此外应理解,在阅读了本发明讲授的内容之后,本领域技术人员可以对本发明作各种改动或修改,这些等价形式同样落于本申请所限定的范围。[0081] 实施例:本发明所述是一种基于Mamba和协方差交互注意力的跨模态哈希学习方法,具体实施步骤如下:[0082] 步骤1:将图像数据集及其对应的类别标签信息分别对应分成三部分:训练集、测试集和检索集,其中每个样本均包括一张图像及对应的文字描述,训练集和测试集中每个类别取相同的样本数;[0083] 步骤2:对图像信息进行预处理,将大幅图像裁剪成224*224像素大。宰魑P褪淙耄籟0084] 步骤3:构建基于斜方差特征融合与Mamba的深度跨模态哈希检索架构,它包括CLIP(采用ViT?B?32预训练权重)特征提取骨干、Mamba斜方差交叉特征融合模块、哈希层(包括全连接层、层归一化层和激活函数tanh(·))和损失函数(包括代理损失和哈希中心平衡损失),其中CLIP特征提取骨干和Mamba斜方差交叉特征融合模块用于学习图像特征,哈希层用于学习哈:墓菇ú⒌玫绞淙胪枷竦墓希码,损失函数用来引导哈:挠呕较颍籟0085] 步骤4:利用训练集,依据基于斜方差特征融合与Mamba的深度跨模态哈希检索架构,通过训练得到基于斜方差特征融合与Mamba的深度跨模态哈希检索模型;[0086] 步骤5:将测试集和检索集图片输入经过训练的基于频域解耦和视觉Mamba的深度哈希图像检索模型,分别得到测试集和检索集的哈希码。通过反向传播算法调整模型参数。利用验证集验证训练效果并保存最好的模型;[0087] 步骤6:取测试集测试最好的模型权重进行保存,并保存在测试集上表现效果最好的哈希码。[0088] 下面对上述步骤所提及特征融合网络、哈希层、损失函数进行详细介绍。[0089] 基于斜方差特征融合与Mamba的深度跨模态哈希检索架构如图1所示。首先使用CLIP框架作为特征提取网络,其中图片特征提取模块采用优秀的计算机视觉visiontransform框架,而在文本特征提取模块则选择transformer模块。使用官方提供的ViT?B?32预训练模型可以大大减少训练所需时间,而且得益于CLIP在大规模未标注的图像和文本对上进行预训练,学习到了图像与文本之间的内在关联,使得在模型中自然形成了模态对齐,而且通过计算图像和文本嵌入之间的相似度,将正例(正确的图像?文本对)拉近,同时将负例(不相关的图像?文本对)拉远,从而生成不仅在大规模数据集上检索速度及快且保持较高检索精度的哈希码。[0090] 一、Mamba斜方差交叉特征融合模块模块[0091] 该模块为本发明的核心模块,其由斜方差特征增强模块与Mamba特征融合模块一同构成,具体如图2所示,其中,在Mamba特征融合模块中,SSM代表状态空间模型,Conv代表卷积层。[0092] 斜方差增强模块:该模块仅由矩阵计算、张量操作与非线性函数的应用构成,这些操作在执行时并不会增加额外的参数量。且该模块可以融合来自不同模态(图像和文本)的信息,生成更加全面和深入的特征表示,以便于更好的处理多模态数据。如此一来再通过优化特征权重和融合策略,该模块能够提高模型在面对复杂决策时的可靠性,有效降低因单一模态信息局限性所导致的误判风险,进而确保模型输出的准确性和鲁棒性。[0093] 具体算法如下所示:[0094] 该模块接收从特征提取模块的提取出的图像特征Fi与文本特征Ft,其中Fi与Ft的矩阵大小为N×D,其中N为样本数量,D为每个样本的特征数量,则有:[0095] 计算样本嵌入总和:[0096][0097][0098] 构建相似度矩阵:[0099] I=i1i1T[0100] T=t1t1T[0101] S=I?T[0102] 构建激活函数:[0103] F=(1?tanh(S)2)·σ(S)·(1?σ(S))[0104] 其中,其中 为Sigmoid()函数,而 该复合激活函数与单一的激活函数Tanh()与Sigmoid()相比,本发明所采用的激活函数输出范围仅为(0,0.25),这有助于保持梯度的稳定性,从而有效降低梯度消失或梯度爆炸的风险,并且在增强模型稳定性。同时可以有效限制异常值的输入,从而增强模型的弹性和抗噪声能力。[0105] 生成增强特征:[0106] Ei=F⊙Fi+Fi[0107] Et=F⊙Ft+Ft[0108] 其中,Ei为图像增强特征,Et为增强文本特征;[0109] 合并特征并进行输出:[0110] R=[Ei,Et]。[0111] Mamba特征融合模块:Mamba框架在处理长序列数据方面展现出卓越效能,其核心竞争力源于创新性地采用选择性状态空间模型(SSM)。这一模型机制具备智能筛选能力,能够动态评估序列中每个token的信息价值,进而精明地决策信息的传递或舍弃。该方法确保了模型聚焦于序列中的关键片段,从而避免了对所有元素的无差别处理,极大地提升了在长序列分析场景下的运行效率与模型性能。[0112] 正是基于Mamba框架这一高效处理长序列数据的能力,本发明巧妙地将之融入跨模态特征融合流程。具体步骤如下,首先通过CLIP框架提取多模态数据的底层特征,随后将这些特征向量进行拼接。随后,将这一融合特征送入Mamba模型中,利用其独特的选择性状态空间机制,实现对不同模态间信息的深度整合与优化。这一过程不仅增强了特征的表达力,还促进了模态间信息的互补与协同,最终产出更为丰富、全面的特征信息,为后续任务做出了强有力的支撑。[0113] 在经过斜方差增强模块与Mamba特征融合模块后,对两种所提取的特征进行加权求和。这会产生具有互补性的特征表示,加权融合可以综合这些不同的特征,从而形成更加丰富与全面的表示,从而提高模型的性能和可靠性。[0114] 二、哈希层:[0115] 本发明所采用的多层感知机作为哈希映射函数,其可以自动学习图像特征的非线性表示,相较于传统的千层哈希方法,可以捕捉更为复杂、更为丰富的特征表达,从而生成更有效的哈希码。且整个哈希码的过程是一个端到端的训练,这允许在训练过程中优化整个网络的参数。相比之下一些传统的哈希方法则可能需要分步骤进行特征提取与哈希码生成,这可能会导致信息损失或不一致。具体哈:缤3所示,其中,隐藏层维度为4096输出层哈希长度为预设哈希长度值。[0116] 本发明所采用的哈希映射函数可以从数学上解释为:[0117] Z=sign(W(2)σ(W(1)X+b(1))+b(2))[0118] 其中,X是N×D的输入矩阵,N代表样本数量,D代表每个样本的维度;[0119] σ是ReLU激活函数,即σ(x)=max(0,x);[0120] W(1),W(2),b(1)与b(2)皆为需要学习的参数,通过反向传播和优化算法调整,以最小化某种损失函数;[0121] Sign函数用于将树枝转换为?1或+1的哈希码,即[0122] Z为N×H的输出矩阵,H为哈希码长度。[0123] 三、哈希学习模块:[0124] 哈希学习模块也是损失函数模块,如图1所示,损失函数是哈希码能够有效地反映图像之间相似关系的重要因素,本发明融合了现有的多模态多标签代理损失和所提出的跨模态分类平衡损失,以优化哈希码的生成。[0125] 多模态多标签代理损失通过学习图像和文本的哈希码表示,并结合代理来表示类别信息,有效地实现了多模态数据的统一表示。这种表示学习使得模型能够在不同模态之间进行有效的语义关联和相似度计算,且能够帮助模型在图像与文本之间建立一致的语义空间,从而实现高效的检索或分类任务。[0126] 但当特征空间分布差异较大时,这种方法无法有效地捕捉到不同模态之间的复杂关系。且多模态多标签代理损失主要关注样本的相似度,但在跨模态学习中标签信息也是十分重要的。[0127] 为了弥补多模态多标签代理损失在跨模态哈希检索中的不足,本发明提出了一种新的跨模态分类平衡损失,其主要补充和优势如:该损失通过计算哈希码与标签之间的一致性,强化了标签信息在模型训练中的作用,这有助于模型学习到更一致和更有意义的特征表示。且在跨模态学习设计多个模态之间的特征表示时,跨模态分类平衡损失的引入可以有效通过正负样本间的距离来优化模型,从而增强了模型对多模态数据的处理能力。该损失通过增强对标签信息的利用和优化多模态间的平衡,有效提升模型在跨模态学习任务中的性能和泛化能力。[0128] 在多模态多标签代理损失:为了确保相关联的多标签数据能在嵌入空间中被紧密聚类,同时推开无关的数据?代理对,本发明采用了一种多模态多标签代理损失函数,用于优化模型参数,其包括余弦距离、不相关代理距离与模态间无关损失,[0129] 余弦距离:[0130][0131] 其中,h是对应模型输出,p为对应真实标签。[0132] 不相关代理距离:[0133][0134] 其中,threshold为一个阈值用于确定何时应将相似度视为负面影响,可参考《HHF:Hashing?guidedHingefunctionfordeephashingretrieval,》进行设置。[0135] 模态间无关损失:[0136][0137] 其中,M代表模态间相关样本对的数量[0138] 计算分别计算其损失:[0139][0140][0141][0142] 其中,C代表该数据集所包含的种类的数量,D代表每个样本的特征数量。[0143] 综上所述,我们的多模态代理损失既考虑了模态内无关损失,同样也考虑了模态间的无关损失。故多模态多标签代理损失函数为:[0144][0145] 跨模态分类平衡损失(哈希中心平衡损失)由三个部分组成,分别为中心损失,Q损失与平衡损失。[0146] 中心损失:其作用是帮助模型学习每个类别在特征空间中的中心位置,从而改善特征表示的聚类效果。中心损失通过优化特征空间中每个类别的中心位置,使得同一类别的样本特征表示更加紧凑和聚集在一起。这种聚类效果有助于提高检索任务的效率,因为相似的样本在特征空间中更接近,更容易被检索到。并且通过最小化样本到其类别中心的距离,中心损失还能够增强特征的判别性。且本发明仅对分类错误的类进行惩罚,具体如以下公式所示:[0147][0148] 其中,ui是对应模型第i个输出,ti是对应真实第i个标签,N则表示样本数目;[0149] Q损失:通过约束特征向量的范围,促使模型生成更具区分度和表达力的哈希码,从而提升跨模态哈希检索任务的性能。具体来说,Q损失的作用是通过限制特征向量的取值范围,使其尽可能接近极端值(?1和1),以减少哈希码之间的重叠和混淆,从而增强哈希码的区分能力和表达能力,Q损失的具体计算方式为:[0150][0151] 平衡损失:通过强化对出现频率较低类别的关注,进而增强模型在多标签分类或多模态数据中的泛化能力和鲁棒性。这种损失机制有助于调整模型的学习重点,使其更加平衡地处理数据中不同类别的样本,从而提高整体性能。具体计算方式如下:[0152][0153] 其主要目的在于衡量标签分布在0.5附近的差异性,并结合平衡权重进行加权处理。其中β为平衡权重其值为0.001。[0154] 故跨模态分类平衡损失为以上三种损失的加权求和,如下所示:[0155] Ltotal=sigmoid(η)(Lcenter+λ×LQ+Lbalance)[0156] 其中,η为可学习参数其初始值为0.0001,而λ则为预先设置超参数其值为0.001。[0157] Ltotal=sigmoid(η)(Lcenter+λ×LQ+Lbalance)[0158] 计算图像和文本生成的哈希码与标签t之间的跨模态分类平衡损失Limage和Ltext,并对其进行加权即可获得跨模态分类平衡损失,如下所示:[0159] LCMCBL=Limage+Ltext[0160] 故哈希学习模块的总损失如下所示:[0161] Lfinal=LCMCBL+LPROXY。

专利地区:新疆

专利申请日期:2024-07-19

专利公开日期:2024-10-08

专利公告号:CN118747843A


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载