开云优惠体育网页版入口

开云优惠体育网页版入口:基于融合注意力机制的视觉语义交互模块的人脸识别方法

更新时间:2026-09-01
基于融合注意力机制的视觉语义交互模块的人脸识别方法 专利申请类型:发明专利;
地区:内蒙古-包头;
源自:包头高价值专利检索信息库;

专利名称:基于融合注意力机制的视觉语义交互模块的人脸识别方法

专利类型:发明专利

专利申请号:CN202310243882.3

专利申请(专利权)人:包头市易慧信息开云优惠体育网页版入口有限公司
权利人地址:内蒙古自治区包头市稀土开发区阿拉坦汗大街21号高新技术产业基地园区A3厂房一层

专利发明(设计)人:庞志刚,王波,杨巨成,王伟,国英龙,陈燕,贾智洋,孙笑,徐振宇,魏峰,赵婷婷,王嫄,潘旭冉

专利摘要:本发明提出一种基于融合注意力机制的视觉语义交互模块的人脸识别方法,包括:S1:获取包含文本描述的人脸数据集;S2:采用融合注意力机制的视觉语义交互模块构建基于知识引导的人脸识别网络模型;S3:初始化S2中建立的人脸识别网络模型,选取优化器,设置网络训练的参数;S4:使用损失函数优化人脸识别网络模型并保存;S5:加载训练过程中生成的最优人脸识别网络模型,获取测试数据集并将其输入到该网络模型,生成对应的人脸识别结果。本发明提出的基于融合注意力机制的视觉语义交互模块的人脸识别方法分别提取视觉特征和文本特征,再通过视觉语义交互更好的提取视觉知识,提高人脸识别的准确率。

主权利要求:
1.一种基于融合注意力机制的视觉语义交互模块的人脸识别方法,其特征在于,包括:S1:获取包含文本描述的人脸数据集;
S2:采用融合注意力机制的视觉语义交互模块构建基于知识引导的人脸识别网络模型,所述人脸识别网络模型包括文本特征提取、视觉特征提取、视觉语义交互三部分;
S3:初始化S2中建立的人脸识别网络模型,选取优化器,设置网络训练的参数;
S4:使用损失函数优化人脸识别网络模型并保存;
S5:加载训练过程中生成的最优人脸识别网络模型,获取测试数据集并将其输入到该网络模型,生成对应的人脸识别结果;
步骤S2中,所述文本特征提取采用长短期记忆网络LSTM,所述视觉特征提取采用残差网络ResNet,所述视觉语义交互由模态传递和多个注意力模块组成;
模态传递函数由具有可训练参数的两层全连接网络实现,给定图像的全局视觉特征之后,模态传递函数描绘出图像内容的模拟文本编码,实现异步训练和测试行为;
注意力模块的公式为: ;
T
其中,v是一张人脸图像的视觉特征的矩阵,v是v的转置矩阵;S是相应语句描述的文本T特征的矩阵,S是S的转置矩阵; 、 、 是可学习参数矩阵,分别将S和v映射到三个不同的向量空间Q、K、V; 为查询向量矩阵Q, 为键向量矩阵K, 为值向量矩阵V;
T
;K为键向量矩阵K的转置矩阵,k为K的向量, 为向量k的维度, 为缩放因子,
查询向量矩阵Q和键向量矩阵K经过缩放点积运算得到分值 ,然后,对分值进行softmax操作,得到权值分布矩阵,最后,将权值分布矩阵与值向量矩阵V相乘,得到输出矩阵A;
为可学习参数矩阵,将输出A映射回原始维度,得到融合特征f。
2.根据权利要求1所述的基于融合注意力机制的视觉语义交互模块的人脸识别方法,其特征在于,步骤S1采用大型人脸图像数据集Multi?Modal?CelebA?HQ,划分训练集和测试集,该数据集是从CelebA数据集中选择了高分辨率人脸图像,每张图像都有相应的文本描述。
3.根据权利要求1所述的基于融合注意力机制的视觉语义交互模块的人脸识别方法,其特征在于,步骤S3采用pytorch框架建立网络模型,初始化网络模型权重,选取随机梯度下降SGD优化器进行训练,初始化学习率。
4.根据权利要求1所述的基于融合注意力机制的视觉语义交互模块的人脸识别方法,其特征在于,步骤S4在视觉特征提取部分采用MagFace损失函数,文本特征提取部分采用交叉熵损失函数,通过两个损失函数共同对模型进行优化。
5.一种基于融合注意力机制的视觉语义交互模块的人脸识别装置,其特征在于,包括:数据集模块:获取包含文本描述的人脸数据集;
构建模块:采用融合注意力机制的视觉语义交互模块构建基于知识引导的人脸识别网络模型,所述人脸识别网络模型包括文本特征提取模块、视觉特征提取模块、视觉语义交互模块三部分;
初始化模块:初始化S2中建立的人脸识别网络模型,选取优化器,设置网络训练的参数;
损失函数模块:使用损失函数优化人脸识别网络模型并保存;
识别模块:加载训练过程中生成的最优人脸识别网络模型,获取测试数据集并将其输入到该网络模型,生成对应的人脸识别结果;
所述文本特征提取模块采用长短期记忆网络LSTM,所述视觉特征提取模块采用残差网络ResNet,所述视觉语义交互模块由模态传递和多个注意力模块组成;
模态传递函数由具有可训练参数的两层全连接网络实现,给定图像的全局视觉特征之后,模态传递函数描绘出图像内容的模拟文本编码,实现异步训练和测试行为;
注意力模块的公式为: ;
T
其中,v是一张人脸图像的视觉特征的矩阵,v是v的转置矩阵;S是相应语句描述的文本T特征的矩阵,S是S的转置矩阵; 、 、 是可学习参数矩阵,分别将S和v映射到三个不同的向量空间Q、K、V; 为查询向量矩阵Q, 为键向量矩阵K, 为值向量矩阵V;
T
;K为键向量矩阵K的转置矩阵,k为K的向量, 为向量k的维度, 为缩放因子,
查询向量矩阵Q和键向量矩阵K经过缩放点积运算得到分值 ,然后,对分值进行softmax操作,得到权值分布矩阵,最后,将权值分布矩阵与值向量矩阵V相乘,得到输出矩阵A;
为可学习参数矩阵,将输出A映射回原始维度,得到融合特征f。
6.根据权利要求5所述的基于融合注意力机制的视觉语义交互模块的人脸识别装置,其特征在于,所述数据集模块采用大型人脸图像数据集Multi?Modal?CelebA?HQ,划分训练集和测试集,该数据集是从CelebA数据集中选择了高分辨率人脸图像,每张图像都有相应的文本描述。
7.根据权利要求5所述的基于融合注意力机制的视觉语义交互模块的人脸识别装置,其特征在于,所述初始化模块中采用pytorch框架建立网络模型,初始化网络模型权重,选取随机梯度下降SGD优化器进行训练,初始化学习率。
8.根据权利要求5所述的基于融合注意力机制的视觉语义交互模块的人脸识别装置,其特征在于,所述损失函数模块在视觉特征提取部分采用MagFace损失函数,文本特征提取部分采用交叉熵损失函数,通过两个损失函数共同对模型进行优化。 说明书 : 基于融合注意力机制的视觉语义交互模块的人脸识别方法技术领域[0001] 本发明属于计算机视觉领域,特别涉及到一种基于融合注意力机制的视觉语义交互模块的人脸识别方法。背景技术[0002] 在当今信息化时代,如何准确鉴定一个人的身份、保护信息安全,已成为一个必须解决的关键社会问题。传统的身份认证由于极易伪造和丢失,越来越难以满足社会的需求,目前最为便捷与安全的解决方案无疑就是生物特征图像识别技术。其中,人脸识别技术相比于指纹、虹膜等其他生物特征识别技术具有直观、非接触性、方便采集、交互性强、可扩展性的优点成为一个非常热门的研究领域。[0003] 目前比较热门的是基于深度学习的人脸识别研究,其流程主要包括人脸预处理、特征学习、特征比对等步骤。其中,特征学习是人脸识别的关键,人脸识别的准确率主要取决于所采用的网络架构和损失函数。现在比较主流的网络架构有VGGNet、GoogleNet、ResNet等模型,此外,选择合适的损失函数有利于在特征空间将不同类别的人脸图像区分开,提升人脸识别的精度。因此,许多学者针对人脸识别的损失函数开展了一系列研究,比如,2019年Deng等人提出的ArcFace损失,2020年YonghyunKim等人提出的GroupFace损失,2021年Meng等人提出的MagFace损失等,显著提升了人脸识别的性能。[0004] 虽然基于深度学习的人脸识别已经取得了显著的改进,但仍存在一些挑战:首先,各种极端情况下的人脸识别性能依然不够理想,例如大年龄跨度、大姿态跨度、极端光照条件和低分辨率等;其次,CNN的高效训练需要大规模的训练数据,而且基于深度神经网络的模型一旦训练成形后成为一个端到端的规则化映射函数,缺乏可解释性和透明性。仅仅依靠数据驱动,缺乏“知识”指导,深度学习模型无法在识别过程中展现决策推理过程,其有效性和鲁棒性也待提高。[0005] 知识的引入能够有效缓解上述数据驱动模型所面临的问题,增加模型可解释性,减少模型对数据量的依赖,增加模型的鲁棒性。知识分为显性知识和隐性知识,一般显性知识包括语义词典、语义网络和知识图谱等知识库中的词义解释、语义关系等明确的知识,这些知识通常被称为常识、世界知识等;隐性知识指在模型训练过程中使用的样本属性、上下文信息、因果关系、挖掘的特征等难以明确但对模型理解有益的知识,这些知识一般是领域规律,需要在具体的场景产生和发挥作用。[0006] 针对知识引导的深度学习模型已经开展了一些研究工作。比如,2017年提出的一种图像和文本信息结合的方式,把一些百科文本信息作为外部辅助信息,其中视觉流是普通的深度卷积神经网络,文本流是一个CNN和RNN结合的方式提取文本特征并和深度卷积神经网络的特征相互匹配学习的过程,最后两个流共同作用于细粒度图像分类。人脸识别是近几年来国内外研究的热点,尽管目前研究人员提出了大量的人脸识别方法,但是基于知识引导的人脸识别还鲜有研究,需要继续探索和完善。发明内容[0007] 本发明的目的在于克服现有技术的不足,提出一种基于融合注意力机制的视觉语义交互模块的人脸识别方法,以提高人脸识别系统的准确率和鲁棒性。[0008] 为达到上述目的,本发明的技术方案是这样实现的:[0009] 一种基于融合注意力机制的视觉语义交互模块的人脸识别方法,包括:[0010] S1:获取包含文本描述的人脸数据集;[0011] S2:采用融合注意力机制的视觉语义交互模块构建基于知识引导的人脸识别网络模型,所述人脸识别网络模型包括文本特征提取、视觉特征提取、视觉语义交互三部分;[0012] S3:初始化S2中建立的人脸识别网络模型,选取优化器,设置网络训练的参数;[0013] S4:使用损失函数优化人脸识别网络模型并保存;[0014] S5:加载训练过程中生成的最优人脸识别网络模型,获取测试数据集并将其输入到该网络模型,生成对应的人脸识别结果。[0015] 进一步的,步骤S1采用大型人脸图像数据集Multi?Modal?CelebA?HQ,划分训练集和测试集。该数据集是从CelebA数据集中选择了高分辨率人脸图像,每张图像都有相应的文本描述。[0016] 进一步的,步骤S2中,所述文本特征提取采用长短期记忆网络LSTM,所述视觉特征提取采用残差网络ResNet,所述视觉语义交互由模态传递和多个注意力模块组成。[0017] 进一步的,步骤S3采用pytorch框架建立网络模型,初始化网络模型权重,选取随机梯度下降SGD优化器进行训练,初始化学习率。[0018] 进一步的,步骤S4在视觉特征提取部分采用MagFace损失函数,文本特征提取部分采用交叉熵损失函数,通过两个损失函数共同对模型进行优化。[0019] 本发明另一方面还提出了一种基于融合注意力机制的视觉语义交互模块的人脸识别装置,包括:[0020] 数据集模块:获取包含文本描述的人脸数据集;[0021] 构建模块:采用融合注意力机制的视觉语义交互模块构建基于知识引导的人脸识别网络模型,所述人脸识别网络模型包括文本特征提取模块、视觉特征提取模块、视觉语义交互模块三部分;[0022] 初始化模块:初始化S2中建立的人脸识别网络模型,选取优化器,设置网络训练的参数;[0023] 损失函数模块:使用损失函数优化人脸识别网络模型并保存;[0024] 识别模块:加载训练过程中生成的最优人脸识别网络模型,获取测试数据集并将其输入到该网络模型,生成对应的人脸识别结果。[0025] 进一步的,所述数据集模块采用大型人脸图像数据集Multi?Modal?CelebA?HQ,划分训练集和测试集。该数据集是从CelebA数据集中选择了高分辨率人脸图像,每张图像都有相应的文本描述。[0026] 进一步的,所述文本特征提取模块采用长短期记忆网络LSTM,所述视觉特征提取模块采用残差网络ResNet,所述视觉语义交互模块由模态传递和多个注意力模块组成。[0027] 进一步的,所述初始化模块中采用pytorch框架建立网络模型,初始化网络模型权重,选取随机梯度下降SGD优化器进行训练,初始化学习率。[0028] 进一步的,所述损失函数模块在视觉特征提取部分采用MagFace损失函数,文本特征提取部分采用交叉熵损失函数,通过两个损失函数共同对模型进行优化。[0029] 与现有技术相比,本发明具有如下的有益效果:[0030] 1、本发明提出了一种基于融合注意力机制的视觉语义交互模块的人脸识别方法,分别提取视觉特征和文本特征,再通过视觉语义交互更好的提取视觉知识,提高人脸识别的准确率。[0031] 2、本发明提出的视觉语义交互基于注意力机制,通过使用多个注意力单元来分段提炼视觉知识,最后求取平均值,获得文本引导后的视觉信息,能够进一步提高人脸识别系统的准确率和鲁棒性。附图说明[0032] 图1是本发明实施例的人脸识别方法实施流程图。[0033] 图2是本发明实施例的人脸识别整体结构示意图。[0034] 图3是本发明实施例的注意力网络示意图。具体实施方式[0035] 需要说明的是,在不冲突的情况下,本发明中的实施例及实施例中的特征可以相互组合。[0036] 为使本发明专利的目的、特征更明显易懂,下面结合附图对本发明专利的具体实施方式作进一步的说明。需说明的是,附图均采用非常简化的形式且均使用非精准的比率,仅用以方便、明晰地辅助说明本发明专利实施例的目的。[0037] 图1显示了本发明提出的基于融合注意力机制的视觉语义交互模块的人脸识别方法实施流程图,其包括:[0038] 步骤1:获取包含文本描述的人脸数据集。[0039] 采用数据集Multi?Modal?CelebA?HQ,该数据集是从CelebA数据集中选择了30000个高分辨率人脸图像,每张图像都有相应的文本描述。按照7:3的比例将其划分训练集和测试集,其中,训练集包含21000张人脸图像,测试集包含9000张人脸图像,同时每张图像选择10条文本描述。[0040] 步骤2:采用融合注意力机制的视觉语义交互模块来构建基于知识引导的人脸识别模型。[0041] 如图2所示,构建的基于知识引导的人脸识别模型主要包括三部分:文本特征提取模块、视觉特征提取模块、视觉语义交互模块。其中,文本特征提取模块采用长短期记忆网络(LSTM)提取文本特征,该网络能够学习长的依赖关系,更好的处理时间序列任务。然后,定义了一个丢弃率r表示随机丢弃真实样本的概率,可以使该网络在训练期间随机丢弃一些信息来提高模型泛化能力。[0042] 视觉特征提取模块首先对输入图像进行人脸检测、人脸对齐,然后采用残差网络(ResNet?100)提取视觉特征,超深的网络结构可以提高网络的表征能力,同时残差模块可以防止出现梯度消失或梯度爆炸现象。[0043] 视觉语义交互模块由模态传递和多个注意力模块组成,其中模态传递函数由具有可训练参数的两层全连接网络实现,给定图像的全局视觉特征之后,该函数可以近似的描绘出图像内容的模拟文本编码,实现异步训练和测试行为。模型经过训练之后,如果只输入图像,可以通过模态传递函数模拟出图像内容的文本编码,从而可以在不考虑文本可用性的情况下进行图像识别。[0044] 缩放点积注意力机制定义为公式(1):[0045][0046] 其中,Q是查询向量矩阵(Query),K是键向量矩阵(Key),KT为K的转置矩阵,V是值向量矩阵(Value),dk为向量k的维度, 为缩放因子,可防止乘积结果过大。[0047] 视觉语义交互模块的注意力单元网络如图3所示,受到缩放点积注意力机制的启发,将其定义为公式(2):[0048] f=A(STWq,VTWk,VTWv)Wf(2)[0049] 其中,V是一张人脸图像的视觉特征的矩阵,VT是V的转置矩阵;S是相应语句描述T的文本特征的矩阵,S是S的转置矩阵;Wq、Wk、Wv是可学习参数矩阵,分别将S和V映射到三个不同的向量空间Q、K、V。查询向量矩阵Q和键向量矩阵K经过缩放点积运算得到分值 然后,对分值进行softmax操作,得到权值分布矩阵,最后,将权值分布矩阵与值向量矩阵V相乘,得到输出矩阵A。Wf为可学习参数矩阵,可将输出A映射回原始维度,得到融合特征f。通过n个注意力网络得到n个融合特征f1…fn(n是根据经验选择的基数因子),然后,对这n个融合特征求平均值得到融合特征向量F。融合特征向量定义为公式(3):[0050][0051] 其中, 分别是f1…fn的转置矩阵,Δ表示全局平均池化运算,最后得到维度为2的融合特征向量F。[0052] 得到融合特征向量F后,将其输入到由两层全连接神经网络构成的分类器中,得到最终输出结果。[0053] 步骤3:初始化网络模型,选取优化器,设置网络训练的参数。[0054] 采用pytorch框架建立网络模型,初始化网络模型权重,选取随机梯度下降(SGD)优化器进行训练,mini?batch设置为64,学习率从0.001动态递减到0.00015。[0055] 步骤4:使用损失函数优化网络模型并保存。[0056] 视觉特征提取模块采用MagFace损失函数,该损失函数引入了一种自适应机制,通过将高质量样本拉近类中心,将低质量样本推开来增强类内紧凑性,提高人脸识别能力。MagFace损失函数定义为公式(4):[0057][0058] 其中,N为一个训练批次的人脸样本数量,超参数λg用于权衡分类损失和正则化损失。分类损失中,s是缩放参数, 是权重 与特征xi之间的夹角,m(ai)是角度边缘惩:,可以根据特征大小动态调整边界。g(ai)为正则化函数,可将低质量样本推向可行区域的边界,将高质量样本拉近类中心。[0059] 文本特征提取模块采用交叉熵损失函数,定义为公式(5):[0060][0061] 其中,N为样本的数量,yi为样本i的标签(正类为1,负类为0),pi为样本i预测为正类的概率。[0062] 该步骤通过以上两个损失函数共同对图2所示模型进行优化,其总损失定义为公式(6):[0063] L=LMag+λLPE(6)[0064] 其中,λ为超参数。[0065] 步骤5:加载训练过程中生成的最优网络模型,获取测试数据集并将其输入到该网络模型,生成对应的人脸识别结果。[0066] 测试数据集为Multi?Modal?CelebA?HQ数据集中的后9000张图像和文本。模型测试时,可以仅输入图像或者图像?文本对进行测试,获得相应的人脸识别结果。[0067] 步骤6:计算评价指标来评估网络模型的性能。[0068] 根据步骤5生成的人脸识别结果来计算评价指标误识率(FAR)、拒识率(FRR)和ROC曲线,评估网络模型的性能。[0069] 以上所述仅为本申请的优选实施例而已,并不用于限制本申请,对于本领域的技术人员来说,本申请可以有各种更改和变化。凡在本申请的精神和原则之内,所作的任何修改、等同替换、改进等,均应包含在本申请的保护范围之内。

专利地区:内蒙古

专利申请日期:2023-03-15

专利公开日期:2024-07-26

专利公告号:CN116563909B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载