产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:一种基于多模态低维特征表示空间的多媒体事件提取方法
专利类型:发明专利
专利申请号:CN202411213679.2
专利申请(专利权)人:西北民族大学
权利人地址:甘肃省兰州市城关区西北新村1号
专利发明(设计)人:江涛,崔伊明,孙斌,崔家豪,徐梦瑶
专利摘要:本发明公开了一种基于多模态低维特征表示空间的多媒体事件提取方法,首先构建多模态低维特征表示空间,将文本与图像特征表示为统一维度,利用对比学习技术将匹配的文本与图像映射到多模态低维特征表示空间的相近区域,同时引入动量蒸馏方法;将文本描述的每个单词进行特征表示初始化,并通过多模态低维特征表示空间与匹配图像进行特征融合,之后根据融合特征提取文本事件;引入ViECap图像描述技术生成图像描述,获取图像、文本与事件类型、事件论元相似度,提取图像事件,进行事件论元框定。本发明基于多模态低维特征表示空间进行多媒体事件的提。魅趿四P凸菇ü讨惺菁胍舳阅P吞崛⌒阅艿挠跋,提高模型进行多媒体事件提取的性能。
主权利要求:
1.一种基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,包括以下步骤:
S1、构建多模态低维特征表示空间
利用VOA图像标题对数据集构建多模态低维特征表示空间;在训练多模态低维特征表示空间模型时,对于给定的图像标题对,分别针对图像集合与文本集合构建基于Transformer的编码器,同时构建两个用于存储最新的图像标题对的队列,根据图像与文本的编码器创建动量编码器,利用动量蒸馏方法从动量蒸馏模型所产生的伪目标中学习图像与文本的匹配,利用动量编码器计算图像与文本的相似性;从而将匹配的文本与图像映射到多模态低维特征表示空间的相近区域;通过多模态低维特征表示空间对测试数据的文本与图像映射为统一维度的多模态低维特征,实现不同模态特征的融合以及便于计算文本与图像间的相似度;
S2、文本事件提取
将ACE2005文本事件数据集作为文本事件提取模型的训练数据;从VOA图像标题对数据集中筛选出与ACE2005文本事件数据集中每个文本描述最为匹配的五个图像作为文本事件的额外图像信息;将文本描述的每个单词通过DeBERTaV3进行特征表示初始化,获得每个单词的向量表示;将所述额外图像信息涉及的图像通过多模态低维特征表示空间编码成图像低维向量表示,将图像低维向量表示按照相似性权重进行加权融合获得图像信息集成的图像表示,之后将每个单词的向量表示与图像信息集成的图像表示以及句子的低维向量表示进行拼接,获得融入图像信息的单词表示,完成文本事件提。
S3、图像事件提取
通过ViECap图像描述技术生成图像相关的文本描述,即图像描述,将图像事件、相关文本事件以及生成的图像描述经多模态低维特征表示空间编码后,利用余弦相似度计算图像事件、相关文本事件以及图像描述与预先定义好的视觉事件类型、视觉事件论元的相似度得分,通过加权融合获得相似度得分最高的视觉事件类型与视觉事件论元;获取事件论元后针对图像进行前向传递、基于梯度的注意力整合以及相关性图计算,从而对图像中相关的事件论元进行图像框定。
2.如权利要求1所述的基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,步骤S1中,为获得能够对测试数据的文本和图像统一维度表示的多模态低维特征表示空间,首先需要使用CLIPViT?B/32版本分别对多模态低维特征表示空间模型和动量蒸馏模型进行参数初始化,之后借助VOA图像标题对数据集的文本与图像对多模态低维特征表示空间进行预训练,同时利用动量蒸馏模型生成的伪目标对基础模型进行监督;最后使用imSitu数据集对预训练后的数据集进行微调,同时利用动量蒸馏模型对微调模型进行监督。
3.如权利要求1所述的基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,步骤S2中,所述单词的向量表示获得方法为:将多媒体事件的句子合集中的每一个句子表示通过DeBERTaV3的编码器获取每个单词的类型嵌入表示、子词嵌入表示以及绝对位置嵌入表示,类型嵌入表示与子词嵌入表示融合作为单词的内容表示向量,之后与绝对位置嵌入表示经注意力解耦机制计算单词间注意力与相对位置信息,获得每个单词的向量表示。
4.如权利要求1所述的基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,步骤S2中,所述相似性权重通过余弦相似度计算,公式如下:
式中,Ij表示图像合集I中的第j个图像ij经多模态低维特征表示空间编码后的低维向量表示,Si是句子合集S中的第i个句子ii经多模态低维特征表示空间编码后的低维向量表示,αi,j是图像ij与句子ii的相似性权重;则所述图像信息集成的图像表示HImage的公式如下:。
5.如权利要求1所述的基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,步骤S3中,所述ViECap图像描述技术生成图像描述的方法如下:将图像合集中的每一个图像经过ViECap模型的图像编码器转化为视觉嵌入,并将视觉嵌入利用转化器生成软提示;同时ViECap模型使用基于CLIP的实体分类器进行零样本图像实体检索,通过计算图像与实体的相关性选取一定的实体构建实体感知硬提示;最后将所述软提示和硬提示按顺序连接并输入到语言模型中进行图像描述的预测,获得多媒体图像合集的图像描述。
6.如权利要求1所述的基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,步骤S3中,所述视觉事件类型的识别方法如下:将imSitu数据集中的活动动词集合与视觉事件类型制作成映射表,通过公共空间计算所有活动动词与图像的余弦相似度,即可获得与图像最相似的活动动词;再分别计算活动动词与文本事件以及与图像描述的余弦相似度;最后将三个余弦相似度得分赋予不同的权重进行加权融合,获得同时匹配视觉图像、文本事件以及图像描述文本的活动动词,根据活动动词集合与视觉事件类型的映射表即可获得该活动动词的视觉事件类型。
7.如权利要求1所述的基于多模态低维特征表示空间的多媒体事件提取方法,其特征在于,步骤S3中,所述视觉事件论元的识别方法如下:将imSitu数据集中的语义角色集合与视觉事件论元制作成映射表,之后通过公共空间计算所有语义角色与视觉图像、文本事件以及图像描述的余弦相似度,最后将三个余弦相似度得分赋予不同的权重进行加权融合,获得同时匹配视觉图像、文本事件以及图像描述文本的语义角色,根据语义角色集合与视觉事件论元的映射表即可获得该语义角色的视觉事件论元。 说明书 : 一种基于多模态低维特征表示空间的多媒体事件提取方法技术领域[0001] 本发明属于多媒体事件提取技术领域,具体涉及一种基于多模态低维特征表示空间的多媒体事件提取方法。背景技术[0002] 事件提取任务是一项重要且富有挑战的信息提取研究,事件提取任务是从非结构化的数据中识别事件的事件类型与事件论元并形成结构化数据,为信息检索、智能推荐、事件知识图谱构建等与事件相关的应用提供基础数据。事件类型一般为促使事件发生的某个动词,也被称为触发词。事件论元包括事件发生的时间、地点以及事件相关的参与者,如发起人、接收者和工具。[0003] 以往的事件提取研究只关注单一模态,无论是从文本数据还是从图像数据中提取事件信息,都忽略了多种模态数据所提供的事件信息补充作用。多媒体新闻事件抽取相关研究起步较晚,由于数据标注的成本过高,目前仍缺少足以支撑模型进行有监督训练的数据集,仅有用于测试的小型多媒体事件提取数据集M2E2,该数据集不足以支撑模型的训练,因此当前的研究都采用弱监督方法进行模型的训练。具体来讲,模型构建流程是通过网络收集图像标题对数据集构建一个能够同时表示文本与图像的特征表示空间,其目的是实现文本与图像两种模态的对齐,同时分别用文本数据集与图像数据集训练文本事件与图像事件以提取模型,借助特征表示空间对文本与图像进行简单融合后分别用于文本事件提取与图像事件提取。[0004] 虽然研究者不断探索新的事件提取方法以提高多媒体事件提取的准确性,但弱监督方法不可避免受到数据中的噪声影响。首先,从网络中收集的图像标题对数据集存在大量的噪声问题,弱相关的图像标题往往会对后续的提取造成负面影响。其次,从文本角度来看多媒体事件提取研究更加关注文章某个词是否为事件类型的触发词或者事件论元,从图像角度来看则更加关注图像中的某个视觉区域是否涉及事件类型或者事件论元,简单的向量融合方法往往将一段文本与一张图像作为一个向量进行融合,这种方法不但无法提高模型的性能,反而会因为引入了另一模态的噪音从而影响事件信息的提取。发明内容[0005] 针对上述背景技术中存在的问题,本发明提供了一种基于多模态低维特征表示空间的多媒体事件提取方法,旨在多媒体事件提取时削弱模型构建过程中数据集噪音对模型提取性能的影响,提高模型进行多媒体事件提取的性能。[0006] 为了实现上述目的,本发明采用如下技术方案:[0007] 一种基于多模态低维特征表示空间的多媒体事件提取方法,包括以下步骤:[0008] S1、构建多模态低维特征表示空间[0009] 利用VOA图像标题对数据集构建多模态低维特征表示空间;在训练多模态低维特征表示空间模型时,对于给定的图像标题对,分别针对图像集合与文本集合构建基于Transformer的编码器,同时构建两个用于存储最新的图像标题对的队列,根据图像与文本的编码器创建动量编码器,利用动量蒸馏方法从动量蒸馏模型所产生的伪目标中学习图像与文本的匹配,利用动量编码器计算图像与文本的相似性;从而将匹配的文本与图像映射到多模态低维特征表示空间的相近区域;通过多模态低维特征表示空间对测试数据的文本与图像映射为统一维度的多模态低维特征,实现不同模态特征的融合以及便于计算文本与图像间的相似度;[0010] 在利用对比学习提高模型匹配文本与图像能力的同时,引入动量蒸馏方法减少图像标题对数据集中噪音对模型的影响;多模态低维特征表示空间可以将文本与图像特征表示为统一维度,以此实现文本与图像的特征融合;[0011] S2、文本事件提取[0012] 将ACE2005文本事件数据集作为文本事件提取模型的训练数据;从VOA图像标题对数据集中筛选出与ACE2005文本事件数据集中每个文本描述最为匹配的五个图像作为文本事件的额外图像信息;将文本描述的每个单词通过DeBERTaV3进行特征表示初始化,获得每个单词的向量表示;将所述额外图像信息涉及的图像通过多模态低维特征表示空间编码成图像低维向量表示,将图像低维向量表示按照相似性权重进行加权融合获得图像信息集成的图像表示,之后将每个单词的向量表示与图像信息集成的图像表示以及句子的低维向量表示进行拼接,获得融入图像信息的单词表示,完成文本事件提。籟0013] S3、图像事件提取[0014] 通过ViECap图像描述技术生成图像相关的文本描述,即图像描述,将图像事件、相关文本事件以及生成的图像描述经多模态低维特征表示空间编码后,利用余弦相似度计算图像事件、相关文本事件以及图像描述与预先定义好的视觉事件类型、视觉事件论元的相似度得分,通过加权融合获得相似度得分最高的视觉事件类型与视觉事件论元;获取事件论元后针对图像进行前向传递、基于梯度的注意力整合以及相关性图计算,从而对图像中相关的事件论元进行图像框定。[0015] 进一步的,步骤S1中,想要获得能够对测试数据的文本和图像统一维度表示的多模态低维特征表示空间,首先需要使用CLIPViT?B/32版本分别对多模态低维特征表示空间模型和动量蒸馏模型进行参数初始化,之后借助VOA图像标题对数据集的文本与图像对多模态低维特征表示空间进行预训练,同时利用动量蒸馏模型生成的伪目标对基础模型进行监督;最后使用imSitu数据集对预训练后的数据集进行微调,同时利用动量蒸馏模型对微调模型进行监督。[0016] 进一步的,在步骤S2中,所述单词的向量表示获得方法为:将多媒体事件的句子合集中的每一个句子表示通过DeBERTaV3的编码器获取每个单词的类型嵌入表示、子词嵌入表示以及绝对位置嵌入表示,类型嵌入表示与子词嵌入表示融合作为单词的内容表示向量,之后与绝对位置嵌入表示经注意力解耦机制计算单词间注意力与相对位置信息,获得每个单词的向量表示。[0017] 进一步的,在步骤S2中,所述相似性权重通过余弦相似度计算,公式如下:[0018][0019] 式中,Ij表示图像合集I中的第j个图像ij经多模态低维特征表示空间编码后的低维向量表示,Si是句子合集S中的第i个句子ii经多模态低维特征表示空间编码后的低维向量表示,αi,j是图像ij与句子ii的相似性权重;则所述图像信息集成的图像表示HImage的公式如下:[0020] 。[0021] 进一步的,在步骤S3中,所述ViECap图像描述技术生成图像描述的方法如下:[0022] 将图像合集中的每一个图像经过ViECap模型的图像编码器转化为视觉嵌入,并将视觉嵌入利用转化器生成软提示;同时ViECap模型使用基于CLIP的实体分类器进行零样本图像实体检索,通过计算图像与实体的相关性选取一定的实体构建实体感知硬提示;最后将所述软提示和硬提示按顺序连接并输入到语言模型中进行图像描述的预测,获得多媒体图像合集的图像描述。[0023] 进一步的,在步骤S3中,所述视觉事件类型的识别方法如下:将imSitu数据集中的活动动词集合与视觉事件类型制作成映射表,通过公共空间计算所有活动动词与图像的余弦相似度,即可获得与图像最相似的活动动词;再分别计算活动动词与文本事件以及与图像描述的余弦相似度;最后将三个余弦相似度得分赋予不同的权重进行加权融合,获得同时匹配视觉图像、文本事件以及图像描述文本的活动动词,根据活动动词集合与视觉事件类型的映射表即可获得该活动动词的视觉事件类型。[0024] 进一步的,在步骤S3中,所述视觉事件论元的识别方法如下:将imSitu数据集中的语义角色集合与视觉事件论元制作成映射表,之后通过公共空间计算所有语义角色与视觉图像、文本事件以及图像描述的余弦相似度,最后将三个余弦相似度得分赋予不同的权重进行加权融合,获得同时匹配视觉图像、文本事件以及图像描述文本的语义角色,根据语义角色集合与视觉事件论元的映射表即可获得该语义角色的视觉事件论元。[0025] 相比于现有技术的缺点和不足,本发明具有以下有益效果:[0026] (1)本发明基于多模态低维特征表示空间进行多媒体事件的提。ü谌氩煌L南喙厥录信息提高事件提取的性能,文本事件提取方面,通过将相关图像的低维表示向量与每个单词进行融合,事件类型与事件论元提取的F1值分别提升了1.0%与1.7%。视觉事件提取通过引入事件的文本描述以及图像描述,各个评价指标也有了不同程度的提升。其中事件类型与事件论元提取的召回率提升最明显,有效提高模型预测正确样例的数量以及减少错误预测的数量;[0027] (2)本发明在CLIP模型参数的基础上借助VOA数据集进行对比学习预训练,然后使用imSitu数据集微调模型,在预训练和微调的同时引入动量蒸馏模型进行监督,加入动量蒸馏后可以有效提高模型图像文本匹配能力;[0028] (3)本发明有效削弱了模型构建过程中数据集噪音对模型提取性能的影响,提高模型进行多媒体事件提取的性能。附图说明[0029] 图1是本发明实施例提供的基于多模态低维特征表示空间的多媒体事件提取方法的流程框图;[0030] 图2是本发明实施例提供的多模态低维特征表示空间构建的框架图;[0031] 图3是本发明实施例提供的事件抽取框架图;[0032] 图4是本发明实验例提供的不同多模态低维特征表示空间构建策略对视觉事件类型检测、视觉事件论元检测以及视觉事件论元框定的影响。具体实施方式[0033] 为了使本发明的目的、技术方案及优点更加清楚明白,以下结合具体实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本发明,并不用于限定本发明。[0034] 实施例[0035] 一种基于多模态低维特征表示空间的多媒体事件提取方法,流程框图如图1所示,包括以下步骤:[0036] S1、构建多模态低维特征表示空间[0037] 对比学习:[0038] 利用VOA图像标题对数据集构建多模态低维特征表示空间,对于给定的一组N对图像标题对,针对图像集合I=[I1,I2,I3,...,IN]与文本集合T=[T1,T2,T3,...,TN]分别构建基于Transformer的编码器。[0039] 定义如下的相似性计算函数:[0040] (1)[0041] (2)[0042] 其中,fv(Ip)与fw(Tq)分别表示将图像Ip与文本Tq( )映射为统一标准化的低维特征表示形式; 表示文本经普通的编码器后获得的相似性计算函数, 表示图像经普通的编码器后获得的相似性计算函数,这两个相似性计算函数能够让相似的图像与文本在向量空间中的位置更加接近,即两者的相似性得分更高。同时构建两个队列用于存储最新的N对图像标题对。根据图像与文本的编码器创建动量编码器,用fˊv(Iˊp)与fˊw(Tˊq)分别表示图像与文本经动量编码器的归一化特征,定义 ,,其中, 表示普通编码器文本与动量蒸馏编码器图像的相似度计算函数, 表示普通编码器图像与动量蒸馏编码器文本的相似度计算函数;对于每个图像与文本,其经过编码器后便可用如下公式计算图像到文本的相似度 (公式(3))以及文本到图像的相似度 (公式(4)):[0043] (3)[0044] (4)[0045] 其中,τ是可以学习的温度参数。[0046] 图像与文本的对比学习损失函数Litc由s和p的交叉熵H定义:[0047] (5)。[0048] 动量蒸馏:[0049] 图像标题对比学习中利用one?hot标签,图像与文本要么是完全匹配要么就会被认定为不匹配。但往往真正的图像标题数据是弱相关的,图像中可能有文本中没有提到的实体,而文本也可能是图像否定,这些因素都会影响对比学习模型将两者识别为不相关。因此,利用动量蒸馏方法从动量蒸馏模型所产生的伪目标中学习图像与文本的匹配。利用动量编码器计算 与 ,其中, 表示从图像到文本的相似度计算函数, 表示从文本到图像的相似度计算函数,参照公式(3)和公式(4)即可i2t t2i计算出软伪目标表示q 以及q 。动量蒸馏下的对比学习损失函数 定义如下:[0050] (6)[0051] 其中,权重α设置为0.4,KL(||)表示计算真实相似度与软伪目标相似度间的相对熵。[0052] 模型训练过程:[0053] 首先使用CLIPViT?B/32版本模型对多模态低维特征表示空间模型进行参数初始化,对于动量蒸馏模型同样使用其参数进行初始化。之后借助VOA图像标题对数据集进行预训练,同时利用动量蒸馏模型生成伪目标对基础模型进行监督,从而让模型针对新闻领域能够获得更多的相关知识。最后使用imSitu数据集对预训练后的数据集进行微调,因为该数据集涉及活动动词以及语义角色两种与图像相关的文本内容,所以利用一个模型同时训练图像与活动动词、图像与语义角色的相似匹配能力。同理利用动量蒸馏模型对微调模型进行监督。[0054] 在利用对比学习提高模型匹配文本与图像能力的同时,引入动量蒸馏方法减少图像标题对数据集中噪音对模型的影响;多模态低维特征表示空间可以将文本与图像特征表示为统一维度,以此实现文本与图像的特征融合。[0055] S2、构建文本事件提取模型[0056] 文本事件类型预测:[0057] 当获得了融入图像信息的单词表示后,对每一个单词判断其是否为事件触发词:[0058] (7)[0059] 其中,Wt和Bt是需要经过模型训练获得的模型参数。Hˊi为融合特征向量,包含一个句子中的第i个单词wi经DeBERTaV3编码器获取的单词特征向量、该文本句子与涉及图像分别经多模态低维特征表示空间所获得的句子特征向量与图像特征向量。Oi是关于该单词所有可能事件类型的概率输出向量,而非事件触发词的单词则用None来表示。Oi中概率最高的事件类型则为该文本事件的事件类型。[0060] 文本事件论元预测:[0061] 参照文本事件类型预测的思路,利用如下方式进行文本事件中实体对应元素角色的预测:[0062] (8)[0063] 其中,Oj是关于元素角色的概率向量,Wa与Ba是需要经过模型训练获得的模型参数,Hˊtrigger表示该文本事件预测出的事件触发词,Hˊj则是句子中的第j个实体。如果一个实体涉及多个单词,则用平均值进行表示。[0064] 训练与测试:[0065] 文本事件提取的模型训练阶段使用ACE2005文本事件数据集作为模型的训练数据。但目前不存在与之匹配的图像数据,借助VOA图像标题对数据集,即可选取与ACE2005文本事件数据集中的每个文本描述最为匹配的五个图像作为图像数据支撑。最后将ACE2005文本事件与匹配的图像转化为统一维度的特征向量并进行特征融合与模型训练。[0066] 测试阶段则利用M2E2进行模型测试,将每个句子相关的所有图像信息进行加权融合并融入文本进行模型预测。具体如下:[0067] 当给定了多媒体事件的句子合集S={s1,s2,s3,...,sm},对于该句子合集中的每一个句子si={w1,w2,w3,...,wt},通过DeBERTaV3的编码器获取每个单词的类型嵌入表示ET={ET,1,ET,2,ET,3,...,ET,t}、子词嵌入表示ES={ES,1,ES,2,ES,3,...,ES,t}以及绝对位置嵌入表示EA={EA,1,EA,2,EA,3,...,EA,t},类型嵌入表示ET与子词嵌入表示ES融合作为单词的内容表示向量,之后与绝对位置嵌入表示EA经注意力解耦机制计算单词间注意力与相对位置信息,获得每个单词的最终向量表示HWord={H1,H2,H3,...,Ht}。[0068] 当获得了每个单词的向量表示,需要将其与图像特征进行融合。将多媒体事件涉及的图像I={i1,i2,i3,...,in}经多模态低维特征表示空间编码成图像低维向量表示,将图像低维向量表示通过余弦相似度计算相似性权重:[0069] (9)[0070] 式中,Ij表示图像合集I中的第j个图像ij经多模态低维特征表示空间编码后的低维向量表示,Si是句子合集S中的第i个句子ii经多模态低维特征表示空间编码后的低维向量表示,αi,j是图像ij与句子ii的相似性权重。相似性权重是图像与句子的归一化值计算,将图像低维向量表示按照相似性权重进行加权融合获得图像信息集成的图像表示HImage:[0071] (10)[0072] 最后将每个单词的向量表示HWord与信息集成的图像表示HImage以及句子的低维向量表示Si进行拼接: ,获得融入图像信息的单词表示HˊWord={Hˊ1,Hˊ2,Hˊ3,...,Hˊt}。[0073] S3、构建图像事件提取模型[0074] 将多媒体事件图像合集I={i1,i2,i3,...,i1}中的每一个图像经过ViECap模型的图像编码器转化为视觉嵌入,并将视觉嵌入利用转化器生成软提示;同时ViECap模型使用基于CLIP的实体分类器进行零样本图像实体检索,通过计算图像与实体的相关性选取一定的实体构建实体感知硬提示;最后将所述软提示和硬提示按顺序连接并输入到语言模型中I2T I2T I2T I2T I2T进行图像描述的预测,获得多媒体图像合集I的图像描述S ={s1 ,s2 ,s3 ,...,sn }。[0075] 视觉事件类型预测:[0076] 对于多媒体事件中的图像,需要确定每一个图像的视觉事件类型。由于缺少对视觉事件类型的直接标注,因此将imSitu数据集中的活动动词集合V={v1,v2,v3,...,vn}与事件类型制作成映射表。通过公共空间计算所有活动动词与图像的余弦相似度,即可获得与图像最相似的活动动词;其中, 表示活动动词vp的公共空间低维向量表示,Iq是图像iq的公共空间低维向量表示。考虑到imSitu数据集中有很多活动动词并不能与视觉事件类型相映射(如:“camouflaging”、“unplugging”等)。因此还需要分 别计 算活动动 词与文本事件以 及与图像描述 的余弦相似 度I2T和 。其中Tr与Tt 分别为文本I2T事件sr、图像描述st 经公共空间后的低维向量表示。最终如公式(11)所示:(11)[0077] 将三个余弦相似度得分赋予了不同的权重λ1、λ2与λ3,只有同时匹配视觉图像、文本事件以及图像描述文本的活动动词才能获得更高的相似性得分。[0078] imSitu数据集中存在多个活动动词对应一个视觉事件类型的情况,采用Top?K方法选取与图像相似性得分最高的前10个活动动词,统计这10个活动动词所映射的视觉事件类型出现的频次,频次最高的视觉事件类型即为该视觉事件的事件类型。[0079] 视觉事件论元预测:[0080] 当获得视觉事件类型后,即可筛选出与之相关的事件论元集合(视觉事件类型的相关事件论元集合被预先定义好)。采用与视觉事件类型预测相同的办法,将imSitu数据集中的活动动词集合V={v1,v2,v3,...,vn}替换为相同数据集中的语义角色集合R={r1,r2,r3,...,rm},之后计算语义角色和视觉图像、文本事件以及图像描述的余弦相似度,最终获得图像中所包含的语义角色。通过语义角色与事件论元映射表,即可获得该视觉事件的事件论元。[0081] 视觉事件论元框定:[0082] 事件论元是指在事件中扮演关键角色的对象或参与者,视觉事件论元提取任务需要对图像中已经预测的事件论元进行框定,即对图像中存在的关键对象或参与者用方框进行定位。通过三个步骤定位事件论元的方框:前向传递、基于梯度的注意力整合以及相关性图计算。通过将语义角色与图像作为输入,获取相似度得分;在前向传递的过程中,对每个注意力层的注意力图A进行平均从而生成梯度增强的注意力图 :[0083] (12)[0084] 其中,Ehd表示图像编码器中所有注意力头的注意力权重的期望值,C是活动角色与图像的相似性得分,e表示Hadamard乘积。获取注意力图后,即可将注意力图转化为相关性tt ii ti图。定义R 、R 、R 分别为文本到文本、图像到图像以及文本到图像相关性矩阵,然后对于文本的自注意力部分采用以下更新规则:[0085] (13)[0086] 其中, 表示第x个自注意力层计算所得的相关性矩阵, 表示第x+1个自注意力层的相关性矩阵。之后在自注意力计算过程中为相关性图添加不同模态的上下文特征信息:[0087] (14)[0088] 其中, 表示第x个自注意力层中所包含的其它模态的文本到图像相关性矩阵,表示第x+1个自注意力层中所包含的其它模态的文本到图像相关性矩阵。对于文本与图像跨模态注意力,采用以下更新规则对自注意力映射进行规范化:[0089] (5)[0090] 其中, 、 和 分别表示规范化的 、 和 ;[0091] 跨模态注意力最后一层的Rti用作相关性图来预测论元边界框。为了生成角色的边ti界框,为R 设置自适应值为0.75*p的阈值,其中p是相关性图的局部峰值,以此计算包含相关性图局部峰值的最小边界框作为预测框。[0092] 实验例[0093] 为验证本发明方法的技术效果,进行如下实验验证:[0094] 实验使用M2E2数据集进行模型评估。该数据集是由245篇多媒体新闻文档中的6167个句子和1014张图片组成,共涵盖8种事件类型(从ACE2005数据集进行选取而来)与15种事件论元(从ACE2005数据集与imSitu数据集扩充而来)。数据集中的事件实例可以分为1105个纯文本事件、188个纯图像事件以及395个多媒体事件。[0095] 实验过程中计算文本事件类型提取、文本事件论元提取、视觉事件类型检测、视觉事件论元检测、视觉事件论元框定的结果。均采用精确率(Precision)、召回率(Recall)以及F1值(F1?score)作为模型评估的指标。[0096] 多模态低维特征表示空间构建阶段,使用CLIP模型对对比学习模型与动量蒸馏模型的参数进行初始化。两个模型的文本编码器均为Transformer编码器,具有12层、512个隐藏单元以及8个注意力头。图像编码器则均为ViT?Transformer编码器,具有16×16的补丁尺寸、12层、768个隐藏单元以及12个头。在预训练与微调阶段,设置40轮训练,每轮训练的?5 ?7批次大小设置为40。在前5000次迭代中,将学习率预热到1e 经过余弦调度衰减为1e 。动量蒸馏模型的动量参数设置为0.995,蒸馏权重从0线性增加到0.4。文本事件提取模型训练过程中设置最大文本输入长度为200,共训练20轮,每轮训练的批次大小为20,学习率为?51e 。视觉事件提取中将Top?K方法的K值设置为10,权重λ1、λ2与λ3分别为0.7、0.15、0.15。图像描述生成方面选用GPT?2base进行图像描述的文本生成模型,软提示长度设置为10。视觉的事件论元提取阈值p为0.7。[0097] 为验证本发明的有效性,选取了目前较为流行且性能较高的几种模型作为基准模型进行对比实验,以下模型的实验结果均引用自原论文:[0098] JMEE是一种利用注意力图卷积神经网络结合句法信息与图表示学习的文本事件提取方法;[0099] GAIL方法是利用强化学习进行文本事件提。籟0100] VAD通过将视觉知识与文本单词、短语相结合,利用图像增强文本语义从而提高文本事件的提取性能;[0101] WASE?T与WASE?V是WASE多媒体事件提取模型的单一模态提取器,两者仅用单一模态进行训练(WASE?T使用文本数据,WASE?V使用图像数据)并分别用于文本与视觉的事件提。籟0102] WASEatt与WASEobj利用弱监督方法对齐文本与视觉事件,并利用两个单一模态事件提取器实现多媒体事件联合提。籥tt与obj表示在图像框定时使用两种不同的方法:[0103] Flatatt与Flatobj是在WASEatt与WASEobj模型基础上去除图卷积网络的变体,两者可以通过连接文本与视觉特征,实现对文本与视觉信息的表示;[0104] CLIP?event借助最优化传输进行多媒体事件对齐并进行信息提。籟0105] UniCL构建了一个统一框架,在该框架下文本与视觉事件信息能够实现统一表示,并在模态间信息增强的基础上进行文本与视觉事件的提取。[0106] 表1显示了文本事件提。ㄉ希、视觉事件提。ㄖ校、多媒体事件提取结果(下),Train Dataset Type表示各种提取方法(Method)使用文本数据(T),视觉数据(V)还是两种数据融合(T+V)进行模型训练,本实验例模型用Ours表示。可以看出,本实验例模型的结果优于大多数基线结果。[0107] 表1 采用不同多媒体事件提取模型的提取结果对比[0108][0109] 本发明提出的方法无论是在文本事件提取、视觉事件提取还是多媒体事件提取都有一定得提升。事件类型提取方面,借助不同模态信息得补充增强,文本与视觉事件类型提取性能分别提高了0.8%与1.0%,多媒体事件类型提取提高了1.9%。事件论元提取则分别提高了0.6%、1.7%与5.4%。同时,本发明的方法也说明了通过融入不同模态的相关事件信息可以提高事件提取的性能。文本事件提取方面,通过将相关图像的低维表示向量与每个单词进行融合,事件类型与事件论元提取的F1值分别提升了1.0%与1.7%。视觉事件提取通过引入事件的文本描述以及图像描述,各个评价指标也有了不同程度的提升。其中事件类型与事件论元提取的召回率提升最明显,分别提升了3.4%与1.7%。这说明通过引入事件文本与图像描述信息,让模型能够更好的判断每一个活动动词与语义角色是否与事件相关,减少不相关单词的出现在Top?10(利用Top?K方法,并且取前10个单词进行相关计算)的概率,从而提高模型预测正确样例的数量以及减少错误预测的数量。[0110] 为评估本发明模型改进的合理性,设置多组消融实验进行验证。[0111] 动量蒸馏技术的引入多媒体事件提取的效果如图4所示,图中,视觉事件类型检测、视觉事件论元检测、视觉事件论元框定中的五个矩形柱从左到右依次代表的方法为CLIP、CLIP+VOA、CLIP+VOA+MoD、CLIP+VOA+imSitu、CLIP+VOA+iSmitu+MoD。视觉事件提取直接利用公共空间进行图像与事件类型、事件论元的相似性计算,能够更好体现公共空间的性能,因此选择视觉事件类型检测、视觉事件论元检测以及视觉事件论元框定三个任务作为对比。这里仅使用图像数据而不使用文本数据从而减少无关因素的影响,实验主要对比了三个任务的F1值;CLIP表示公共空间直接使用CLIP模型提供的参数进行提。籆LIP+VOA表示在CLIP模型参数的基础上使用VOA数据集预训练后的公共空间;CLIP+VOA+MoD为在VOA预训练时利用动量蒸馏模型进行监督;CLIP+VOA+imSitu是在VOA数据集预训练后对公共空间进行imSitu数据集微调,利用活动动词与语义角色训练一个微调模型;CLIP+VOA+imSitu+MoD则是我们最终的方法,在CLIP模型参数的基础上借助VOA数据集进行对比学习预训练,然后使用imSitu数据集微调模型,在预训练和微调的同时引入动量蒸馏模型进行监督。通过对比可以看出CLIP+VOA+imSitu+MoD方法在事件类型检测与事件论元检测的F1值为56.9与39.8达到了最高的提取效果。虽然视觉事件论元框定为15.9低于CLIP+VOA+MoD方法,但验证了加入动量蒸馏后可以有效提高模型图像文本匹配能力。总体上,本发明的提取方法实现了三种任务的最好性能。[0112] 图像描述技术的引入对视觉事件类型与视觉事件论元检测的影响分析:通过引入文本事件与图像的文本描述能够提高视觉事件提取的总体效果,因此本发明还探究了图像2 2事件、文本事件与图像文本描述三者在不同权重下的模型表现。ME数据集包含两种图像事件类型,一种只有事件的相关图像没有与之匹配的文本事件(OnlyImage),另一种既存在图像事件也有与之直接相关的文本事件(MultimediaImage)。OnlyImage中没有对应的文本事件,因此只分析图像(Image)与图像描述(I2T)不同权重的影响。MultimediaImage则需要分析图像(Image)、文本事件(Text)、图像描述(I2T)三者的影响。将OnlyImage中图像与图像描述的不同占比分为四种情况:仅有图像信息(Image:1.0与I2T:0.0)、图像信息权重大(Image:0.85与I2T:0.15)、图像信息权重较大(Image:0.7与I2T:0.3)、权重均衡(Image:0.5与I2T:0.5)。同理MultimediaImage中图像、文本事件、图像描述不同占比分为以下五种情况:仅有图像信息(Image:1.0;Text:0;I2T:0)、仅有图像信息与文本事件(Image:0.7;Text:0.3;I2T:0)、仅有图像信息与图像描述(Image:0.7;Text:0;I2T:0.3)、图像信息权重较大同时文本事件与图像描述权重。↖mage:0.7;Text:0.15;I2T:0.15)、权重均衡(Image:0.4;Text:0.4;I2T:0.4)。通过将图像事件、文本事件以及相关图像描述分别与活动动词、语义角色进行相关性计算,将获得的相关性得分利用不同权重进行加权求和,最终获得图像事件类型与图像事件论元的检测结果。具体占比情况与结果如表2所示。无论是事件类型还是事件论元检测,当图像事件、文本事件与图像描述占比权重均衡时,都会导致检测性能的下降(如表2中的第5、11、13行数据)。同时MultimediaImage数据缺少文本事件或者图像描述都无法达到检测的最佳性能(如表2的第2、3、7、8行数据)。当OnlyImage数据中不融入图像描述,MultimediaImage数据中三种信息的占比为0.7、0.15、0.15时(如表2中第4行数据),可以达到视觉事件类型检测的最佳性能。而视觉事件论元检测,OnlyImage数据中图像与图像描述占比为0.7与0.3,而MultimediaImage数据中图像、文本与图像描述占比为0.7、0.15、0.15时,可以达到最佳检测性能。最终针对视觉事件类型检测与视觉事件论元检测,使用OnlyImage(Image:1.0与I2T:0.0)与MultimediaImage(Image:0.7;Text:0.15;I2T:0.15)作为参数,可以达到最佳检测结果,两者F1值分别达到58.6与42.9。[0113] 表2图像事件、文本事件与图像描述不同权重对视觉事件类型与视觉事件论元检测的影响[0114][0115] 以上所述仅为本发明的较佳实施例而已,并不用以限制本发明,凡在本发明的精神和原则之内所作的任何修改、等同替换和改进等,均应包含在本发明的保护范围之内。
专利地区:甘肃
专利申请日期:2024-08-30
专利公开日期:2024-11-22
专利公告号:CN118762261B