产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:基于文本内容特征对齐的视频描述方法与系统
专利类型:发明专利
专利申请号:CN202411082674.0
专利申请(专利权)人:江西财经大学
权利人地址:江西省南昌市经济技术开发区双港东大街169号
专利发明(设计)人:姜文晖,官文彬,黎海军,方玉明,冯佳辉,陈俊杰
专利摘要:本发明提出基于文本内容特征对齐的视频描述方法与系统,该方法包括:通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;将视频帧和文本输入到预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;利用文本视频相关性图得到精炼后的时空特征和精炼后的动作特征;基于原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征得到目标描述文本。本发明以文本为条件,结合视频帧来构建文本视频相关性图,并与视频时空特征和视频动作特征进行融合来优化视频表征,以达到视频文本对齐的效果。
主权利要求:
1.一种基于文本内容特征对齐的视频描述方法,其特征在于,所述方法包括如下步骤:步骤1、通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;
步骤2、将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;
步骤3、利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征;
将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合,并将融合结果作为视频表征,对视频表征进行解码操作,得到目标描述文本;
在所述步骤3中,利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征,具体步骤如下:对文本视频相关性图进行归一化操作,得到归一化后的文本视频相关性图,利用归一化后的文本视频相关性图对原始视频时空特征进行时间维度的池化操作,得到精炼后的时空特征,过程存在如下关系式:;
其中, 表示精炼后的视频特征, 表示归一化权重, 表示第 帧的第 块区域的网格特征, 表示第 帧的第 块区域的网格特征与给定文本的相似程度, 表示第 块区域的精炼后的视觉特征;
对文本视频相关性图进行帧级别的平均池化操作,得到池化后的文本视频相关性图,利用池化后的文本视频相关性图对原始视频动作特征进行时间维度的池化操作,得到精炼后的动作特征,过程存在如下关系式:;
其中, 表示精炼后的动作特征, 表示第 帧池化后的权重;
将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合是采用拼接操作实现的,对应的关系式如下:;
其中, 表示视频表征。
2.根据权利要求1所述的一种基于文本内容特征对齐的视频描述方法,其特征在于,在所述步骤1中,通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征,具体步骤如下;
将每个视频均匀采样,利用预训练的视觉编码器提取并得到视觉网格特征,过程存在如下关系式:;
其中, 表示第 帧的视觉网格特征, 表示每一帧网格特征的数量, 表示第 帧中第 块区域的视觉网格特征;
将所有视觉网格特征进行拼接,得到原始视频时空特征,过程存在如下关系式:;
其中, 表示原始视频时空特征, 表示从每个视频均匀采样的帧的数量,且 ;
利用预训练的视觉编码器提取视频每一帧的动作特征,得到原始视频动作特征,过程存在如下关系式:;
其中, 表示第 帧的动作特征, 表示视频帧的序号, 表示原始视频动作特征。
3.根据权利要求2所述的一种基于文本内容特征对齐的视频描述方法,其特征在于,在所述步骤2中,将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图,具体步骤为:大规模预训练视觉语言模型采用GLIPv2模型,通过GLIPv2模型找出与给定文本相关的边界框集合以及计算出对应的置信度分数集合设置置信度阈值,对边界框集合进行过滤,得到过滤后的所有边界框合集,过程存在如下关系式:;
其中, 表示过滤后的第 帧的所有边界框集合, 表示第 帧中第 个边界框,表示边界框的序号, 表示第 帧中边界框的总数;
与过滤后的所有边界框集合相对应的置信度分数集合为:;
其中, 表示与 相对应的置信度分数集合, 表示第 帧中第 个边界框的置信度,且 。
4.根据权利要求3所述的一种基于文本内容特征对齐的视频描述方法,其特征在于,为视频中每一帧构建空白图片,过程存在如下关系式:;
其中, 和 分别表示视频帧的高度和宽度, 表示第 帧的空白图片;
将与过滤后的所有边界框集合相对应的置信度分数集合映射到空白图片上并得到热力图,过程存在如下关系式:;
其中, 表示像素坐标, 表示第 帧的热力图, 表示示性函数,表示平均池化操作;
对热力图进行划分并进行平均池化操作,得到文本视频相关性图,过程存在如下关系式:;
其中, 表示第 帧的文本视频相关性图, 表示视频区域序号, 表示第 帧第块视频区域与给定文本的相似度。
5.根据权利要求4所述的一种基于文本内容特征对齐的视频描述方法,其特征在于,在所述步骤3中,解码操作采用的是Transformer解码器。
6.一种基于文本内容特征对齐的视频描述系统,其特征在于,所述系统应用如上述权利要求1至5任意一项所述的基于文本内容特征对齐的视频描述方法,所述系统包括:特征提取模块,通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;
相关性图构建模块,将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;
描述文本生成模块,利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征;将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合,并将融合结果作为视频表征,对视频表征进行解码操作,得到目标描述文本。 说明书 : 基于文本内容特征对齐的视频描述方法与系统技术领域[0001] 本发明属于计算机视觉与视频处理技术领域,特别涉及基于文本内容特征对齐的视频描述方法与系统。背景技术[0002] 视频描述是一个活跃的研究课题,目标是用自然语言句子描述视频内容。它具有广泛的应用,例如辅助视障人士、视频检索和人机交互。近年来,由于深度学习技术的推进和MSR?VTT、MSVD等大规模数据集的收集,视频字幕技术取得了显著进步。然而,由于视频本身包含各种各样的对象、事件和复杂的场景,注释者很难用一句话全面地描述视频,因此每个视频常常会有多个描述,以减轻注释偏差。为了更准确地理解视频与描述之间的关系,研究人员不断探索先进的模型架构。尽管现有模型取得了进步,但仍面临一个关键问题:即监督是模棱两可的问题,也被称为“一对多”的问题,这归根到底源于视频与字幕对齐不足。[0003] 为了解决这一问题,最新的研究方法试图通过屏蔽与文本相似度较低的视频帧来实现视频文本对齐。但是,这种方法在操作过程中可能会导致大量空间细节的丢失,且主要用于跨模态检索任务,不能直接应用于视频字幕生成任务。[0004] 如上所述,基于视频文本对齐仍缺少可靠的方法,直接影响视频描述的精准性。基于此,有必要提出一种新的方法实现视频文本对齐,提升字幕质量,以解决上述技术问题。发明内容[0005] 鉴于上述状况,本发明的主要目的是为了提出基于文本内容特征对齐的视频描述方法,以解决上述技术问题。[0006] 本发明提供了基于文本内容特征对齐的视频描述方法,所述方法包括如下步骤:[0007] 步骤1、通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;[0008] 步骤2、将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;[0009] 步骤3、利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征;[0010] 将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合,并将融合结果作为视频表征,对视频表征进行解码操作,得到目标描述文本。[0011] 本发明还提出基于文本内容特征对齐的视频描述系统,所述系统包括:[0012] 特征提取模块,通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;[0013] 相关性图构建模块,将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;[0014] 描述文本生成模块,利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征;将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合,并将融合结果作为视频表征,对视频表征进行解码操作,得到目标描述文本。[0015] 与现有技术相比,本发明有益效果如下:[0016] 1、本发明以文本内容为条件,结合视频帧来构建文本视频相关性图,并与视频时空特征和视频动作特征进行融合来优化视频表征,不仅提供多样化的视频表示,还抑制多余或分散注意力的视觉信息和动作信息,实现视频文本对齐,生成目标描述文本。[0017] 2、本发明的附加方面与优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实施例了解到。[0018] 本发明的附加方面与优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实施例了解到。附图说明[0019] 图1为本发明提出的基于文本内容特征对齐的视频描述方法的流程图;[0020] 图2为本发明提出的基于文本内容特征对齐的视频描述系统的总体框架图。具体实施方式[0021] 下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描述的实施例是示例性的,仅用于解释本发明,而不能理解为对本发明的限制。[0022] 参照下面的描述和附图,将清楚本发明的实施例的这些和其他方面。在这些描述和附图中,具体公开了本发明的实施例中的一些特定实施方式,来表示实施本发明的实施例的原理的一些方式,但是应当理解,本发明的实施例的范围不受此限制。[0023] 请参阅图1,本发明实施例提供了基于文本内容特征对齐的视频描述方法,所述方法包括如下步骤:[0024] 步骤1、通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;[0025] 在步骤1中,通过SwinTransformer提取网格对视频进行提取并得到原始视频时空特征和原始视频动作特征,具体步骤如下;[0026] 将每个视频均匀采样,利用预训练的视觉编码器提取并得到视觉网格特征,过程存在如下关系式:[0027] ;[0028] 其中, 表示第 帧的视觉网格特征, 表示每一帧网格特征的数量, 表示第 帧中第 块区域的视觉网格特征;[0029] 将所有视觉网格特征进行拼接,得到原始视频时空特征,过程存在如下关系式:[0030] ;[0031] 其中, 表示原始视频时空特征, 表示从每个视频均匀采样的帧的数量,且;[0032] 利用Text4Vis提取视频每一帧的动作特征,得到原始视频动作特征,过程存在如下关系式:[0033] ;[0034] 其中, 表示第 帧的动作特征, 表示视频帧的序号, 表示原始视频动作特征。[0035] 步骤2、将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;[0036] 在步骤2中,由于视频在时空上与文本描述不一致,为了精准匹配细粒度的图像文本对应关系,首先采用大规模预训练视觉语言模型,找出与给定文本相关的边界框集合并得出相应的置信度分数集合,将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图,具体步骤为:[0037] 大规模预训练视觉语言模型采用GLIPv2模型,通过GLIPv2模型找出与给定文本相关的边界框集合以及计算出对应的置信度分数集合;[0038] 由于大规模预训练视觉语言模型可能会生成低置信度的边界框,意味着这些边界框区域与文本内容匹配程度很低甚至是错误的,应该将其丢弃。因此,设置置信度阈值,对边界框集合进行过滤,得到过滤后的所有边界框合集,过程存在如下关系式:[0039] ;[0040] 其中, 表示过滤后的第 帧的所有边界框集合, 表示第 帧中第 个边界框,表示边界框的序号, 表示第 帧中边界框的总数;[0041] 与过滤后的所有边界框集合相对应的置信度分数集合为:[0042] ;[0043] 其中, 表示与 相对应的置信度分数集合, 表示第 帧中第 个边界框的置信度,且 ;[0044] 在步骤2中,为视频中每一帧构建空白图片,过程存在如下关系式:[0045] ;[0046] 其中, 和 分别表示视频帧的高度和宽度, 表示第 帧的空白图片;[0047] 将与过滤后的所有边界框集合相对应的置信度分数集合映射到空白图片上并得到热力图,过程存在如下关系式:[0048] ;[0049] 其中, 表示像素坐标, 表示第 帧的热力图, 表示示性函数,表示平均池化操作;[0050] 对热力图进行划分并进行平均池化操作,得到文本视频相关性图,过程存在如下关系式:[0051] ;[0052] 其中, 表示第 帧的文本视频相关性图, 表示视频区域序号, 表示第 帧第 块视频区域与给定文本的相似度;[0053] 经过以上步骤,完成了文本视频相关性图的构建,可用于后续视频和文本的细粒度对齐。[0054] 步骤3、利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征;将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合,并将融合结果作为视频表征,对视频表征进行解码操作,得到目标描述文本。[0055] 在步骤3中,利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征,具体步骤如下:[0056] 对文本视频相关性图进行归一化操作,得到归一化后的文本视频相关性图,利用归一化后的文本视频相关性图对原始视频时空特征进行时间维度的池化操作,得到精炼后的时空特征,过程存在如下关系式:[0057] ;[0058] 其中, 表示精炼后的视频特征, 表示归一化权重, 表示第 帧的第 块区域的网格特征, 表示第 帧的第 块区域的网格特征与给定文本的相似程度, 表示第 块区域的精炼后的视觉特征;[0059] 在步骤3中,对文本视频相关性图进行帧级别的平均池化操作,得到池化后的文本视频相关性图,利用池化后的文本视频相关性图对原始视频动作特征进行时间维度的池化操作,得到精炼后的动作特征,过程存在如下关系式:[0060] ;[0061] 其中, 表示精炼后的动作特征, 表示第 帧池化后的权重;[0062] 在步骤3中,为了改善视频文本对齐,根据跨视频帧构建的相关性图,有选择地融合原始视频时空特征和原始视频动作特征来优化视频表征。相关性图中的分数高,表明时空区域与给定标题之间的语义相关性更接近,因此应强调相应的特征,反之亦然,基于原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征得到目标描述文本,具体步骤如下:[0063] 将原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征进行融合是采用拼接操作实现的,对应的关系式如下:[0064] ;[0065] 其中, 表示视频表征;[0066] 将上述得到的视频表征送入Transformer解码器生成目标描述文本。[0067] 请参阅图2,本发明实施例还提供了一种利用NMF的不同活跃度用户长尾推荐系统,所述系统包括:[0068] 特征提取模块,通过预训练的视觉编码器对视频进行提取并得到原始视频时空特征和原始视频动作特征;[0069] 相关性图构建模块,将视频帧和文本输入到大规模预训练视觉语言模型,得到边界框集合和置信度分数集合,基于边界框集合和置信度分数集合构建文本视频相关性图;[0070] 描述文本生成模块,利用文本视频相关性图分别对原始视频时空特征和原始视频动作特征进行时间维度的池化操作,得到精炼后的时空特征和精炼后的动作特征;基于原始视频时空特征、精炼后的时空特征、原始视频动作特征以及精炼后的动作特征得到目标描述文本。[0071] 应当理解的,本发明的各部分可以用硬件、软件、固件或它们的组合来实现。在上述实施方式中,多个步骤或方法可以用存储在存储器中且由合适的指令执行系统执行的软件或固件来实现。例如,如果用硬件来实现,和在另一实施方式中一样,可用本领域公知的下列技术中的任一项或他们的组合来实现:具有用于对数据信号实现逻辑功能的逻辑门电路的离散逻辑电路,具有合适的组合逻辑门电路的专用集成电路,可编程门阵列(PGA),现场可编程门阵列(FPGA)等。[0072] 在本说明书的描述中,参考术语“一个实施例”、“一些实施例”、“示例”、“具体示例”、或“一些示例”等的描述意指结合该实施例或示例描述的具体特征、结构、材料或者特点包含于本发明的至少一个实施例或示例中。在本说明书中,对上述术语的示意性表述不一定指的是相同的实施例或示例。而且,描述的具体特征、结构、材料或者特点可以在任何的一个或多个实施例或示例中以合适的方式结合。[0073] 以上所述实施例仅表达了本发明的几种实施方式,其描述较为具体和详细,但并不能因此而理解为对本发明专利范围的限制。应当指出的是,对于本领域的普通技术人员来说,在不脱离本发明构思的前提下,还可以做出若干变形和改进,这些都属于本发明的保护范围。因此,本发明专利的保护范围应以所附权利要求为准。
专利地区:江西
专利申请日期:2024-08-08
专利公开日期:2024-11-29
专利公告号:CN118628963B