开云优惠体育网页版入口

开云优惠体育网页版入口:基于人工智能的实体链接方法、装置、设备及存储介质

更新时间:2026-09-01
基于人工智能的实体链接方法、装置、设备及存储介质 专利申请类型:实用新型专利;
地区:广东-深圳;
源自:深圳高价值专利检索信息库;

专利名称:基于人工智能的实体链接方法、装置、设备及存储介质

专利类型:实用新型专利

专利申请号:CN202210028874.2

专利申请(专利权)人:平安开云优惠体育网页版入口(深圳)有限公司
权利人地址:广东省深圳市福田区福田街道福安社区益田路5033号平安金融中心23楼

专利发明(设计)人:王健宗,李泽远

专利摘要:本申请涉及人工智能技术领域,揭示了一种基于人工智能的实体链接方法、装置、设备及存储介质,其中方法包括:基于混合实体特征提取模型,根据目标文本和提及实体确定提及实体特征和附加实体特征集;根据附加实体特征集,对知识库的实体描述特征库中与提及实体对应的候选实体描述特征集中的各个候选实体描述特征与提及实体特征得到相似性评分集;根据附加实体特征集、候选实体描述特征集和相似性评分集得到加权评分集;将加权评分集中的最大的加权评分对应的候选实体描述特征作为目标实体描述特征;将提及实体链接至目标实体描述特征对应的实体。通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵及相似性评分,提高实体链接的准确性。

主权利要求:
1.一种基于人工智能的实体链接方法,其特征在于,所述方法包括:获取目标文本和所述目标文本对应的提及实体;
基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷
从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集;
根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;
根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;
将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;
将所述提及实体链接至所述目标实体描述特征对应的实体;
所述基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷牟街,包括:将所述提及实体和所述目标文本进行拼接,得到待分析的文本;
采用所述混合实体特征提取模型,根据所述待分析的文本生成标签序列;
采用所述混合实体特征提取模型,根据所述标签序列生成所述提及实体特征和所述附加实体特征集;
所述采用所述混合实体特征提取模型,根据所述标签序列生成所述提及实体特征和所述附加实体特征集的步骤,包括:获取标志位字符,将所述标志位字符与所述标签序列进行拼接,得到待分析序列;
采用所述混合实体特征提取模型的第二特征提取层,对所述待分析序列进行特征提。
根据所述提及实体,获取所述第二特征提取层输出的数据作为所述提及实体特征;
获取所述第二特征提取层对所述标志位字符输出的数据,得到所述附加实体特征集。
2.根据权利要求1所述的基于人工智能的实体链接方法,其特征在于,所述采用所述混合实体特征提取模型,根据所述待分析的文本生成标签序列的步骤,包括:采用所述混合实体特征提取模型的第一特征提取层,针对所述待分析的文本生成文本特征;
采用所述混合实体特征提取模型的标签标注层,针对所述文本特征生成所述标签序列。
3.根据权利要求1所述的基于人工智能的实体链接方法,其特征在于,所述根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集的步骤,包括:对每个所述候选实体描述特征和文本实体特征数据进行交叉熵计算,得到第一交叉熵集,其中,所述文本实体特征数据包括所述提及实体特征和所述附加实体特征集;
对所述提及实体特征和所述候选实体描述特征集进行交叉熵计算,得到第二交叉熵;
根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行相似性评分计算,得到所述相似性评分集。
4.根据权利要求3所述的基于人工智能的实体链接方法,其特征在于,所述根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行相似性评分计算,得到所述相似性评分集的步骤,包括:获取所述文本实体特征数据对应的实体数量作为第一实体数量;
获取所述候选实体描述特征集中的所述候选实体描述特征的数量作为第二实体数量;
将所述第一实体数量和所述第二实体数量进行相加,得到实体总数量;
将所述第一交叉熵集中的每个第一交叉熵与所述第二交叉熵分别进行相加,得到交叉熵综合值集;
将所述交叉熵综合值集中的每个交叉熵综合值除以所述实体总数量,得到所述相似性评分集。
5.根据权利要求1所述的基于人工智能的实体链接方法,其特征在于,所述根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集的步骤,包括:对每个所述候选实体描述特征和所述附加实体特征集中的每个附加实体特征进行信息熵计算,得到每个所述候选实体描述特征对应的信息熵集;
从所述候选实体描述特征集中获取所述候选实体描述特征作为待分析的实体特征;
将所述待分析的实体特征对应的所述信息熵集进行相加计算,得到所述待分析的实体特征对应的附加评分;
从所述相似性评分集中获取所述待分析的实体特征对应的相似性评分作为待计算的评分;
将所述附加评分和所述待计算的评分进行加权求和,得到所述待分析的实体特征对应的加权评分;
重复执行所述从所述候选实体描述特征集中获取所述候选实体描述特征作为待分析的实体特征的步骤,直至完成所述候选实体描述特征集中的所述候选实体描述特征的获。
将各个所述加权评分作为所述加权评分集。
6.一种基于人工智能的实体链接装置,其特征在于,用于执行权利要求1?5中任意一项所述的方法,所述装置包括:数据获取模块,用于获取目标文本和所述目标文本对应的提及实体;
混合实体特征确定模块,用于基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷
候选实体描述特征集获取模块,用于从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集;
相似性评分集确定模块,用于根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;
加权评分集确定模块,用于根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;
目标实体描述特征确定模块,用于将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;
实体链接模块,用于将所述提及实体链接至所述目标实体描述特征对应的实体。
7.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至5中任一项所述方法的步骤。
8.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至5中任一项所述的方法的步骤。 说明书 : 基于人工智能的实体链接方法、装置、设备及存储介质技术领域[0001] 本申请涉及到人工智能技术领域,特别是涉及到一种基于人工智能的实体链接方法、装置、设备及存储介质。背景技术[0002] 实体链接是将文本中的提及实体链接到知识库的实体。比如,文本“巴黎是国王普里阿摩斯的儿子”,需要将文本中的提及实体“巴黎”链接到知识库中代表希希腊神话中的英雄的“巴黎”,而不是将文本中的提及实体“巴黎”链接到知识库中带包城市的“巴黎”。虽然面向英语的实体链接技术不断发展,但针对中文的实体链接技术仍然滞后。传统的针对中文的实体链接技术,通过设计多种特征来衡量长文本中的提及实体与知识库的实体之间的相似性,通过长文本中丰富的上下文信息辅助实体识别与消歧。传统的针对中文的实体链接技术在处理短文本的提及实体链接到知识库的实体时,因为短文本无法提供丰富的上下文信息,导致无法为消歧提供足够的语义信息,影响了实体链接的准确性。发明内容[0003] 本申请的主要目的为提供一种基于人工智能的实体链接方法、装置、设备及存储介质,旨在解决传统的针对中文的实体链接技术在处理短文本的提及实体链接到知识库的实体时,因为短文本无法提供丰富的上下文信息,导致无法为消歧提供足够的语义信息,影响了实体链接的准确性的技术问题。[0004] 为了实现上述发明目的,本申请提出一种基于人工智能的实体链接方法,所述方法包括:[0005] 获取目标文本和所述目标文本对应的提及实体;[0006] 基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷籟0007] 从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集;[0008] 根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;[0009] 根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;[0010] 将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;[0011] 将所述提及实体链接至所述目标实体描述特征对应的实体。[0012] 进一步的,所述基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷牟街,包括:[0013] 将所述提及实体和所述目标文本进行拼接,得到待分析的文本;[0014] 采用所述混合实体特征提取模型,根据所述待分析的文本生成标签序列;[0015] 采用所述混合实体特征提取模型,根据所述标签序列生成所述提及实体特征和所述附加实体特征集。[0016] 进一步的,所述采用所述混合实体特征提取模型,根据所述待分析的文本生成标签序列的步骤,包括:[0017] 采用所述混合实体特征提取模型的第一特征提取层,针对所述待分析的文本生成文本特征;[0018] 采用所述混合实体特征提取模型的标签标注层,针对所述文本特征生成所述标签序列。[0019] 进一步的,所述采用所述混合实体特征提取模型,根据所述标签序列生成所述提及实体特征和所述附加实体特征集的步骤,包括:[0020] 获取标志位字符,将所述标志位字符与所述标签序列进行拼接,得到待分析序列;[0021] 采用所述混合实体特征提取模型的第二特征提取层,对所述待分析序列进行特征提。籟0022] 根据所述提及实体,获取所述第二特征提取层输出的数据作为所述提及实体特征;[0023] 获取所述第二特征提取层对所述标志位字符输出的数据,得到所述附加实体特征集。[0024] 进一步的,所述根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集的步骤,包括:[0025] 对每个所述候选实体描述特征和文本实体特征数据进行交叉熵计算,得到第一交叉熵集,其中,所述文本实体特征数据包括所述提及实体特征和所述附加实体特征集;[0026] 对所述提及实体特征和所述候选实体描述特征集进行交叉熵计算,得到第二交叉熵;[0027] 根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行相似性评分计算,得到所述相似性评分集。[0028] 进一步的,所述根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行相似性评分计算,得到所述相似性评分集的步骤,包括:[0029] 获取所述文本实体特征数据对应的实体数量作为第一实体数量;[0030] 获取所述候选实体描述特征集中的所述候选实体描述特征的数量作为第二实体数量;[0031] 将所述第一实体数量和所述第二实体数量进行相加,得到实体总数量;[0032] 将所述第一交叉熵集中的每个第一交叉熵与所述第二交叉熵分别进行相加,得到交叉熵综合值集;[0033] 将所述交叉熵综合值集中的每个交叉熵综合值除以所述实体总数量,得到所述相似性评分集。[0034] 进一步的,所述根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集的步骤,包括:[0035] 对每个所述候选实体描述特征和所述附加实体特征集中的每个附加实体特征进行信息熵计算,得到每个所述候选实体描述特征对应的信息熵集;[0036] 从所述候选实体描述特征集中获取所述候选实体描述特征作为待分析的实体特征;[0037] 将所述待分析的实体特征对应的所述信息熵集进行相加计算,得到所述待分析的实体特征对应的附加评分;[0038] 从所述相似性评分集中获取所述待分析的实体特征对应的相似性评分作为待计算的评分;[0039] 将所述附加评分和所述待计算的评分进行加权求和,得到所述待分析的实体特征对应的加权评分;[0040] 重复执行所述从所述候选实体描述特征集中获取所述候选实体描述特征作为待分析的实体特征的步骤,直至完成所述候选实体描述特征集中的所述候选实体描述特征的获。籟0041] 将各个所述加权评分作为所述加权评分集。[0042] 本申请还提出了一种基于人工智能的实体链接装置,所述装置包括:[0043] 数据获取模块,用于获取目标文本和所述目标文本对应的提及实体;[0044] 混合实体特征确定模块,用于基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷籟0045] 候选实体描述特征集获取模块,用于从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集;[0046] 相似性评分集确定模块,用于根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;[0047] 加权评分集确定模块,用于根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;[0048] 目标实体描述特征确定模块,用于将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;[0049] 实体链接模块,用于将所述提及实体链接至所述目标实体描述特征对应的实体。[0050] 本申请还提出了一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现上述任一项所述方法的步骤。[0051] 本申请还提出了一种计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现上述任一项所述的方法的步骤。[0052] 本申请的基于人工智能的实体链接方法、装置、设备及存储介质,其中首先通过基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷,从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集,其次根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集,根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集,然后将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征,最后将所述提及实体链接至所述目标实体描述特征对应的实体,通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵,从而提高了计算得到的相似性评分的准确性,提高了实体链接的准确性;而且根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的相似性评分,进一步提高了实体链接的准确性。附图说明[0053] 图1为本申请一实施例的基于人工智能的实体链接方法的流程示意图;[0054] 图2为本申请一实施例的基于人工智能的实体链接装置的结构示意框图;[0055] 图3为本申请一实施例的计算机设备的结构示意框图。[0056] 本申请目的的实现、功能特点及优点将结合实施例,参照附图做进一步说明。具体实施方式[0057] 为了使本申请的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本申请进行进一步详细说明。应当理解,此处描述的具体实施例仅仅用以解释本申请,并不用于限定本申请。[0058] 参照图1,本申请实施例中提供一种基于人工智能的实体链接方法,所述方法包括:[0059] S1:获取目标文本和所述目标文本对应的提及实体;[0060] S2:基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷籟0061] S3:从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集;[0062] S4:根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;[0063] S5:根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;[0064] S6:将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;[0065] S7:将所述提及实体链接至所述目标实体描述特征对应的实体。[0066] 本实施例首先通过基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷,从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集,其次根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集,根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集,然后将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征,最后将所述提及实体链接至所述目标实体描述特征对应的实体,通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵,从而提高了计算得到的相似性评分的准确性,提高了实体链接的准确性;而且根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的相似性评分,进一步提高了实体链接的准确性。[0067] 对于S1,可以获取用户输入的目标文本和所述目标文本对应的提及实体,也可以从数据库中获取目标文本和所述目标文本对应的提及实体,还可以从第三方应用系统中获取目标文本和所述目标文本对应的提及实体。[0068] 目标文本,可以是长文本、中长文本、短文本中的任一种。长文本的文字数量大于或等于第一阈值,短文本的文字数量小于或等于第二阈值,中长文本的文字数量位于第二阈值与第一阈值之间(不包括第一阈值,也不包括第二阈值)。第一阈值是常量。第二阈值是常量。[0069] 所述目标文本对应的提及实体,是所述目标文本中的需要进行实体链接的实体。[0070] 实体,是对客观个体的抽象,一个人、一部电影、一个城市都可以看做是一个实体。比如,曹雪芹(人名)、卧虎藏龙(电影名)、北京(城市名)都是实体,在此举例不做具体限定。[0071] 对于S2,首先将所述提及实体和所述目标文本进行拼接,然后将拼接得到的文本输入混合实体特征提取模型分别分别进行BIO的标签序列预测、标签序列的特征提取、提及实体特征的获取和附加实体特征集的获取。[0072] BIO,将每个元素标注为“B?X”、“I?X”或者“O”。其中,“B?X”表示此元素所在的片段属于X类型并且此元素在此片段的开头,“I?X”表示此元素所在的片段属于X类型并且此元素在此片段的中间位置,“O”表示不属于任何类型。比如,X类型是实体。[0073] 其中,混合实体特征提取模型是基于Bert(Bidirectional EncoderRepresentationsfromTransformers)模型、LSTM(长短期记忆人工神经网络)和CRF(条件随机场)训练得到的模型。[0074] 提及实体特征,是提及实体经过混合实体特征提取模型进行特征提取得到的特征。[0075] 附加实体特征集,是提及实体在目标文本中关联的实体经过混合实体特征提取模型进行特征提取得到的特征的集合。[0076] 比如,目标文本是“巴黎是国王普里阿摩斯的儿子”,其中,提及实体是巴黎,提及实体在目标文本中关联的实体包括:国王、普里阿摩斯、儿子,附加实体特征集中包括三个附加实体特征,三个附加实体特征分别是:实体“国王”对应的特征、实体“普里阿摩斯”对应的特征、实体“儿子”对应的特征,在此举例不做具体限定。[0077] 对于S3,知识库中包括一条或多条词条信息。词条信息包括:实体、多个分类、每个分类的描述文本。比如,词条信息的实体为“胜利”,词条信息的分类包括:摘要、制作方、外文名、义项描述,分类“摘要”的描述文本为“联盟S的胜利系列皮肤是公司五制作的具有纪念意义限定系列皮肤之一”,分类“制作方”的描述文本为“公司五”,分类“外文名”的描述文本为“Victorious”,分类“义项描述”的描述文本为“游戏《联盟S》胜利系列皮肤”,在此举例不做具体限定。[0078] 实体描述特征库,是采用Bert模型根据知识库中的各个词条信息得到的特征库。实体描述特征库包括:词条信息标识、实体和实体描述特征。实体描述特征,是采用Bert模型对待提取的实体(也就是词条信息的实体)及所述待提取的实体对应的各个分类的描述文本进行特征提。袢ert模型针对所述待提取的实体输出的特征。词条信息标识可以是词条信息ID,用于唯一标识一条词条信息。[0079] 可选的,实体描述特征,是词条信息的实体的特征。[0080] 可选的,实体描述特征,是将词条信息的各个分类的描述文本作为上下文时提取的词条信息的实体的特征。比如,将词条信息的实体和词条信息的各个分类的描述文本进行拼接,将拼接文本输入Bert模型,获取Bert模型针对词条信息的实体输出的特征数据。[0081] 其中,采用名称词典匹配技术,根据所述提及实体,从知识库的实体描述特征库的各个实体中获取实体,将获取的实体对应的每个实体描述特征作为一个候选实体描述特征,将所有候选实体描述特征作为候选实体描述特征。[0082] 对于S4,首先计算每个候选实体描述特征与文本实体特征数据之前的交叉熵,然后计算提及实体特征与所述候选实体描述特征集之间的交叉熵,最后根据计算得到的交叉熵,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征之间进行混合交叉熵计算,将计算得到的每个混合交叉熵作为一个相似性评分,将各个相似性评分作为相似性评分集;其中,所述文本实体特征数据包括:所述附加实体特征集和所述提及实体特征。也就是说,相似性评分是候选实体描述特征与所述提及实体特征之间的混合交叉熵。[0083] 对于S5,首先对每个候选实体描述特征和所述附加实体特征集中的每个附加实体特征进行信息熵计算,然后根据计算得到的信息熵,对每个候选实体描述特征进行附加评分计算,最后将附加评分和相似性评分进行加权计算得到加权评分,将各个加权评分作为所述加权评分集。也就是说,加权评分中表述了附加评分和相似性评分的综合数值。从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的最终评分(也就是加权评分),从而有利于选择相似性最大的候选实体描述特征对应的实体作为所述目标文本对应的提及实体的链接目标,进一步提高了实体链接的准确性。[0084] 对于S6,从所述加权评分集找出最大的加权评分作为目标评分,将目标评分对应的所述候选实体描述特征作为目标实体描述特征,从而找出了与文本实体特征数据(也就是提及实体特征和附加实体特征集)的相似性最大的候选实体描述特征。[0085] 对于S7,将所述目标实体描述特征对应的词条信息标识作为目标词条信息标识,将所述目标文本对应的提及实体链接至知识库中的与目标词条信息标识对应的词条信息的实体。[0086] 在一个实施例中,上述基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷牟街,包括:[0087] S21:将所述提及实体和所述目标文本进行拼接,得到待分析的文本;[0088] S22:采用所述混合实体特征提取模型,根据所述待分析的文本生成标签序列;[0089] S23:采用所述混合实体特征提取模型,根据所述标签序列生成所述提及实体特征和所述附加实体特征集。[0090] 本实施例通过首先将所述提及实体和所述目标文本进行拼接,然后采用混合实体特征提取模型进行混合实体特征提。佣崛〕隽颂峒笆堤逄卣骱透郊邮堤逄卣骷,为通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵提供了支持。[0091] 对于S21,将所述提及实体和所述目标文本进行依次拼接,将拼接得到的文本作为待分析的文本。[0092] 对于S22,采用所述混合实体特征提取模型,根据所述待分析的文本分别进行特征提取和BIO标签标注,将标签标注得到的数据作为标签序列。[0093] 对于S23,采用所述混合实体特征提取模型,对所述标签序列进行特征提。犹崛〉奶卣髦谢袢∷鎏峒笆堤逄卣骱退龈郊邮堤逄卣骷。[0094] 在一个实施例中,上述采用所述混合实体特征提取模型,根据所述待分析的文本生成标签序列的步骤,包括:[0095] S221:采用所述混合实体特征提取模型的第一特征提取层,针对所述待分析的文本生成文本特征;[0096] S222:采用所述混合实体特征提取模型的标签标注层,针对所述文本特征生成所述标签序列。[0097] 本实施例通过先采用第一特征提取层针对所述待分析的文本进行特征提。缓蟛捎帽昵┍曜⒉愀萏崛〉奶卣鹘斜昵┍曜,从而有效地捕捉了所述待分析的文本中的上下文和语义信息,为提取出准确的附加实体特征集提供了支持。[0098] 对于S221,将所述待分析的文本输入第一特征提取层,获取第一特征提取层输出的数据作为文本特征。[0099] 可选的,所述第一特征提取层包括:输入层和特征提取层,其中,特征提取层采用Bert模型。[0100] 对于S222,将所述文本特征输入标签标注层进行BIO标签的标注,将标注得到的数据作为所述标签序列。[0101] 可选的,所述标签标注层依次包括:LSTM层和CRF层。其中,LSTM层用于利用文本的潜在特征生成提及实体与附加实体的特征的表示。[0102] 可以理解的是,在进行BIO标签的标注时,对于[CLS]、[SEP]用标签TAG进行标注。[0103] 在一个实施例中,上述采用所述混合实体特征提取模型,根据所述标签序列生成所述提及实体特征和所述附加实体特征集的步骤,包括:[0104] S231:获取标志位字符,将所述标志位字符与所述标签序列进行拼接,得到待分析序列;[0105] S232:采用所述混合实体特征提取模型的第二特征提取层,对所述待分析序列进行特征提。籟0106] S233:根据所述提及实体,获取所述第二特征提取层输出的数据作为所述提及实体特征;[0107] S234:获取所述第二特征提取层对所述标志位字符输出的数据,得到所述附加实体特征集。[0108] 因为第一特征提取层和标签标注层没有对实体边界的识别,本实施例采用先添加标志位字符,然后采用第二特征提取层对待分析序列进行特征提取以获取更有信息熵的实体,从而为提及实体对应的附加实体给予更多的权重分配,提高了附加实体特征集的准确性。[0109] 对于S231,将所述标志位字符与所述标签序列进行依次拼接,得到待分析序列。也就是说,所述标志位字符位于所述待分析序列的开头。[0110] 可选的,标志位字符设置为CLS。[0111] 对于S232,将所述待分析序列输入所述混合实体特征提取模型的第二特征提取层进行特征提取。[0112] 可选的,所述第二特征提取层采用采用Bert模型。[0113] 对于S233,获取所述第二特征提取层针对所述提及实体输出的数据作为所述提及实体特征。[0114] 对于S234,所述第二特征提取层在所述标志位字符对应的位置,对提及实体特征和各个附加实体特征进行连接,可以从所述第二特征提取层针对所述标志位字符对应的位置输出的特征中获取附加实体特征集。[0115] 在一个实施例中,上述根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集的步骤,包括:[0116] S41:对每个所述候选实体描述特征和文本实体特征数据进行交叉熵计算,得到第一交叉熵集,其中,所述文本实体特征数据包括所述提及实体特征和所述附加实体特征集;[0117] S42:对所述提及实体特征和所述候选实体描述特征集进行交叉熵计算,得到第二交叉熵;[0118] S43:根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行相似性评分计算,得到所述相似性评分集。[0119] 本实施例首先计算每个候选实体描述特征与文本实体特征数据之前的交叉熵,然后计算提及实体特征与所述候选实体描述特征集之间的交叉熵,最后根据计算得到的交叉熵,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行混合交叉熵计算,将计算的混合交叉熵作为相似性评分,从而使得到的相似性评分更符合实际情况,提高了计算得到的相似性评分的准确性,提高了实体链接的准确性。[0120] 对于S41,采用交叉熵函数,对每个所述候选实体描述特征和文本实体特征数据进行交叉熵计算,也就是计算所述候选实体描述特征和文本实体特征数据之间的交叉熵,将计算得到的每个交叉熵作为一个第一交叉熵,将所有第一交叉熵作为第一交叉熵集。[0121] 对于S42,采用交叉熵函数,对所述提及实体特征和所述候选实体描述特征集进行交叉熵计算,也就是计算所述提及实体特征和所述候选实体描述特征集之间的交叉熵,将计算得到的交叉熵作为第二交叉熵。[0122] 对于S43,根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行混合交叉熵计算,将计算得到的每个混合交叉熵作为一个相似性评分,将所有相似性评分作为所述相似性评分集。[0123] 在一个实施例中,上述根据所述第一交叉熵集和所述第二交叉熵,针对每个所述候选实体描述特征与所述提及实体特征进行相似性评分计算,得到所述相似性评分集的步骤,包括:[0124] S431:获取所述文本实体特征数据对应的实体数量作为第一实体数量;[0125] S432:获取所述候选实体描述特征集中的所述候选实体描述特征的数量作为第二实体数量;[0126] S433:将所述第一实体数量和所述第二实体数量进行相加,得到实体总数量;[0127] S434:将所述第一交叉熵集中的每个第一交叉熵与所述第二交叉熵分别进行相加,得到交叉熵综合值集;[0128] S435:将所述交叉熵综合值集中的每个交叉熵综合值除以所述实体总数量,得到所述相似性评分集。[0129] 本实施例根据计算得到的交叉熵,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行混合交叉熵计算,将计算的混合交叉熵作为相似性评分,从而使得到的相似性评分更符合实际情况,提高了计算得到的相似性评分的准确性,提高了实体链接的准确性。[0130] 对于S431,计算所述文本实体特征数据对应的实体的总数量,作为第一实体数量。可以理解的是,所述提及实体特征和所述附加实体特征集中每个实体特征(也就是提及实体特征、附加实体特征)对应一个实体。[0131] 对于S433,将所述第一实体数量和所述第二实体数量进行相加,将相加得到的数据作为实体总数量。[0132] 对于S434,将第一交叉熵与所述第二交叉熵进行相加,将相加得到的数据作为交叉熵综合值。[0133] 对于S435,将交叉熵综合值除以所述实体总数量得到混合交叉熵,将计算得到的每个混合交叉熵作为一个相似性评分,将所有相似性评分作为所述相似性评分集。[0134] 在一个实施例中,上述根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集的步骤,包括:[0135] S51:对每个所述候选实体描述特征和所述附加实体特征集中的每个附加实体特征进行信息熵计算,得到每个所述候选实体描述特征对应的信息熵集;[0136] S52:从所述候选实体描述特征集中获取所述候选实体描述特征作为待分析的实体特征;[0137] S53:将所述待分析的实体特征对应的所述信息熵集进行相加计算,得到所述待分析的实体特征对应的附加评分;[0138] S54:从所述相似性评分集中获取所述待分析的实体特征对应的相似性评分作为待计算的评分;[0139] S55:将所述附加评分和所述待计算的评分进行加权求和,得到所述待分析的实体特征对应的加权评分;[0140] S56:重复执行所述从所述候选实体描述特征集中获取所述候选实体描述特征作为待分析的实体特征的步骤,直至完成所述候选实体描述特征集中的所述候选实体描述特征的获。籟0141] S57:将各个所述加权评分作为所述加权评分集。[0142] 本实施例首先对每个候选实体描述特征和所述附加实体特征集中的每个附加实体特征进行信息熵计算,然后根据计算得到的信息熵,对每个候选实体描述特征进行附加评分计算,最后将附加评分和相似性评分进行加权计算得到加权评分,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的最终评分,从而有利于选择相似性最大的候选实体描述特征对应的实体作为所述目标文本对应的提及实体的链接目标,进一步提高了实体链接的准确性。[0143] 对于S51,采用信息熵函数,对所述候选实体描述特征和所述附加实体特征集中的每个附加实体特征之间进行信息熵计算,得到所述候选实体描述特征对应的信息熵集。也就是说,信息熵集中的每个信息熵表述的是一个所述候选实体描述特征和一个所述附加实体特征的数据。[0144] 对于S52,依次从所述候选实体描述特征集中获取所述候选实体描述特征,将获取的所述候选实体描述特征作为待分析的实体特征。[0145] 对于S53,将所述待分析的实体特征对应的所述信息熵集中的各个信息熵进行相加计算,将相加得到的数据作为所述待分析的实体特征对应的附加评分。[0146] 对于S55,采用预设的加权规则,将所述附加评分和所述待计算的评分进行加权求和,将加权求和得到的数据作为所述待分析的实体特征对应的加权评分,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的最终评分,减小了不同属性的候选实体描述特征的最终评分,从而有利于选择相似性最大的候选实体描述特征对应的实体作为所述目标文本对应的提及实体的链接目标。[0147] 可以理解的是,每个所述候选实体描述特征对应一个加权评分。[0148] 对于S56,重复执行步骤S52至S56,直至完成所述候选实体描述特征集中的所述候选实体描述特征的获取。[0149] 参照图2,本申请还提出了一种基于人工智能的实体链接装置,所述装置包括:[0150] 数据获取模块100,用于获取目标文本和所述目标文本对应的提及实体;[0151] 混合实体特征确定模块200,用于基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷籟0152] 候选实体描述特征集获取模块300,用于从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集;[0153] 相似性评分集确定模块400,用于根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;[0154] 加权评分集确定模块500,用于根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;[0155] 目标实体描述特征确定模块600,用于将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;[0156] 实体链接模块700,用于将所述提及实体链接至所述目标实体描述特征对应的实体。[0157] 本实施例首先通过基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷,从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集,其次根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集,根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集,然后将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征,最后将所述提及实体链接至所述目标实体描述特征对应的实体,通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵,从而提高了计算得到的相似性评分的准确性,提高了实体链接的准确性;而且根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的相似性评分,进一步提高了实体链接的准确性。[0158] 参照图3,本申请实施例中还提供一种计算机设备,该计算机设备可以是服务器,其内部结构可以如图3所示。该计算机设备包括通过系统总线连接的处理器、存储器、网络接口和数据库。其中,该计算机设计的处理器用于提供计算和控制能力。该计算机设备的存储器包括非易失性存储介质、内存储器。该非易失性存储介质存储有操作系统、计算机程序和数据库。该内存器为非易失性存储介质中的操作系统和计算机程序的运行提供环境。该计算机设备的数据库用于储存基于人工智能的实体链接方法等数据。该计算机设备的网络接口用于与外部的终端通过网络连接通信。该计算机程序被处理器执行时以实现一种基于人工智能的实体链接方法。所述基于人工智能的实体链接方法,包括:获取目标文本和所述目标文本对应的提及实体;基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷淮又犊獾氖堤迕枋鎏卣骺庵谢袢∮胨鎏峒笆堤宥杂Φ暮蜓∈堤迕枋鎏卣骷桓菟龈郊邮堤逄卣骷,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;将所述提及实体链接至所述目标实体描述特征对应的实体。[0159] 本实施例首先通过基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷,从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集,其次根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集,根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集,然后将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征,最后将所述提及实体链接至所述目标实体描述特征对应的实体,通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵,从而提高了计算得到的相似性评分的准确性,提高了实体链接的准确性;而且根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的相似性评分,进一步提高了实体链接的准确性。[0160] 本申请一实施例还提供一种计算机可读存储介质,其上存储有计算机程序,计算机程序被处理器执行时实现一种基于人工智能的实体链接方法,包括步骤:获取目标文本和所述目标文本对应的提及实体;基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷淮又犊獾氖堤迕枋鎏卣骺庵谢袢∮胨鎏峒笆堤宥杂Φ暮蜓∈堤迕枋鎏卣骷桓菟龈郊邮堤逄卣骷,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集;根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集;将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征;将所述提及实体链接至所述目标实体描述特征对应的实体。[0161] 上述执行的基于人工智能的实体链接方法,本实施例首先通过基于混合实体特征提取模型,根据所述目标文本和所述提及实体进行混合实体特征提。范ㄌ峒笆堤逄卣骱透郊邮堤逄卣骷,从知识库的实体描述特征库中获取与所述提及实体对应的候选实体描述特征集,其次根据所述附加实体特征集,对所述候选实体描述特征集中的各个候选实体描述特征与所述提及实体特征进行相似性评分计算,得到相似性评分集,根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,得到加权评分集,然后将所述加权评分集中的最大的加权评分对应的所述候选实体描述特征作为目标实体描述特征,最后将所述提及实体链接至所述目标实体描述特征对应的实体,通过附加实体特征集增大了相同属性的候选实体描述特征的信息熵,从而提高了计算得到的相似性评分的准确性,提高了实体链接的准确性;而且根据所述附加实体特征集、所述候选实体描述特征集和所述相似性评分集进行加权评分计算,从而实现了通过附加实体特征集增大了相同属性的候选实体描述特征的相似性评分,进一步提高了实体链接的准确性。[0162] 本领域普通技术人员可以理解实现上述实施例方法中的全部或部分流程,是可以通过计算机程序来指令相关的硬件来完成,所述的计算机程序可存储于一非易失性计算机可读取存储介质中,该计算机程序在执行时,可包括如上述各方法的实施例的流程。其中,本申请所提供的和实施例中所使用的对存储器、存储、数据库或其它介质的任何引用,均可包括非易失性和/或易失性存储器。非易失性存储器可以包括只读存储器(ROM)、可编程ROM(PROM)、电可编程ROM(EPROM)、电可擦除可编程ROM(EEPROM)或闪存。易失性存储器可包括随机存取存储器(RAM)或者外部高速缓冲存储器。作为说明而非局限,RAM以多种形式可得,诸如静态RAM(SRAM)、动态RAM(DRAM)、同步DRAM(SDRAM)、双速据率SDRAM(SSRSDRAM)、增强型SDRAM(ESDRAM)、同步链路(Synchlink)DRAM(SLDRAM)、存储器总线(Rambus)直接RAM(RDRAM)、直接存储器总线动态RAM(DRDRAM)、以及存储器总线动态RAM(RDRAM)等。[0163] 需要说明的是,在本文中,术语“包括”、“包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、装置、物品或者方法不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、装置、物品或者方法所固有的要素。在没有更多限制的情况下,由语句“包括一个……”限定的要素,并不排除在包括该要素的过程、装置、物品或者方法中还存在另外的相同要素。[0164] 以上所述仅为本申请的优选实施例,并非因此限制本申请的专利范围,凡是利用本申请说明书及附图内容所作的等效结构或等效流程变换,或直接或间接运用在其他相关的技术领域,均同理包括在本申请的专利保护范围内。

专利地区:广东

专利申请日期:2022-01-11

专利公开日期:2024-11-29

专利公告号:CN114386420B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载