开云优惠体育网页版入口

开云优惠体育网页版入口:词条搜索方法及装置、存储介质及计算机设备

更新时间:2026-09-01
词条搜索方法及装置、存储介质及计算机设备 专利申请类型:实用新型专利;
源自:北京高价值专利检索信息库;

专利名称:词条搜索方法及装置、存储介质及计算机设备

专利类型:实用新型专利

专利申请号:CN202210036469.5

专利申请(专利权)人:北京华通人商用信息有限公司
权利人地址:北京市丰台区南四环西路188号一区31号楼1层101-5

专利发明(设计)人:曾曲,王卓飞,蒋兴荣,白欢朋

专利摘要:本申请公开了一种词条搜索方法及装置、存储介质和计算机设备。方法包括:根据待搜索词条的长度,将待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个分词的权重值;将分词排序,分别确定每个分词的位置;获取待搜索文本,在待搜索文本中查找分词,得到目标分词;在多个权重值中确定目标分词对应的目标权重值,在多个位置中确定目标分词对应的目标位置,并根据目标权重值以及目标位置,确定词条的词条权重值和词条位置值;根据词条权重值以及词条位置值,确定待搜索文本与待搜索词条的相似度,并根据相似度确定搜索结果。本申请的方法,解决了现有方法搜索得到的词条词序与统计指标不符的问题,提高了搜索准确度。

主权利要求:
1.一种词条搜索方法,其特征在于,所述方法包括:
根据待搜索词条的长度,将所述待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个所述分词的权重值,其中,所述待搜索词条的层次总数与所述长度正相关,每个所述分词的权重值与所述分词的层次正相关;
将所述分词排序,分别确定每个所述分词的位置;其中,所述分词的位置包括所述分词在所述待搜索词条中的位置;
获取待搜索文本,在所述待搜索文本中查找所述分词,得到目标分词;
将所述目标分词对应的权重值作为目标权重值,并将所述目标分词的位置作为目标位置;并根据所述目标权重值确定所述待搜索词条的词条权重值,以及根据所述目标位置确定所述待搜索词条的词条位置值;
根据所述词条权重值以及所述词条位置值,确定所述待搜索文本与所述待搜索词条的相似度,并根据所述相似度确定搜索结果;
所述根据所述目标位置确定所述待搜索词条的词条位置值,包括:根据 计算所述待搜索词条的词条位置值,其中,k表示目标分词的数量; 为第i个目标分词的位置Pi与该目标分词在待搜索文本中的位置Pi′之间的距离; len(S)为待搜索词条S的长度,len(SE)为待搜索文本SE的长度。
2.根据权利要求1所述的词条搜索方法,其特征在于,所述将所述待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,具体包括:获取所述层次总数N,其中N为正整数;
将所述待搜索词条划分为多个与第一层对应的第一层分词;
将每个与第m?1层对应的第m?1分词划分成多个与第m层对应的第m分词,其中,所述m为大于1且不大于N的整数。
3.根据权利要求2所述的词条搜索方法,其特征在于,所述确定每个所述分词的权重值,具体包括:根据所述第一层分词的数量确定每个所述第一层分词对应的第一权重值;
根据每个所述第m层分词的长度、所述第m层分词对应的第m?1层分词的长度以及所述第m层分词对应的第m?1层分词的第m?1权重,确定所述第m层分词对应的第m权重。
4.根据权利要求2或3所述的词条搜索方法,其特征在于,所述将所述分词排序,具体包括:根据每个所述第一层分词在所述待搜索词条中的位置,确定所述第一层分词的顺序;
确定每个第m?1层分词对应的第m层分词,分别得到与每个所述第m?1层分词对应的第m层分词组;
根据所述第m层分词组内每个第m层分词在对应的第m?1层分词中的位置,确定所述第m层分词组内的第m层分词的顺序,并将所述第m层分词按顺序置于所述对应的第m?1分词后。
5.根据权利要求1所述的词条搜索方法,其特征在于,所述根据所述目标位置确定所述待搜索词条的词条位置值,具体包括:根据所述目标位置、每个所述目标分词在所述待搜索词条中的位置、所述待搜索词条的长度以及所述待搜索文本的长度,确定所述词条位置值。
6.根据权利要求2所述的词条搜索方法,其特征在于,所述在所述待搜索文本中查找所述分词,得到目标分词,具体包括:在所述待搜索文本中查找所述分词,并将查找到的所有分词作为备选分词集合;
若所述备选分词集合中包含一个第m?1层目标分词以及与所述第m?1层目标分词对应的所有第m层目标分词,则将所述与所述第m?1层目标分词对应的所有第m层目标分词从所述备选分词集合中移除,得到目标分词集合;
将所述目标分词集合中的每个分词作为所述目标分词。
7.根据权利要求6所述的词条搜索方法,其特征在于,所述根据所述目标位置确定所述待搜索词条的词条位置值,具体包括:若所述目标分词集合中包含一个第m?1层目标分词以及与所述第m?1层目标分词对应的至少一个第m层目标分词,则将所述与所述第m?1层目标分词对应的至少一个第m层目标分词从所述目标分词集合中移除;
将所述目标分词集合中剩余的每个目标分词的目标权重值累加,得到所述词条权重值。
8.一种词条的词条搜索装置,其特征在于,所述装置包括:分层模块,用于根据待搜索词条的长度,将所述待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个所述分词的权重值,其中,所述待搜索词条的层次总数与所述长度正相关,每个所述分词的权重值与所述分词的层次正相关;
定位模块,用于将所述分词排序,分别确定每个所述分词的位置;其中,所述分词的位置包括所述分词在所述待搜索词条中的位置;
搜索模块,用于获取待搜索文本,在所述待搜索文本中查找所述分词,得到目标分词;
计算模块,用于将所述目标分词对应的权重值作为目标权重值,并将所述目标分词的位置作为目标位置;并根据所述目标权重值确定所述待搜索词条的词条权重值,以及根据所述目标位置确定所述待搜索词条的词条位置值;
所述计算模块,还用于根据所述词条权重值以及所述词条位置值,确定所述待搜索文本与所述待搜索词条的相似度,并根据所述相似度确定搜索结果;
所述计算模块还用于:
根据 计算所述待搜索词条的词条位置值,其中,k表示目标分词的数量; 为第i个目标分词的位置Pi与该目标分词在待搜索文本中的位置Pi′之间的距离; len(S)为待搜索词条S的长度,len(SE)为待搜索文本SE的长度。
9.一种可读存储介质,其上存储有程序或指令,其特征在于,所述程序或指令被处理器执行时实现如权利要求1至7中任一项所述的词条搜索方法的步骤。
10.一种计算机设备,包括存储介质、处理器及存储在存储介质上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现权利要求1至7中任一项所述的词条搜索方法。 说明书 : 词条搜索方法及装置、存储介质及计算机设备技术领域[0001] 本申请涉及基于短语词组的科学名词垂直搜索引擎领域,尤其是涉及到一种词条搜索方法及装置、存储介质和计算机设备。背景技术[0002] 统计指标的搜索对象是统计指标的名称,其特征是每一个指标名称均是一个具有极强专业性的科学名词,由若干定语和主体构成,是一个词组而非自然语义样本。例如,“北京向山东投资总额”和“山东向北京投资总额”两个指标,“山东”和“北京”两个词的词序就非常重要。而现有的针对统计指标的搜索方法只能搜索关键词,搜索得到的词条的词序往往与统计指标不符,导致搜索准确度较低。发明内容[0003] 有鉴于此,本申请提供了一种词条搜索方法及装置、存储介质和计算机设备,可以基于语序搜索词条,提高了搜索准确度。[0004] 根据本申请的一个方面,提供了一种词条搜索方法,包括:[0005] 根据待搜索词条的长度,将所述待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个所述分词的权重值,其中,所述待搜索词条的层次总数与所述长度正相关,每个所述分词的权重值与所述分词的层次正相关;[0006] 将所述分词排序,分别确定每个所述分词的位置;[0007] 获取待搜索文本,在所述待搜索文本中查找所述分词,得到目标分词;[0008] 在多个所述权重值中确定所述目标分词对应的目标权重值,在多个所述位置中确定所述目标分词对应的目标位置,并根据所述目标分词的目标权重值以及所述目标分词的目标位置,确定所述待搜索词条的词条权重值和词条位置值;[0009] 根据所述词条权重值以及所述词条位置值,确定所述待搜索文本与所述待搜索词条的相似度,并根据所述相似度确定搜索结果。[0010] 可选地,所述将待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,具体包括:[0011] 获取所述层次总数N,其中N为正整数;[0012] 将所述待搜索词条划分为多个与第一层对应的第一层分词;[0013] 将每个与所述第m?1层对应的第m?1分词划分成多个与第m层对应的第m分词,其中,所述m为大于1且不大于N的整数。[0014] 可选地,所述确定每个所述分词的权重值,具体包括:[0015] 根据所述第一层分词的数量确定每个所述第一层分词对应的第一权重值;[0016] 根据每个所述第m层分词的长度、所述第m层分词对应的第m?1层分词的长度以及所述第m层分词对应的第m?1层分词的第m?1权重,确定所述第m层分词对应的第m权重。[0017] 可选地,所述将所述分词排序,具体包括:[0018] 根据每个所述第一层分词在所述待搜索词条中的位置,确定所述第一层分词的顺序;[0019] 确定每个第m?1层分词对应的第m层分词,分别得到与每个所述第m?1层分词对应的第m层分词组;[0020] 根据所述第m层分词组内每个第m层分词在对应的第m?1层分词中的位置,确定所述第m层分词组内的第m层分词的顺序,并将所述第m层分词按顺序置于所述对应的第m?1分词后。[0021] 可选地,所述根据所述目标分词的目标权重值以及所述目标分词的目标位置,确定所述待搜索词条的词条权重值和词条位置值,具体包括:[0022] 根据所述目标位置、每个所述目标分词在所述待搜索词条中的位置、所述待搜索词条的长度以及所述待搜索文本的长度,确定所述词条位置值。[0023] 可选地,所述在所述待搜索文本中查找所述分词,得到目标分词,具体包括:[0024] 在所述待搜索文本中查找所述分词,并将查找到的所有分词作为备选分词集合;[0025] 若所述备选分词集合中包含一个第m?1层目标分词以及与所述第m?1层目标分词对应的所有第m层目标分词,则将所述与所述第m?1层目标分词对应的所有第m层目标分词从所述备选分词集合中移除,得到目标分词集合;[0026] 将所述目标分词集合中的每个分词作为所述目标分词。[0027] 可选地,所述根据所述目标分词的目标权重值以及所述目标分词的目标位置,确定所述待搜索词条的词条权重值和词条位置值,具体包括:[0028] 若所述目标分词集合中包含一个第m?1层目标分词以及与所述第m?1层目标分词对应的至少一个第m层目标分词,则将所述与所述第m?1层目标分词对应的至少一个第m层目标分词从所述目标分词集合中移除;[0029] 将所述目标分词集合中剩余的每个目标分词的目标权重值累加,得到所述词条权重值。[0030] 根据本申请的另一方面,提供了一种词条搜索装置,包括:[0031] 分层模块,用于根据待搜索词条的长度,将所述待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个所述分词的权重值,其中,所述待搜索词条的层次总数与所述长度正相关,每个所述分词的权重值与所述分词的层次正相关;[0032] 定位模块,用于将所述分词排序,分别确定每个所述分词的位置;[0033] 搜索模块,用于获取待搜索文本,在所述待搜索文本中查找所述分词,得到目标分词;[0034] 计算模块,用于在多个所述权重值中确定所述目标分词对应的目标权重值,在多个所述位置中确定所述目标分词对应的目标位置,并根据所述目标权重值以及所述目标位置,确定所述待搜索词条的词条权重值和词条位置值;[0035] 所述计算模块,还用于根据所述词条权重值以及所述词条位置值,确定所述待搜索文本与所述待搜索词条的相似度,并根据所述相似度确定搜索结果。[0036] 可选地,所述分层模块包括划分单元。所述划分单元,具体用于:[0037] 获取所述层次总数N,其中N为正整数;[0038] 将所述待搜索词条划分为多个与第一层对应的第一层分词;[0039] 将每个与所述第m?1层对应的第m?1分词划分成多个与第m层对应的第m分词,其中,所述m为大于1且不大于N的整数。[0040] 可选地,所述分层模块还包括权重计算单元。所述权重计算单元,具体用于:[0041] 根据所述第一层分词的数量确定每个所述第一层分词对应的第一权重值;[0042] 根据每个所述第m层分词的长度、所述第m层分词对应的第m?1层分词的长度以及所述第m层分词对应的第m?1层分词的第m?1权重,确定所述第m层分词对应的第m权重。[0043] 可选地,所述定位模块具体用于:[0044] 根据每个所述第一层分词在所述待搜索词条中的位置,确定所述第一层分词的顺序;[0045] 确定每个第m?1层分词对应的第m层分词,分别得到与每个所述第m?1层分词对应的第m层分词组;[0046] 根据所述第m层分词组内每个第m层分词在对应的第m?1层分词中的位置,确定所述第m层分词组内的第m层分词的顺序,并将所述第m层分词按顺序置于所述对应的第m?1分词后。[0047] 可选地,所述计算模块具体用于:[0048] 根据所述目标位置、每个所述目标分词在所述待搜索词条中的位置、所述待搜索词条的长度以及所述待搜索文本的长度,确定所述词条位置值。[0049] 可选地,所述搜索模块具体用于:[0050] 在所述待搜索文本中查找所述分词,并将查找到的所有分词作为备选分词集合;[0051] 若所述备选分词集合中包含一个第m?1层目标分词以及与所述第m?1层目标分词对应的所有第m层目标分词,则将所述与所述第m?1层目标分词对应的所有第m层目标分词从所述备选分词集合中移除,得到目标分词集合;[0052] 将所述目标分词集合中的每个分词作为所述目标分词。[0053] 可选地,所述计算模块具体用于:[0054] 若所述目标分词集合中包含一个第m?1层目标分词以及与所述第m?1层目标分词对应的至少一个第m层目标分词,则将所述与所述第m?1层目标分词对应的至少一个第m层目标分词从所述目标分词集合中移除;[0055] 将所述目标分词集合中剩余的每个目标分词的目标权重值累加,得到所述词条权重值。[0056] 根据本申请又一个方面,提供了一种存储介质,其上存储有计算机程序,所述程序被处理器执行时实现上述词条搜索方法。[0057] 根据本申请再一个方面,提供了一种计算机设备,包括存储介质、处理器及存储在存储介质上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现上述词条搜索方法。[0058] 借由上述技术方案,本申请将词条划分为多个分词,并根据查找到的每个目标分词的目标权重以及目标位置,确定词条的词条权重值以及词条位置值,并根据词条权重值以及词条位置值确定搜索结果。本申请同时考虑了词条中每个分词的文本相似程度以及顺序相似程度,有效解决了现有的搜索方法无法判断词序的问题,提高了词条搜索的准确度。[0059] 上述说明仅是本申请技术方案的概述,为了能够更清楚了解本申请的技术手段,而可依照说明书的内容予以实施,并且为了让本申请的上述和其它目的、特征和优点能够更明显易懂,以下特举本申请的具体实施方式。附图说明[0060] 此处所说明的附图用来提供对本申请的进一步理解,构成本申请的一部分,本申请的示意性实施例及其说明用于解释本申请,并不构成对本申请的不当限定。在附图中:[0061] 图1示出了本申请实施例提供的一种词条搜索方法的流程示意图;[0062] 图2示出了本申请实施例提供的另一种词条搜索方法的流程示意图;[0063] 图3示出了本申请实施例提供的另一种词条搜索方法的流程示意图;[0064] 图4示出了本申请实施例提供的另一种词条搜索方法的流程示意图;[0065] 图5示出了本申请实施例提供的一种词条搜索装置的结构框图。具体实施方式[0066] 下文中将参考附图并结合实施例来详细说明本申请。需要说明的是,在不冲突的情况下,本申请中的实施例及实施例中的特征可以相互组合。[0067] 在本实施例中提供了一种词条搜索方法,如图1所示,该方法包括:[0068] 步骤101,根据待搜索词条的长度,将待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个分词的权重值,其中,待搜索词条的层次总数与长度正相关,每个分词的权重值与分词的层次正相关;[0069] 本申请实施例提供的词条搜索方法,将待搜索词条拆分成多个分词,并根据针对每个分词的搜索结果,确定对于待搜索词条的搜索结果。[0070] 具体地,将待搜索词条划分成为多个层次,并基于每个层次得到对应的分词,通过划分多个层次的方法,使搜索结果更加精准。可以理解的是,词条的长度越长,可以将词条划分成更多的分词,因此可以令层次总数与待搜索词条的长度正相关。[0071] 例如,可以将待搜索词条S划分成两个层次,其中第一层包括(A,B,C,D)四个分词,第二层包括(A1,A2,A3,B1,B2,C1,C2,D1,D2,D3)十个分词。并分别确定这十四个分词中每个分词的权重值。其中,每个分词的权重值与分词的层次正相关,第一层分词的权重值最大,可以保证第一层分词对整个搜索结果的影响最大。[0072] 步骤102,将分词排序,分别确定每个分词的位置;[0073] 在该实施例中,将拆分得到的所有分词进行排序,并根据排序结果确定每个分词的位置。具体地,按照每个分词在待搜索词条中的位置,将第一层的四个分词和第二层的十四个分词一起排序。[0074] 步骤103,获取待搜索文本,在待搜索文本中查找分词,得到目标分词;[0075] 在该实施例中,获取待搜索文本,并查找待搜索文本中是否存在待搜索词条中的分词,将找到的分词作为目标分词。其中,目标分词可以是第一层分词也可以是第二层分词,目标分词可以有多个。[0076] 步骤104,在多个所述权重值中确定所述目标分词对应的目标权重值,在多个所述位置中确定所述目标分词对应的目标位置,并根据目标权重值以及目标位置,确定待搜索词条的词条权重值和词条位置值;[0077] 在该实施例中,将目标分词对应的权重值作为目标权重值,目标分词对应的位置作为目标位置。综合考虑所有目标分词的目标权重值,得到待搜索词条的词条权重值;综合考虑所有目标分词的目标位置,得到待搜索词条的词条位置值。[0078] 步骤105,根据词条权重值以及词条位置值,确定待搜索文本与待搜索词条的相似度,并根据相似度确定搜索结果。[0079] 在该实施例中,预先设置多个待搜索词条,并将多个待搜索词条按照词条权重值降序排列,在词条权重值相同的情况下,按照词条位置值升序排列。由于词条权重值越大就表明词条与待搜索文本的文本相似度越高,而词条位置值越小就表明词条与待搜索文本的词序相似度越高,因此根据多个词条的排列顺序就可以确定与待搜索文本相似度最高的待搜索词条。[0080] 通过应用本实施例的技术方案,同时考虑了文本的相似程度以及词序的相似程度,可以避免查找到词序不同的结果,保证搜索结果更加精准。[0081] 进一步地,作为上述实施例具体实施方式的细化和扩展,为了完整说明本实施例的具体实施过程,提供了另一种词条搜索方法,如图2所示,在该方法中,将待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,具体包括:[0082] 步骤201,获取层次总数N,其中N为正整数;[0083] 步骤202,将待搜索词条划分为多个与第一层对应的第一层分词;[0084] 在该实施例中,将待搜索词条S划分成多个与第一层对应的第一层分词(A,B,C,D,……)。例如,可以将“北京向山东投资总额”划分成“北京”“向”“山东”“投资总额”。[0085] 步骤203,将每个与第m?1层对应的第m?1分词划分成多个与第m层对应的第m分词,其中,m为大于1且不大于N的整数。[0086] 在该实施例中,将第m?1层的分词继续划分,例如可以将第一层的第一层分词A划分成三个第二层的第二分词(A1,A2,A3)。[0087] 进一步地,在另一种词条搜索方法中,确定每个分词的权重值,具体包括:[0088] 步骤301,根据第一层分词的数量确定每个第一层分词对应的第一权重值;[0089] 在该实施例中,可以理解的是,第一层分词的数量越多,每个第一层分词可以分配到的第一权重值就越。虼丝梢愿莸谝徊惴执实氖咳范ǖ谝蝗ㄖ刂。[0090] 具体地,对于m个第一层分词(A,B,C,D,……),每个第一层分词对应的第一权重值可以为:[0091] 步骤302,根据每个第m层分词的长度、第m层分词对应的第m?1层分词的长度以及第m层分词对应的第m?1层分词的第m?1权重,确定第m层分词对应的第m权重。[0092] 在该实施例中,在确定了第m?1层分词对应的第m?1权重后,可以确定这个第m?1层分词所拆分出的每个第m层分词对应的第m权重。[0093] 具体地,例如,确定了第一层分词A的权重为W(A)后,可以确定由第一层分词A拆分得到的第二层分词Ai的权重为:[0094][0095] 其中,Len(Ai)为第二层分词Ai的长度,Len(A)为第一层分词A的长度。[0096] 进一步地,如图3所示,在另一种词条搜索方法中,将分词排序,具体包括:[0097] 步骤401,根据每个第一层分词在待搜索词条中的位置,确定第一层分词的顺序;[0098] 在该实施例中,由于第一层分词为待搜索词条拆分得到的,因此每个第一层分词在待搜索词条中都有对应的位置,可以根据该位置确定第一层分词的顺序。例如,将待搜索词条拆分为“北京向山东投资总额”划分成“北京”“向”“山东”“投资总额”四个第一层分词后,可以确定四个第一层分词的顺序为(“北京”,“向”,“山东”,“投资总额”)。[0099] 步骤402,确定每个第m?1层分词对应的第m层分词,分别得到与每个第m?1层分词对应的第m层分词组;[0100] 在该实施例中,针对每个第m?1层分词,确定该第m?1层分词对应的所有第m层分词并作为该第m?1层分词对应的第m层分词组。[0101] 例如,针对第一层分词A,确定该第一层分词A对应的所有第二层分词A1、A2和A3,并将第二层分词(A1,A2,A3)作为第一层分词A对应的第二分词组。[0102] 步骤403,根据第m层分词组内每个第m层分词在对应的第m?1层分词中的位置,确定第m层分词组内的第m层分词的顺序,并将第m层分词按顺序置于对应的第m?1分词后。[0103] 在该实施例中,首先确定第m?1层分词的位置,然后在每个第m?1层分词后面按顺序插入与之对应的第m层分词。[0104] 例如,首先确定第一层分词的顺序为(A,B,C,D),然后将第一层分词A对应的第二层分词A1、A2和A3按顺序插入到第一层分词A之后,得到(A,A1,A2,A3,B,C,D)。同理,把第一层分词B对应的第二层分词B1和B2也按顺序插入到第二分词B之后,得到(A,A1,A2,A3,B,B1,B2,C,D)。从而根据分词的顺序得到每个分词对应的位置P(A)至P(D),其中,P(A)
[0105] 进一步地,在另一种词条搜索方法中,根据目标分词的目标权重值以及目标分词的目标位置,确定待搜索词条的词条权重值和词条位置值,具体包括:[0106] 根据目标位置、每个目标分词在待搜索词条中的位置、待搜索词条的长度以及待搜索文本的长度,确定词条位置值。[0107] 在该实施例中,在搜索到目标分词后,可以综合考虑每个目标分词的位置,得到整个待搜索词条的词条位置值。[0108] 具体地,例如搜索到k个目标分词,则可以根据 计算待搜索词条S的词条位置值。[0109] 其中, 为第i个目标分词的位置Pi与该目标分词在待搜索文本中的位置P′i之间的距离。[0110] 其中, len(S)为待搜索词条S的长度,len(SE)为待搜索文本SE的长度。[0111] 进一步地,在另一种词条搜索方法中,在待搜索文本中查找分词,得到目标分词,具体包括:[0112] 步骤501,在待搜索文本中查找分词,并将查找到的所有分词作为备选分词集合;[0113] 步骤502,若备选分词集合中包含一个第m?1层目标分词以及与第m?1层目标分词对应的所有第m层目标分词,则将与第m?1层目标分词对应的所有第m层目标分词从备选分词集合中移除,得到目标分词集合;[0114] 步骤503,将目标分词集合中的每个分词作为目标分词。[0115] 在该实施例中,例如,在待搜索文本中查找到分词A,A1,A2,A3,B,B1和C,则将找到的所有分词作为备选分词集合。由于备选分词集合中包含了第一层分词A,同时还包含了第一层分词A对应的所有第二层分词A1,A2和A3,因此可以将第二层分词A1,A2和A3从备选集合中移除,得到目标分词集合(A,B,B1,C),并将A、B、B1和C作为目标分词,从而避免了查找到的分词被重复计算。[0116] 进一步地,如图4所示,在另一种词条搜索方法中,根据目标分词的目标权重值以及目标分词的目标位置,确定待搜索词条的词条权重值和词条位置值,具体包括:[0117] 步骤601,若目标分词集合中包含一个第m?1层目标分词以及与第m?1层目标分词对应的至少一个第m层目标分词,则将与第m?1层目标分词对应的至少一个第m层目标分词从目标分词集合中移除;[0118] 在该实施例中,例如,已经确定了目标分词集合为(A,B,B1,C)。由于目标分词集合中包含了第一层分词B,同时还包含了第一层分词B对应的所有第二层分词B1,因此可以将第二层分词B1从目标集合中移除,剩余(A,B,C)。[0119] 步骤602,将目标分词集合中剩余的每个目标分词的目标权重值累加,得到词条权重值。[0120] 在该实施例中,在将与第m?1层目标分词对应的至少一个第m层目标分词从目标分词集合中移除后,将目标分词集合中剩余的每个目标分词的目标权重值累加作为词条权重值。[0121] 例如目标分词集合中剩余的目标分词为(A,B,C),则待搜索词条S的词条权重值ranks=W(A)+W(B)+W(C),其中W(A)、W(B)和W(C)分别为目标分词A、B和C的目标权重值。[0122] 进一步地,作为上述词条搜索方法的具体实现,本申请实施例提供了一种词条搜索装置,如图5所示,该装置包括:分层模块、定位模块、搜索模块以及计算模块。[0123] 分层模块,用于根据待搜索词条的长度,将待搜索词条划分成多个层次,分别得到与每个层次对应的至少一个分词,并确定每个分词的权重值,其中,待搜索词条的层次总数与长度正相关,每个分词的权重值与分词的层次正相关;[0124] 定位模块,用于将分词排序,分别确定每个分词的位置;[0125] 搜索模块,用于获取待搜索文本,在待搜索文本中查找分词,得到目标分词;[0126] 计算模块,用于在多个权重值中确定目标分词对应的目标权重值,在多个位置中确定目标分词对应的目标位置,并根据目标权重值以及目标位置,确定待搜索词条的词条权重值和词条位置值;[0127] 计算模块,还用于根据词条权重值以及词条位置值,确定待搜索文本与待搜索词条的相似度,并根据相似度确定搜索结果。[0128] 在具体的应用场景中,可选地,分层模块包括划分单元。划分单元,具体用于:[0129] 获取层次总数N,其中N为正整数;[0130] 将待搜索词条划分为多个与第一层对应的第一层分词;[0131] 将每个与第m?1层对应的第m?1分词划分成多个与第m层对应的第m分词,其中,m为大于1且不大于N的整数。[0132] 在具体的应用场景中,可选地,分层模块还包括权重计算单元。权重计算单元,具体用于:[0133] 根据第一层分词的数量确定每个第一层分词对应的第一权重值;[0134] 根据每个第m层分词的长度、第m层分词对应的第m?1层分词的长度以及第m层分词对应的第m?1层分词的第m?1权重,确定第m层分词对应的第m权重。[0135] 在具体的应用场景中,可选地,定位模块具体用于:[0136] 根据每个第一层分词在待搜索词条中的位置,确定第一层分词的顺序;[0137] 确定每个第m?1层分词对应的第m层分词,分别得到与每个第m?1层分词对应的第m层分词组;[0138] 根据第m层分词组内每个第m层分词在对应的第m?1层分词中的位置,确定第m层分词组内的第m层分词的顺序,并将第m等分词按顺序置于对应的第m?1分词后。[0139] 在具体的应用场景中,可选地,计算模块具体用于:[0140] 根据目标位置、每个目标分词在待搜索词条中的位置、待搜索词条的长度以及待搜索文本的长度,确定词条位置值。[0141] 在具体的应用场景中,可选地,搜索模块具体用于:[0142] 在待搜索文本中查找分词,并将查找到的所有分词作为备选分词集合;[0143] 若备选分词集合中包含一个第m?1层目标分词以及与第m?1层目标分词对应的所有第m层目标分词,则将与第m?1层目标分词对应的所有第m层目标分词从备选分词集合中移除,得到目标分词集合;[0144] 将目标分词集合中的每个分词作为目标分词。[0145] 在具体的应用场景中,可选地,计算模块具体用于:[0146] 若目标分词集合中包含一个第m?1层目标分词以及与第m?1层目标分词对应的至少一个第m层目标分词,则将与第m?1层目标分词对应的至少一个第m层目标分词从目标分词集合中移除;[0147] 将目标分词集合中剩余的每个目标分词的目标权重值累加,得到词条权重值。[0148] 需要说明的是,本申请实施例提供的一种词条搜索装置所涉及各功能模块的其他相应描述,可以参考图1至图4中的对应描述,在此不再赘述。[0149] 基于上述如图1至图4所示方法,相应的,本申请实施例还提供了一种存储介质,其上存储有计算机程序,该程序被处理器执行时实现上述如图1至图4所示的词条搜索方法。[0150] 基于这样的理解,本申请的技术方案可以以软件产品的形式体现出来,该软件产品可以存储在一个非易失性存储介质(可以是CD?ROM,U盘,移动硬盘等)中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行本申请各个实施场景所述的方法。[0151] 基于上述如图1至图4所示的方法,以及图5所示的虚拟装置实施例,为了实现上述目的,本申请实施例还提供了一种计算机设备,具体可以为个人计算机、服务器、网络设备等,该计算机设备包括存储介质和处理器;存储介质,用于存储计算机程序;处理器,用于执行计算机程序以实现上述如图1至图4所示的词条搜索方法。[0152] 可选地,该计算机设备还可以包括用户接口、网络接口、摄像头、射频(RadioFrequency,RF)电路,传感器、音频电路、WI?FI模块等等。用户接口可以包括显示屏(Display)、输入单元比如键盘(Keyboard)等,可选用户接口还可以包括USB接口、读卡器接口等。网络接口可选的可以包括标准的有线接口、无线接口(如蓝牙接口、WI?FI接口)等。[0153] 本领域技术人员可以理解,本实施例提供的一种计算机设备结构并不构成对该计算机设备的限定,可以包括更多或更少的部件,或者组合某些部件,或者不同的部件布置。[0154] 存储介质中还可以包括操作系统、网络通信模块。操作系统是管理和保存计算机设备硬件和软件资源的程序,支持信息处理程序以及其它软件和/或程序的运行。网络通信模块用于实现存储介质内部各组件之间的通信,以及与该实体设备中其它硬件和软件之间通信。[0155] 通过以上的实施方式的描述,本领域的技术人员可以清楚地了解到本申请可以借助软件加必要的通用硬件平台的方式来实现,也可以通过硬件实现。[0156] 本领域技术人员可以理解附图只是一个优选实施场景的示意图,附图中的单元或流程并不一定是实施本申请所必须的。本领域技术人员可以理解实施场景中的装置中的单元可以按照实施场景描述进行分布于实施场景的装置中,也可以进行相应变化位于不同于本实施场景的一个或多个装置中。上述实施场景的单元可以合并为一个单元,也可以进一步拆分成多个子单元。[0157] 上述本申请序号仅仅为了描述,不代表实施场景的优劣。以上公开的仅为本申请的几个具体实施场景,但是,本申请并非局限于此,任何本领域的技术人员能思之的变化都应落入本申请的保护范围。

专利地区:北京

专利申请日期:2022-01-13

专利公开日期:2024-11-29

专利公告号:CN114510938B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载