开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于大数据的热词挖掘方法和系统发明专利

更新时间:2026-09-01
一种基于大数据的热词挖掘方法和系统发明专利 专利申请类型:发明专利;
地区:江苏-淮安;
源自:淮安高价值专利检索信息库;

专利名称:一种基于大数据的热词挖掘方法和系统

专利类型:发明专利

专利申请号:CN202311622391.6

专利申请(专利权)人:淮安科畅开云优惠体育网页版入口信息有限公司
权利人地址:江苏省淮安市经济技术开发区和畅路9号

专利发明(设计)人:张浩,王宇曦,蒋梦圆

专利摘要:本发明涉及互联网热词挖掘相关领域,公开了一种基于大数据的热词挖掘方法和系统,包括检索指向划分模块、词条向量生成模块、指向区间协同模块以及热词挖掘评估模块;通过采取对网上的主题内容进行类别划分,从而在不同的类别下进行词条热度的评估,并对词条在类别间的曝光度进行交叉判断,从而综合考虑以选取更加精准的热度词条,相较于现有技术中的热词挖掘方式,通过交叉热度的判断,能够有效的降低某一话题内容下的热度抑制行为,结果更加可靠。

主权利要求:
1.一种基于大数据的热词挖掘系统,其特征在于,包含:
检索指向划分模块,用于基于线上索引内容的标题词条建立类别向量,所述类别向量用于表征线上索引内容对应主题类别的数字检索特征;
词条向量生成模块,用于获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据;
指向区间协同模块,用于对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度,所述交叉热度表征词句内容在基于类别向量划分的多个组别内的出现占比;
热词挖掘评估模块,用于基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象;
所述词条向量生成模块包括:
向量偏差划分单元,用于获取多个类别向量,将多个所述类别向量进行空间表示,并通过预设的偏差值对多个类别向量进行聚散分析,以将多个类别向量进行组别划分,所述偏差值用于表征当所述词句内容的语言含义相近或相同时,对应类别向量的空间特征的波动范围;
词句向量生成单元,用于基于Harris分布式假设建立组别内数个词句的共现矩阵,并对所述共现矩阵乘以预设的投影向量,使得所述共现矩阵低维空间映射为内容向量;
词句向量统计单元,用于对组别内的数个内容向量进行向量统计,对应获取包含数个内容向量出现次数的组别内统计数据,所述向量统计基于预设偏差值实现;
所述指向区间协同模块包括:
交叉检索单元,用于将组别内的内容向量与其他组别进行交叉判断,获取所述内容向量在其他组别内的存在情况,所述交叉判断用于基于偏差值将其他组别内的内容向量与进行匹配的内容向量比对,判断是否用于表征相同或相近词句内容;
交叉统计单元,用于对所述内容向量在其他多个组别内出现的总次数以及在不同组别内的出现次数进行统计,以获取所述内容向量的交叉热度,即内容向量在其他话题下的出现概率;
所述热词挖掘评估模块包括:
交叉赋值单元,用于获取多个所述内容向量的交叉热度,基于出现频率进行交叉系数赋值,所述交叉系数赋值基于预设的赋值映射关系执行,所述赋值映射关系包括组别总数的级别划分及对应级别下出现频率对应的交叉系数,在级别划分确定时,所述交叉系数与出现频率成正比;
向量评估单元,用于基于内容向量的统计数据及其相对应的交叉系数和出现次数进行综合热度计算,并基于计算结果对多个内容向量进行排序,以获取数个热词对象,所述,所述热词对象即在排序中处于前预设数量个内容向量所对应的词句内容。
2.根据权利要求1所述的一种基于大数据的热词挖掘系统,其特征在于,还包括热词冷却模块;
所述热词冷却模块,用于通过牛顿冷却定律计算所述内容向量的冷却系数,所述冷却系数作用于内容向量的综合热度,所述冷却系数表示为 其中 表示当前综合热度, 表示历史综合热度,Δt表示时间差。
3.一种基于大数据的热词挖掘方法,其特征在于,包含步骤:
基于线上索引内容的标题词条建立类别向量,所述类别向量用于表征线上索引内容对应主题类别的数字检索特征;
获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据;
对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度,所述交叉热度表征词句内容在基于类别向量划分的多个组别内的出现占比;
基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象;
所述获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据的步骤具体包括:获取多个类别向量,将多个所述类别向量进行空间表示,并通过预设的偏差值对多个类别向量进行聚散分析,以将多个类别向量进行组别划分,所述偏差值用于表征当所述词句内容的语言含义相近或相同时,对应类别向量的空间特征的波动范围;
基于Harris分布式假设建立组别内数个词句的共现矩阵,并对所述共现矩阵乘以预设的投影向量,使得所述共现矩阵低维空间映射为内容向量;
对组别内的数个内容向量进行向量统计,对应获取包含数个内容向量出现次数的组别内统计数据,所述向量统计基于预设偏差值实现;
所述对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度的步骤具体包括:将组别内的内容向量与其他组别进行交叉判断,获取所述内容向量在其他组别内的存在情况,所述交叉判断用于基于偏差值将其他组别内的内容向量与进行匹配的内容向量比对,判断是否用于表征相同或相近词句内容;
对所述内容向量在其他多个组别内出现的总次数以及在不同组别内的出现次数进行统计,以获取所述内容向量的交叉热度,即内容向量在其他话题下的出现概率;
所述基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象的步骤具体包括:获取多个所述内容向量的交叉热度,基于出现频率进行交叉系数赋值,所述交叉系数赋值基于预设的赋值映射关系执行,所述赋值映射关系包括组别总数的级别划分及对应级别下出现频率对应的交叉系数,在级别划分确定时,所述交叉系数与出现频率成正比;
基于内容向量的统计数据及其相对应的交叉系数和出现次数进行综合热度计算,并基于计算结果对多个内容向量进行排序,以获取数个热词对象,所述,所述热词对象即在排序中处于前预设数量个内容向量所对应的词句内容。
4.根据权利要求3所述的一种基于大数据的热词挖掘方法,其特征在于,还包括步骤:通过牛顿冷却定律计算所述内容向量的冷却系数,所述冷却系数作用于内容向量的综合热度,所述冷却系数表示为 其中 表示当前综合热度,表示历史综合热度,Δt表示时间差。 说明书 : 一种基于大数据的热词挖掘方法和系统技术领域[0001] 本发明涉及互联网热词挖掘相关领域,具体是一种基于大数据的热词挖掘方法和系统。背景技术[0002] 在互联网信息爆炸的时代,将海量数据中的重要数据向用户群体推广是十分重要的,因此热词挖掘则承担了通过海量数据获取有效推广内容的重要任务。[0003] 现有技术中的热词挖掘多通过对于词条在一定时间内的出现评论统计排序获。谑导实氖褂弥,存在对应内容相关话题限流导致无法有效的进行热度挖掘评估的情况,因此部分重要内容无法有效的推广被更多用户所获取。发明内容[0004] 本发明的目的在于提供一种基于大数据的热词挖掘方法和系统,以解决上述背景技术中提出的问题。[0005] 为实现上述目的,本发明提供如下技术方案:[0006] 一种基于大数据的热词挖掘系统,包含:[0007] 检索指向划分模块,用于基于线上索引内容的标题词条建立类别向量,所述类别向量用于表征线上索引内容对应主题类别的数字检索特征;[0008] 词条向量生成模块,用于获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据;[0009] 指向区间协同模块,用于对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度,所述交叉热度表征词句内容在基于类别向量划分的多个组别内的出现占比;[0010] 热词挖掘评估模块,用于基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象。[0011] 作为本发明的进一步方案:所述词条向量生成模块包括:[0012] 向量偏差划分单元,用于获取多个类别向量,将多个所述类别向量进行空间表示,并通过预设的偏差值对多个类别向量进行聚散分析,以将多个类别向量进行组别划分,所述偏差值用于表征当所述词句内容的语言含义相近或相同时,对应类别向量的空间特征的波动范围;[0013] 词句向量生成单元,用于基于Harris分布式假设建立组别内数个词句的共现矩阵,并对所述共现矩阵乘以预设的投影向量,使得所述共现矩阵低维空间映射为内容向量;[0014] 词句向量统计单元,用于对组别内的数个内容向量进行向量统计,对应获取包含数个内容向量出现次数的组别内统计数据,所述向量统计基于预设偏差值实现。[0015] 作为本发明的再进一步方案:所述指向区间协同模块包括:[0016] 交叉检索单元,用于将组别内的内容向量与其他组别进行交叉判断,获取所述内容向量在其他组别内的存在情况,所述交叉判断用于基于偏差值将其他组别内的内容向量与进行匹配的内容向量比对,判断是否用于表征相同或相近词句内容;[0017] 交叉统计单元,用于对所述内容向量在其他多个组别内出现频率以及在不同组别内的出现次数进行统计,以获取所述内容向量的交叉热度。[0018] 作为本发明的再进一步方案:所述热词挖掘评估模块包括:[0019] 交叉赋值单元,用于获取多个所述内容向量的交叉热度,基于出现频率进行交叉系数赋值,所述交叉系数赋值基于预设的赋值映射关系执行,所述赋值映射关系包括组别总数的级别划分及对应级别下出现频率对应的交叉系数,在级别划分确定时,所述交叉系数与出现频率成正比;[0020] 向量评估单元,用于基于内容向量的统计数据及其相对应的交叉系数和出现次数进行综合热度计算,并基于计算结果对多个内容向量进行排序,以获取数个热词对象,所述,所述热词对象即在排序中处于前预设数量个内容向量所对应的词句内容。[0021] 作为本发明的再进一步方案:还包括热词冷却模块;[0022] 所述热词冷却模块,用于通过牛顿冷却定律计算所述内容向量的冷却系数,所述冷却系数作用于内容向量的综合热度,所述冷却系数表示为,其中 表示当前综合热度, 表示历史综合热度, 表示时间差。[0023] 本发明实施例旨在提供一种基于大数据的热词挖掘方法,包含步骤:[0024] 基于线上索引内容的标题词条建立类别向量,所述类别向量用于表征线上索引内容对应主题类别的数字检索特征;[0025] 获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据;[0026] 对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度,所述交叉热度表征词句内容在基于类别向量划分的多个组别内的出现占比;[0027] 基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象。[0028] 作为本发明的进一步方案:所述获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据的步骤具体包括:[0029] 获取多个类别向量,将多个所述类别向量进行空间表示,并通过预设的偏差值对多个类别向量进行聚散分析,以将多个类别向量进行组别划分,所述偏差值用于表征当所述词句内容的语言含义相近或相同时,对应类别向量的空间特征的波动范围;[0030] 基于Harris分布式假设建立组别内数个词句的共现矩阵,并对所述共现矩阵乘以预设的投影向量,使得所述共现矩阵低维空间映射为内容向量;[0031] 对组别内的数个内容向量进行向量统计,对应获取包含数个内容向量出现次数的组别内统计数据,所述向量统计基于预设偏差值实现。[0032] 作为本发明的再进一步方案:所述对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度的步骤具体包括:[0033] 将组别内的内容向量与其他组别进行交叉判断,获取所述内容向量在其他组别内的存在情况,所述交叉判断用于基于偏差值将其他组别内的内容向量与进行匹配的内容向量比对,判断是否用于表征相同或相近词句内容;[0034] 对所述内容向量在其他多个组别内出现频率以及在不同组别内的出现次数进行统计,以获取所述内容向量的交叉热度。[0035] 作为本发明的再进一步方案:所述基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象的步骤具体包括:[0036] 获取多个所述内容向量的交叉热度,基于出现频率进行交叉系数赋值,所述交叉系数赋值基于预设的赋值映射关系执行,所述赋值映射关系包括组别总数的级别划分及对应级别下出现频率对应的交叉系数,在级别划分确定时,所述交叉系数与出现频率成正比;[0037] 基于内容向量的统计数据及其相对应的交叉系数和出现次数进行综合热度计算,并基于计算结果对多个内容向量进行排序,以获取数个热词对象,所述,所述热词对象即在排序中处于前预设数量个内容向量所对应的词句内容。[0038] 作为本发明的再进一步方案:还包括步骤:[0039] 通过牛顿冷却定律计算所述内容向量的冷却系数,所述冷却系数作用于内容向量的综合热度,所述冷却系数表示为 ,其中 表示当前综合热度, 表示历史综合热度, 表示时间差。[0040] 与现有技术相比,本发明的有益效果是:通过采取对网上的主题内容进行类别划分,从而在不同的类别下进行词条热度的评估,并对词条在类别间的曝光度进行交叉判断,从而综合考虑以选取更加精准的热度词条,相较于现有技术中的热词挖掘方式,通过交叉热度的判断,能够有效的降低某一话题内容下的热度抑制行为,结果更加可靠。附图说明[0041] 图1为一种基于大数据的热词挖掘系统的组成框图。[0042] 图2为一种基于大数据的热词挖掘系统中向量生成模块的组成框图。[0043] 图3为一种基于大数据的热词挖掘系统中指向区间协同模块的组成框图。[0044] 图4为一种基于大数据的热词挖掘系统中热词挖掘评估模块的组成框图。[0045] 图5为一种基于大数据的热词挖掘方法的流程框图。具体实施方式[0046] 为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本发明,并不用于限定本发明。[0047] 以下结合具体实施例对本发明的具体实现方式进行详细描述。[0048] 如图1所述,为本发明一个实施例提供的一种基于大数据的热词挖掘系统,包括以下步骤:[0049] 检索指向划分模块100,用于基于线上索引内容的标题词条建立类别向量,所述类别向量用于表征线上索引内容对应主题类别的数字检索特征。[0050] 词条向量生成模块300,用于获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据。[0051] 指向区间协同模块500,用于对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度,所述交叉热度表征词句内容在基于类别向量划分的多个组别内的出现占比。[0052] 热词挖掘评估模块700,用于基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象。[0053] 本实施例中,给出了一种基于大数据的热词挖掘系统,通过采取对网上的主题内容进行类别划分,从而在不同的类别下进行词条热度的评估,并对词条在类别间的曝光度进行交叉判断,从而综合考虑以选取更加精准的热度词条,相较于现有技术中的热词挖掘方式,通过交叉热度的判断,能够有效的降低某一话题内容下的热度抑制行为,结果更加可靠;在实际的热词挖掘中,会面对部分话题下,热度被压制的情况,即使某一相关话题,其下方的相关讨论热度极高,但话题依然无法被算法有效的挖掘成为热词,因此,为了某些热门话题内容能够有效的被挖掘,本申请便采用了交叉热度判断的方式,具体的来说,在实际场景下,当某一话题具有讨论度时,尤其是某一话题讨论度较高,但是却受到了热度限制时,对该话题具有一定知情的相关线上用户便可能会通过在其他的内容场所对该内容进行曝光,而现有技术中的热词挖掘方法,是基于线上整体词汇的检索频率建立的,因此,这一类的较为分散的少量曝光方式对于相关词条的本身热度提升无法有效的生效,因此这种方法也就无法使被抑制热度的词条重新成为热词,而本申请则是首先对线上的内容基于相关度进行划分,对划分后的组别进行分别的热词提。虼思词够疤庀碌南喙啬谌荼灰种迫榷,但其他组别内被线上用户不断零星曝光的对应词条,会随着零星分布的分布点变多而被提升判断优先级,也就是交叉热度,因此,可以通过分布式热词曝光的方式提升交叉热度,进而可以有效的对常规热词挖掘部分产生影响,以提升词条的相关热度,使其重新成为热词。[0054] 如图2所示,作为本发明另一个优选的实施例,所述词条向量生成模块300包括:[0055] 向量偏差划分单元301,用于获取多个类别向量,将多个所述类别向量进行空间表示,并通过预设的偏差值对多个类别向量进行聚散分析,以将多个类别向量进行组别划分,所述偏差值用于表征当所述词句内容的语言含义相近或相同时,对应类别向量的空间特征的波动范围。[0056] 词句向量生成单元302,用于基于Harris分布式假设建立组别内数个词句的共现矩阵,并对所述共现矩阵乘以预设的投影向量,使得所述共现矩阵低维空间映射为内容向量。[0057] 词句向量统计单元303,用于对组别内的数个内容向量进行向量统计,对应获取包含数个内容向量出现次数的组别内统计数据,所述向量统计基于预设偏差值实现。[0058] 本实施例中,对词条向量生成模块300进行了说明,其中对于词条词句生成内容向量的步骤,采用的是Harris分布式假设(其中检索指向划分模块100生成类别向量的步骤采用的方式是相同的),简单的可以理解为,基于某个词汇的上下文相似匹配对词的相似性进行判断,这种方法相较于传统的对词句进行语言含义判断的方式相比,可以有效的规避词句在不同场景下释义不同的情况下的错误判断,具体的来说,基于词的上下文,可以建立一个共现矩阵,其中共现矩阵可以表示为P*C,其中P是词典,C是词汇上下文相邻词汇等,投影向量则是一个确定的向量,用于将共现矩阵在平面内进行投影,获取更加易于判断的平面向量;在处理完成后生成多个内容向量后,在通过统计对不同内容向量的热度进行评估,以进行热度的判断。[0059] 如图3所示,作为本发明另一个优选的实施例,所述指向区间协同模块500包括:[0060] 交叉检索单元501,用于将组别内的内容向量与其他组别进行交叉判断,获取所述内容向量在其他组别内的存在情况,所述交叉判断用于基于偏差值将其他组别内的内容向量与进行匹配的内容向量比对,判断是否用于表征相同或相近词句内容。[0061] 交叉统计单元502,用于对所述内容向量在其他多个组别内出现频率以及在不同组别内的出现次数进行统计,以获取所述内容向量的交叉热度。[0062] 本实施例中,指向区间协同模块500用于组别间的交叉热度评估,主要包括两个步骤,其一为组别间的交叉判断,将多个组别间向量的存在进行检索获。黄涠则对组别间的向量进行统计计算,计算包括在不同话题下的存在情况,也就是出现概率,以及在不同组别内的出现次数,其中出现频率为最主要的参数,例如,线上除去原本的组别外,总的话题组别有十个,其中这一话题在5个组别中存在,则0.5为出现频率。[0063] 如图4所示,作为本发明另一个优选的实施例,所述热词挖掘评估模块700包括:[0064] 交叉赋值单元701,用于获取多个所述内容向量的交叉热度,基于出现频率进行交叉系数赋值,所述交叉系数赋值基于预设的赋值映射关系执行,所述赋值映射关系包括组别总数的级别划分及对应级别下出现频率对应的交叉系数,在级别划分确定时,所述交叉系数与出现频率成正比。[0065] 向量评估单元702,用于基于内容向量的统计数据及其相对应的交叉系数和出现次数进行综合热度计算,并基于计算结果对多个内容向量进行排序,以获取数个热词对象,所述,所述热词对象即在排序中处于前预设数量个内容向量所对应的词句内容。[0066] 本实施例中,热词挖掘评估模块700的作用为对交叉热度和组别内的基本热度进行协同判断以获取综合热度,在生成综合热度的过程中,需要组别内的热度和交叉热度间进行运算累加系数的分配,在实际的场景下,当某一话题在非原本组别外,被提及的组别数量越多时,则表示,该话题则可能越加重要,因此,需要对其分配更高的交叉系数来进行综合热度的计算,来进一步的提升其整体热度,使其对应的词句成为热词。[0067] 作为本发明另一个优选的实施例,还包括热词冷却模块;[0068] 所述热词冷却模块,用于通过牛顿冷却定律计算所述内容向量的冷却系数,所述冷却系数作用于内容向量的综合热度,所述冷却系数表示为,其中 表示当前综合热度, 表示历史综合热度, 表示时间差。[0069] 本实施例中,某一热词在随着时间的变化下,其热度是逐渐降低的,因此便存在一个热度冷却的速度,即冷却系数,当冷却效率越大时(在一段时间内,热度的衰减速度越大),表示该话题其实际的重要性或关注度并不高,在人们了解后便很快舍弃了,所以即使当前的热度基础依然很高,也需要通过冷却系数降低其热度,为其他的更需要曝光的内容提供窗口。[0070] 如图5所示,本发明还提供了一种基于大数据的热词挖掘方法,其包含步骤:[0071] S200,基于线上索引内容的标题词条建立类别向量,所述类别向量用于表征线上索引内容对应主题类别的数字检索特征。[0072] S400,获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据。[0073] S600,对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度,所述交叉热度表征词句内容在基于类别向量划分的多个组别内的出现占比。[0074] S800,基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象。[0075] 作为本发明另一个优选的实施例,所述获取预设偏差值内多个类别向量对应的所述线上索引内容的主体内容以及关联词条的词句内容,基于所述词句内容的单词进行低维空间映射,建立内容向量并进行向量统计,获取组别内的统计数据的步骤具体包括:[0076] 获取多个类别向量,将多个所述类别向量进行空间表示,并通过预设的偏差值对多个类别向量进行聚散分析,以将多个类别向量进行组别划分,所述偏差值用于表征当所述词句内容的语言含义相近或相同时,对应类别向量的空间特征的波动范围。[0077] 基于Harris分布式假设建立组别内数个词句的共现矩阵,并对所述共现矩阵乘以预设的投影向量,使得所述共现矩阵低维空间映射为内容向量。[0078] 对组别内的数个内容向量进行向量统计,对应获取包含数个内容向量出现次数的组别内统计数据,所述向量统计基于预设偏差值实现。[0079] 作为本发明另一个优选的实施例,所述对多个组别内统计数据进行交叉判断,获取某一所述内容向量在其他组别的出现频率,以生成对应内容向量的交叉热度的步骤具体包括:[0080] 将组别内的内容向量与其他组别进行交叉判断,获取所述内容向量在其他组别内的存在情况,所述交叉判断用于基于偏差值将其他组别内的内容向量与进行匹配的内容向量比对,判断是否用于表征相同或相近词句内容。[0081] 对所述内容向量在其他多个组别内出现频率以及在不同组别内的出现次数进行统计,以获取所述内容向量的交叉热度。[0082] 作为本发明另一个优选的实施例,所述基于统计数据及交叉热度对所述内容向量进行综合热度评估,并基于多个内容向量的综合热度评估排序,获取数个热词对象的步骤具体包括:[0083] 获取多个所述内容向量的交叉热度,基于出现频率进行交叉系数赋值,所述交叉系数赋值基于预设的赋值映射关系执行,所述赋值映射关系包括组别总数的级别划分及对应级别下出现频率对应的交叉系数,在级别划分确定时,所述交叉系数与出现频率成正比。[0084] 基于内容向量的统计数据及其相对应的交叉系数和出现次数进行综合热度计算,并基于计算结果对多个内容向量进行排序,以获取数个热词对象,所述,所述热词对象即在排序中处于前预设数量个内容向量所对应的词句内容。[0085] 作为本发明另一个优选的实施例,还包括步骤:[0086] 通过牛顿冷却定律计算所述内容向量的冷却系数,所述冷却系数作用于内容向量的综合热度,所述冷却系数表示为 ,其中 表示当前综合热度, 表示历史综合热度, 表示时间差。[0087] 本领域普通技术人员可以理解实现上述实施例方法中的全部或部分流程,是可以通过计算机程序来指令相关的硬件来完成,所述的程序可存储于一非易失性计算机可读取存储介质中,该程序在执行时,可包括如上述各方法的实施例的流程。其中,本申请所提供的各实施例中所使用的对存储器、存储、数据库或其它介质的任何引用,均可包括非易失性和/或易失性存储器。非易失性存储器可包括只读存储器(ROM)、可编程ROM(PROM)、电可编程ROM(EPROM)、电可擦除可编程ROM(EEPROM)或闪存。易失性存储器可包括随机存取存储器(RAM)或者外部高速缓冲存储器。作为说明而非局限,RAM以多种形式可得,诸如静态RAM(SRAM)、动态RAM(DRAM)、同步DRAM(SDRAM)、双数据率SDRAM(DDRSDRAM)、增强型SDRAM(ESDRAM)、同步链路(Synchlink)DRAM(SLDRAM)、存储器总线(Rambus)直接RAM(RDRAM)、直接存储器总线动态RAM(DRDRAM)、以及存储器总线动态RAM(RDRAM)等。[0088] 本领域技术人员在考虑说明书及实施例处的公开后,将容易想到本公开的其它实施方案。本申请旨在涵盖本公开的任何变型、用途或者适应性变化,这些变型、用途或者适应性变化遵循本公开的一般性原理并包括本公开未公开的本技术领域中的公知常识或惯用技术手段。说明书和实施例仅被视为示例性的,本公开的真正范围和精神由权利要求指出。[0089] 应当理解的是,本公开并不局限于上面已经描述并在附图中示出的精确结构,并且可以在不脱离其范围进行各种修改和改变。本公开的范围仅由所附的权利要求来限制。

专利地区:江苏

专利申请日期:2023-11-30

专利公开日期:2024-11-29

专利公告号:CN117828152B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载