开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于大数据的资讯信息提取方法及装置发明专利

更新时间:2026-04-22
一种基于大数据的资讯信息提取方法及装置发明专利 专利申请类型:发明专利;
地区:安徽-六安;
源自:六安高价值专利检索信息库;

专利名称:一种基于大数据的资讯信息提取方法及装置

专利类型:发明专利

专利申请号:CN202410186792.X

专利申请(专利权)人:安徽彼亿网络开云优惠体育网页版入口有限公司
权利人地址:安徽省六安市裕安区光彩大市场D07-112铺

专利发明(设计)人:杜英丽,李恩赐,吴凌峰

专利摘要:本发明公开了一种基于大数据的资讯信息提取方法及装置,涉及数据分析领域;通过计算资讯数据库中的文本与预设主题词的关联度获得目标文本;通过对目标文本进行情感分数计算和数据标注,将目标文本分别处理,有助于更准确地确定文本的情感倾向,并为智能体模型训练提供了高质量的有标注数据,解决了人工标注时间长、成本高的问题;通过智能体对情感极性不明显的目标文本进行二次标注,进一步提高了情感分析的准确性。

主权利要求:
1.一种基于大数据的资讯信息提取方法,其特征在于,所述方法包括:从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集;资讯数据库中的文本是新闻资讯和相关话题下的评论数据;
计算第一目标数据集中各文本的情感分数,并添加数据标注;所述数据标注包括积极的标注、消极的标注和中立的标注;
将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集;
利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体;
通过所述智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集;
将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息;
所述深度强化学习模型的奖励计算过程包括:
若智能体的动作与环境状态对应的文本的数据标注一致,则给予正奖励,其中,rewarda是所求正奖励,p是智能体选择该动作的概率;
若智能体的动作选择与环境状态对应的文本的数据标注不一致,则给予负奖励,其中,rewardn是所求负奖励,p是智能体选择该动作的概率;
所述通过所述智能体为第二目标数据集中各文本做二次数据标注包括:修改智能体的输出规则为输出选择每个动作的概率;根据智能体对训练集的测试数据,确定判断阈值Pt;
将第二目标数据集中的各文本向量化,输入给所述智能体,得到选择1的概率P1和选择?
1的概率P2;
若P1>P2且P1>Pt,则为该文本添加积极的数据标注;若P2>P1且P2>Pt,则为该文本添加消极的数据标注;若P1

2.根据权利要求1所述的一种基于大数据的资讯信息提取方法,其特征在于,所述从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集包括:从资讯数据库中按顺序选择文本,提取文本中的名词,根据各名词的出现频率进行排序,将排名在前的预设数量的名词作为该文本的第一类型关键字;
匹配所述第一类型关键字的各名词在语义网络中的位置,以各名词到预设主题词的路径长度的倒数作为各名词与预设主题词的关联度,对第一类型关键字的各名词的关联度进行加权平均,得到文本与预设主题词的关联度;所述语义网络是根据预设主题词构建的语义网络;
将与预设主题词的关联度大于第一预设阈值的文本放入第一目标数据集。
3.根据权利要求1所述的一种基于大数据的资讯信息提取方法,其特征在于,所述计算第一目标数据集中各文本的情感分数,并添加数据标注包括:从第一目标数据集中按顺序选择第一目标文本,提取第一目标文本中的形容词和副词作为该第一目标文本的第二类型关键字;
根据预设的情感字典,遍历第二类型关键字,如果形容词不在情感字典中,则赋零分;
如果形容词在情感字典中,则为该形容词赋上相应的情感分数,如果形容词前有程度副词,则根据程度调整赋分;如果形容词前有否定副词,则改变赋分符号;将所有形容词的情感分数加权求和得到该第一目标文本的情感分数;所述预设的情感字典包含积极词汇和消极词汇,积极词汇的情感分数在(0,1]之间,消极词汇的情感分数在[?1,0)之间;
若文本的情感分数大于预设积极阈值,则为该文本添加积极的情感标注;若文本的情感分数小于预设消极阈值,则为该文本添加消极的情感标注;若文本的情感分数大于预设消极阈值且小于预设积极阈值,则为该文本添加中立的情感标注;所述预设积极阈值大于
0,所述预设消极阈值小于0。
4.根据权利要求1所述的一种基于大数据的资讯信息提取方法,其特征在于,所述利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体包括:初始化训练环境,以使智能体根据环境状态从动作区间中选择动作;根据智能体的动作和环境状态给出奖励和新的环境状态,以使智能体根据奖励更新策略函数并根据新的环境状态选择动作;重复训练步骤直至达到预设停止条件;所述动作区间为{?1,1},?1表示选择消极标注,1表示选择积极标注;所述环境状态由第三数据集中的文本向量化表示;所述预设停止条件包括最大训练轮数和/或收敛函数收敛。
5.根据权利要求4所述的一种基于大数据的资讯信息提取方法,其特征在于,所述初始化训练环境之前包括:对第三目标数据集中的文本进行分词、去除、填充或截断,得到长度相等的规范化文本;通过词嵌入的方法将所述规范化文本中的词汇转换为固定维度的向量;将向量化的各文本作为环境状态表示放入训练集中。
6.一种基于大数据的资讯信息提取装置,其特征在于,所述装置包括:文本选择模块,用于从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集;
一次标注模块,用于计算第一目标数据集中各文本的情感分数,并添加数据标注;所述数据标注包括积极的标注、消极的标注和中立的标注;
一次标注模块,还用于将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集;
模型训练模块,用于利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体;
二次标注模块,用于通过所述智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集;
数据分析模块,用于将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息;
所述深度强化学习模型的奖励计算过程包括:
若智能体的动作与环境状态对应的文本的数据标注一致,则给予正奖励,其中,rewarda是所求正奖励,p是智能体选择该动作的概率;
若智能体的动作选择与环境状态对应的文本的数据标注不一致,则给予负奖励,其中,rewardn是所求负奖励,p是智能体选择该动作的概率;
所述通过所述智能体为第二目标数据集中各文本做二次数据标注包括:修改智能体的输出规则为输出选择每个动作的概率;根据智能体对训练集的测试数据,确定判断阈值Pt;
将第二目标数据集中的各文本向量化,输入给所述智能体,得到选择1的概率P1和选择?
1的概率P2;
若P1>P2且P1>Pt,则为该文本添加积极的数据标注;若P2>P1且P2>Pt,则为该文本添加消极的数据标注;若P1
说明书 : 一种基于大数据的资讯信息提取方法及装置技术领域[0001] 本发明涉及数据分析领域,具体涉及一种基于大数据的资讯信息提取方法及装置。背景技术[0002] 随着移动互联网的快速发展,资讯信息呈几何式的增长,如何从海量的文本数据中提取有用的信息成为了一个重要的问题,情感分析技术应运而生。[0003] 情感分析是根据文本内容判断其情感倾向的技术,现有的实现方式有两种,一种是通过人工预定义规则与统计分析技术实现,主要是情感词典的方法;一种是通过有标注的情感分类数据训练分类器模型实现。但是,情感词典在文本的情感极性没有特别明显时,它的准确率会大幅下降;分类器模型需要大量的有标注数据进行模型训练,而现有的技术是通过人工对文本进行情感判断后再手动添加数据标注,这会耗费大量的时间和人力成本。发明内容[0004] 本发明的目的就在于解决上述背景技术中提到的情感词典准确率低和模型训练成本高的问题,而提出一种基于大数据的资讯信息提取方法及装置。[0005] 本发明实施的第一方面,提供了一种基于大数据的资讯信息提取方法,所述方法包括:[0006] 从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集;[0007] 计算第一目标数据集中各文本的情感分数,并添加数据标注;所述数据标注包括积极的标注、消极的标注和中立的标注;[0008] 将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集;[0009] 利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体;[0010] 通过所述智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集;[0011] 将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息。[0012] 可选的,从资讯数据库中按顺序选择文本,提取文本中的名词,根据各名词的出现频率进行排序,将排名在前的预设数量的名词作为该文本的第一类型关键字;[0013] 匹配所述第一类型关键字的各名词在语义网络中的位置,以各名词到预设主题词的路径长度的倒数作为各名词与预设主题词的关联度,对第一类型关键字的各名词的关联度进行加权平均,得到文本与预设主题词的关联度;所述语义网络是根据预设主题词构建的语义网络;[0014] 将与预设主题词的关联度大于第一预设阈值的文本放入第一目标数据集。[0015] 可选的,从第一目标数据集中按顺序选择第一目标文本,提取第一目标文本中的形容词和副词作为该第一目标文本的第二类型关键字;[0016] 根据预设的情感字典,遍历第二类型关键字,如果形容词不在情感字典中,则赋零分;如果形容词在情感字典中,则为该形容词赋上相应的情感分数,如果形容词前有程度副词,则根据程度调整赋分;如果形容词前有否定副词,则改变赋分符号;将所有形容词的情感分数加权求和得到该第一目标文本的情感分数;所述预设的情感字典包含积极词汇和消极词汇,积极词汇的情感分数在(0,1]之间,消极词汇的情感分数在[?1,0)之间;[0017] 若文本的情感分数大于预设积极阈值,则为该文本添加积极的情感标注;若文本的情感分数小于预设消极阈值,则为该文本添加消极的情感标注;若文本的情感分数大于预设消极阈值且小于预设积极阈值,则为该文本添加中立的情感标注;所述预设积极阈值大于0,所述预设消极阈值小于0。[0018] 可选的,初始化训练环境,以使智能体根据环境状态从动作区间中选择动作;根据智能体的动作和环境状态给出奖励和新的环境状态,以使智能体根据奖励更新策略函数并根据新的环境状态选择动作;重复训练步骤直至达到预设停止条件;所述动作区间为{?1,1},?1表示选择消极标注,1表示选择积极标注;所述环境状态由第三数据集中的文本向量化表示;所述预设停止条件包括最大训练轮数和/或收敛函数收敛。[0019] 可选的,若智能体的动作与环境状态对应的文本的数据标注一致,则给予正奖励,[0020] rewarda=100*p[0021] 其中,rewarda是所求正奖励,p是智能体选择该动作的概率;[0022] 若智能体的动作选择与环境状态对应的文本的数据标注不一致,则给予负奖励,[0023] rewardn=?1000*p[0024] 其中,rewardn是所求负奖励,p是智能体选择该动作的概率。[0025] 可选的,对第三目标数据集中的文本进行分词、去除、填充或截断,得到长度相等的规范化文本;通过词嵌入的方法将所述规范化文本中的词汇转换为固定维度的向量;将向量化的各文本作为环境状态表示放入训练集中。[0026] 可选的,修改智能体的输出规则为输出选择每个动作的概率;根据智能体对训练集的测试数据,确定判断阈值Pt;[0027] 将第二目标数据集中的各文本向量化,输入给所述智能体,得到选择1的概率P1和选择?1的概率P2;[0028] 若P1>P2且P1>Pt,则为该文本添加积极的数据标注;若P2>P1且P2>Pt,则为该文本添加消极的数据标注;若P1
[0029] 本发明实施的第二方面,提供了一种基于大数据的资讯信息提取装置,所述装置包括:[0030] 文本选择模块,用于从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集;[0031] 一次标注模块,用于计算第一目标数据集中各文本的情感分数,并添加数据标注;所述数据标注包括积极的标注、消极的标注和中立的标注;[0032] 一次标注模块,还用于将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集;[0033] 模型训练模块,用于利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体;[0034] 二次标注模块,用于通过所述智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集;[0035] 数据分析模块,用于将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息。[0036] 本发明的有益效果:[0037] 本发明提出了一种基于大数据的资讯信息提取方法,该方法包括:从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集;计算第一目标数据集中各文本的情感分数,并添加数据标注;数据标注包括积极的标注、消极的标注和中立的标注;将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集;利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体;通过智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集;将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息。[0038] 本发明实施例通过对目标文本进行情感分数计算和数据标注,将目标文本分别处理,有助于更准确地确定文本的情感倾向,并为智能体模型训练提供了高质量的有标注数据,解决了人工标注时间长、成本高的问题;通过智能体对情感极性不明显的目标文本进行二次标注,进一步提高了情感分析的准确性。附图说明[0039] 下面结合附图对本发明作进一步的说明。[0040] 图1为本发明实施例提供了一种基于大数据的资讯信息提取方法的流程图;[0041] 图2为本发明实施例提供了另一种基于大数据的资讯信息提取方法的流程图;[0042] 图3为本发明实施例提供了一种基于大数据的资讯信息提取装置的结构图。具体实施方式[0043] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其它实施例,都属于本发明保护的范围。[0044] 本发明实施例提供了一种基于大数据的资讯信息提取方法。参见图1,图1为本发明实施例提供的一种基于大数据的资讯信息提取方法的流程图。该方法包括以下步骤:[0045] S101,从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集。[0046] S102,计算第一目标数据集中各文本的情感分数,并添加数据标注。[0047] S103,将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集。[0048] S104,利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体。[0049] S105,通过智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集。[0050] S106,将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息。[0051] 其中,数据标注包括积极的标注、消极的标注和中立的标注。[0052] 基于本实施例提供的一种基于大数据的资讯信息提取方法,通过对目标文本进行情感分数计算和数据标注,将目标文本分别处理,有助于更准确地确定文本的情感倾向,并为智能体模型训练提供了高质量的有标注数据,解决了人工标注时间长、成本高的问题;通过智能体对情感极性不明显的目标文本进行二次标注,进一步提高了情感分析的准确性。[0053] 一种实现方式中,资讯可以是新闻资讯,通过实时的获取装置获。4嬖谑菘庵校蛔恃兑部梢允窃谙喙鼗疤庀碌钠缆凼,通过实时的获取装置获。4嬖谑菘庵。[0054] 一种实现方式中,预设主题词可以是某个主体的名称,如具体的公司名或人名;预设主题词也可以是某领域的名称,如计算机、化学等。[0055] 一种实现方式中,第一预设阈值是根据对关联度的要求而预先设定的用于筛选与预设主题高度相关的资讯的关联度阈值,可以提高分析的针对性和效率,减少无关数据对分析结果地影响。[0056] 一种实现方式中,通过各文本的情感分数判断文本的情绪倾向,再根据情绪倾向为文本添加数据标注;情感倾向分为积极的情感、消极的情感和中立的情感;因为情感字典中包含的是积极词汇和消极词汇,所以情感倾向明显的文本在分类时可以清晰地分为积极的和消极的,但剩余的情感不明显的文本则都归为中立的,这大大降低了对情感不明显的文本的判断准确率;所以将情感词典判断为中立的文本分开处理,通过模型方法做二次判断,从而提高对文本情感判断的准确性。[0057] 在一个实施例中,在图1的基础上步骤S101包括:[0058] 步骤一,从资讯数据库中按顺序选择文本,提取文本中的名词,根据各名词的出现频率进行排序,将排名在前的预设数量的名词作为该文本的第一类型关键字。[0059] 步骤二,匹配第一类型关键字的各名词在语义网络中的位置,以各名词到预设主题词的路径长度的倒数作为各名词与预设主题词的关联度。[0060] 步骤三,对第一类型关键字的各名词的关联度进行加权平均,得到第一类型关键字与预设主题词的关联度。[0061] 步骤四,将与预设主题词的关联度大于第一预设阈值的文本放入第一目标数据集。[0062] 其中,语义网络是根据预设主题词构建的语义网络。[0063] 一种实现方式中,通过设定关联度的第一预设阈值,能够精准地筛选出与主题高度相关的文本,这样可以显著提高分析的针对性和效率,减少不必要的数据处理。[0064] 一种实现方式中,语义网络以树的形式存在,每个节点代表一个词汇,其中根节点为预设主题词;每一层结点的深度代表了该层结点与预设主题词的关联度,深度越大,关联度越小。[0065] 在一个实施例中,在图1的基础上步骤S102包括:[0066] 步骤一,从第一目标数据集中按顺序选择第一目标文本,提取第一目标文本中的形容词和副词作为该第一目标文本的第二类型关键字。[0067] 步骤二,根据预设的情感字典,遍历第二类型关键字,如果形容词不在情感字典中,则赋零分;如果形容词在情感字典中,则为该形容词赋上相应的情感分数,如果形容词前有程度副词,则根据程度调整赋分;如果形容词前有否定副词,则改变赋分符号。[0068] 步骤三,将所有形容词的情感分数加权求和得到该第一目标文本的情感分数。[0069] 步骤四,若文本的情感分数大于预设积极阈值,则为该文本添加积极的情感标注;若文本的情感分数小于预设消极阈值,则为该文本添加消极的情感标注;若文本的情感分数大于预设消极阈值且小于预设积极阈值,则为该文本添加中立的情感标注。[0070] 其中,预设的情感字典包含积极词汇和消极词汇,积极词汇的情感分数在(0,1]之间,消极词汇的情感分数在[?1,0)之间;预设积极阈值大于0,预设消极阈值小于0。[0071] 一种实现方式中,通过预设积极阈值和预设消极阈值,将情绪极性明显的文本筛选出来并添加数据标注,有助于更清晰地理解文本的情感倾向,并为智能体模型训练提供了高质量的有标注数据,解决了人工标注时间长、成本高的问题。[0072] 一种实现方式中,预设积极阈值和预设消极阈值由模型训练的结果决定。例如,若模型在训练和测试过程中发现了过拟合现象,则适当地降低预设积极阈值和提高预设消极阈值。[0073] 在一个实施例中,参见图2,在图1的基础上步骤S104包括:[0074] S1041,初始化训练环境,以使智能体根据环境状态从动作区间中选择动作。[0075] S1042,根据智能体的动作和环境状态给出奖励和新的环境状态,以使智能体根据奖励更新策略函数并根据新的环境状态选择动作,直至达到预设停止条件。[0076] 其中,动作区间为{?1,1},?1表示选择消极标注,1表示选择积极标注;环境状态由第三数据集中的文本向量化表示;预设停止条件包括最大训练轮数和/或收敛函数收敛。[0077] 一种实现方式中,利用有标注的文本对深度强化学习模型进行训练,得到的智能体具有判断文本情感倾向的能力。这种模型训练方式能够充分利用深度学习的特征提取能力和强化学习的决策优化能力,从而得到更加准确和鲁棒的用于判断文本情感倾向的智能体。[0078] 在一个实施例中,在图2的基础上,步骤S1042包括:[0079] 步骤一,若智能体的动作与环境状态对应的文本的数据标注一致,则给予正奖励,[0080] rewarda=100*p[0081] 步骤二,若智能体的动作选择与环境状态对应的文本的数据标注不一致,则给予负奖励,[0082] rewardn=?1000*p[0083] 其中,rewarda是所求正奖励,rewardn是所求负奖励,p是智能体选择该动作的概率。[0084] 一种实现方式中,根据智能体选择动作的正确性和概率决定奖励,使得智能体的学习朝着提高决策的确定性方向迭代;由于奖励与动作概率相关,智能体在训练初期可能会倾向于探索不同的动作,此时它的决策较为随机,随着训练的进行,智能体会逐渐学会选择更准确的动作,同时保持一定的探索性,以避免过早陷入局部最优解。[0085] 在一个实施例中,在图2的基础上,步骤S1041之前包括:[0086] 步骤一,对第三目标数据集中的文本进行分词、去除、填充或截断,得到长度相等的规范化文本。[0087] 步骤二,通过词嵌入的方法将规范化文本中的词汇转换为固定维度的向量。[0088] 步骤三,将向量化的各文本作为环境状态表示放入训练集中。[0089] 一种实现方式中,通过对文本进行规范化、向量化处理,可以确保输入数据的一致性,便于模型处理。[0090] 在一个实施例中,在图1的基础上,步骤S105包括:[0091] 步骤一,修改智能体的输出规则为输出选择每个动作的概率。[0092] 步骤二,根据智能体对训练集的测试数据,确定判断阈值Pt。[0093] 步骤三,将第二目标数据集中的各文本向量化,输入给智能体,得到选择1的概率P1和选择?1的概率P2。[0094] 步骤四,若P1>P2且P1>Pt,则为该文本添加积极的数据标注;若P2>P1且P2>Pt,则为该文本添加消极的数据标注;若P1
[0095] 一种实现方式中,根据智能体对训练集的测试数据,确定判断阈值Pt。例如,若在测试过程中,智能体做出动作选择的概率最小值为0.7,则将Pt设置为0.7,从而提高对文本进行情绪判断的确定性和准确性。[0096] 本发明实施例提供了一种基于大数据的资讯信息提取装置。参见图3,图3为本发明实施例提供的一种基于大数据的资讯信息提取装置的结构图。该装置包括:[0097] 文本选择模块,用于从资讯数据库中提取与预设主题词关联度大于第一预设阈值的文本,作为第一目标文本放入第一目标数据集。[0098] 一次标注模块,用于计算第一目标数据集中各文本的情感分数,并添加数据标注,还用于将数据标注为中立的第一目标文本作为第二目标文本放入第二目标数据集;将数据标注为积极的和消极的第一目标文本作为第三目标文本放入第三目标数据集。[0099] 模型训练模块,用于利用第三目标数据集中的文本训练深度强化学习模型,得到用于判断文本情感倾向的智能体。[0100] 二次标注模块,用于通过智能体为第二目标数据集中各文本做二次数据标注,并将二次数据标注后的文本放入第四目标数据集。[0101] 数据分析模块,用于将第三目标数据集和第四目标数据集整合分析,得到资讯数据库中与预设主题相关的情感倾向信息。[0102] 基于本实施例提供的一种基于大数据的资讯信息提取装置,通过对目标文本进行情感分数计算和数据标注,将目标文本分别处理,有助于更准确地确定文本的情感倾向,并为智能体模型训练提供了高质量的有标注数据,解决了人工标注时间长、成本高的问题;通过智能体对情感极性不明显的目标文本进行二次标注,进一步提高了情感分析的准确性。[0103] 以上对本发明的一个实施例进行了详细说明,但所述内容仅为本发明的较佳实施例,不能被认为用于限定本发明的实施范围。凡依本发明申请范围所作的均等变化与改进等,均应仍归属于本发明的专利涵盖范围之内。

专利地区:安徽

专利申请日期:2024-02-20

专利公开日期:2024-11-29

专利公告号:CN118035444B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载