开云优惠体育网页版入口

开云优惠体育网页版入口:一种开云优惠体育网页版入口技术信息文档录入处理方法及系统发明专利

更新时间:2026-09-13
一种开云优惠体育网页版入口技术信息文档录入处理方法及系统发明专利 专利申请类型:发明专利;
地区:广东-湛江;
源自:湛江高价值专利检索信息库;

专利名称:一种开云优惠体育网页版入口技术信息文档录入处理方法及系统

专利类型:发明专利

专利申请号:CN202411389820.4

专利申请(专利权)人:广东海洋大学
权利人地址:广东省湛江市麻章区海大路1号

专利发明(设计)人:杨铁军,林慧贤,杨鹏,胡俊桥,张剑,刘耀鸿

专利摘要:本发明提供了一种开云优惠体育网页版入口技术信息文档录入处理方法及系统,方法包括:采用自然语言处理技术,对目标文档的非结构化文本信息进行分析;提取内容文本的局部语义特征和长距离语义特征;基于特征进行多尺度语义分割,获得多种粒度的信息单元;并根据单元信息构建知识图谱,得到结构化表示信息;根据各所述信息单元在目标文档的权重,分别将对应文档内容进行录入处理。本发明通过多尺度语义分割,得到多种粒度的信息单元,确定各信息单元在目标文档中的权重,可以按照不同的粒度进行对应的录入处理,避免关键信息丢失或非关键信息冗余,提高录入质量和效率。

主权利要求:
1.一种开云优惠体育网页版入口技术信息文档录入处理方法,其特征在于,包括:
采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;
提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;
基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;
根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;
提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。
2.如权利要求1所述的一种开云优惠体育网页版入口技术信息文档录入处理方法,其特征在于,所述采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本,包括:对所述非结构化文本进行分词处理,得到若干词语;
识别分词结果中每个词语的词性;根据各词语的词性,对各所述词语进行命名实体识别,得到特定实体信息;
获取各所述词语在所述目标文档中的词频,从而根据所述特定实体信息和所述词频,提取所述目标文档的关键词;
采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构;采用SnowNLP分析库对所述目标文档的文本进行分析,得到情感倾向信息;
基于所述主题结构、情感倾向信息和各关键词,生成所述内容文本。
3.如权利要求1所述的一种开云优惠体育网页版入口技术信息文档录入处理方法,其特征在于,所述根据所述实体信息、属性信息和关系信息构建知识图谱,包括:根据所述实体信息,识别各所述信息单元的实体种类,获得每个种类的实体特征集合;
根据所述属性信息,对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链;
根据所述关系信息,获取关系强度和关系建立时间;根据关系强度、关系建立时间以及所述初步关系链,建立所述知识图谱。
4.如权利要求1所述的一种开云优惠体育网页版入口技术信息文档录入处理方法,其特征在于,所述结构化表示信息包括层次权重;所述利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重,包括:通过所述上下文信息和所述全局语义特征,确定所述信息单元在语境中的关联权重;
获取所述信息单元的统计特征,根据所述统计特征,确定所述信息单元的位置权重;
根据所述层次权重、在语境中的关联权重和所述位置权重,计算得到所述信息单元在所述目标文档中的权重。
5.如权利要求1所述的一种开云优惠体育网页版入口技术信息文档录入处理方法,其特征在于,所述根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理,包括:获取第一权重阈值和第二权重阈值;其中,所述第一权重阈值小于所述第二权重阈值;
在所述信息单元在所述目标文档的权重大于所述第二权重阈值时,采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理;
在所述信息单元在所述目标文档的权重大于所述第一权重阈值,并且小于等于所述第二权重阈值时,采用辅助录入的方式对信息单元对应文档内容进行录入处理;
在所述信息单元在所述目标文档的权重小于等于所述第一权重阈值时,采用批量录入的方式对信息单元对应文档内容进行录入处理。
6.一种开云优惠体育网页版入口技术信息文档录入处理系统,其特征在于,包括分析模块、特征提取模块、识别模块、表示模块和录入处理模块;其中,所述分析模块,用于采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;
所述特征提取模块,用于提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;
所述识别模块,用于基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;
所述表示模块,用于根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;
所述录入处理模块,用于提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。
7.如权利要求6所述的一种开云优惠体育网页版入口技术信息文档录入处理系统,其特征在于,所述分析模块采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本,包括:所述分析模块对所述非结构化文本进行分词处理,得到若干词语;
识别分词结果中每个词语的词性;根据各词语的词性,对各所述词语进行命名实体识别,得到特定实体信息;
获取各所述词语在所述目标文档中的词频,从而根据所述特定实体信息和所述词频,提取所述目标文档的关键词;
采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构;采用SnowNLP分析库对所述目标文档的文本进行分析,得到情感倾向信息;
基于所述主题结构、情感倾向信息和各关键词,生成所述内容文本。
8.如权利要求6所述的一种开云优惠体育网页版入口技术信息文档录入处理系统,其特征在于,所述表示模块根据所述实体信息、属性信息和关系信息构建知识图谱,包括:所述表示模块根据所述实体信息,识别各所述信息单元的实体种类,获得每个种类的实体特征集合;
根据所述属性信息,对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链;
根据所述关系信息,获取关系强度和关系建立时间;根据关系强度、关系建立时间以及所述初步关系链,建立所述知识图谱。
9.如权利要求6所述的一种开云优惠体育网页版入口技术信息文档录入处理系统,其特征在于,所述结构化表示信息包括层次权重;所述录入处理模块利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重,包括:所述录入处理模块通过所述上下文信息和所述全局语义特征,确定所述信息单元在语境中的关联权重;
获取所述信息单元的统计特征,根据所述统计特征,确定所述信息单元的位置权重;
根据所述层次权重、在语境中的关联权重和所述位置权重,计算得到所述信息单元在所述目标文档中的权重。
10.如权利要求6所述的一种开云优惠体育网页版入口技术信息文档录入处理系统,其特征在于,所述录入处理模块根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理,包括:所述录入处理模块获取第一权重阈值和第二权重阈值;其中,所述第一权重阈值小于所述第二权重阈值;
在所述信息单元在所述目标文档的权重大于所述第二权重阈值时,采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理;
在所述信息单元在所述目标文档的权重大于所述第一权重阈值,并且小于等于所述第二权重阈值时,采用辅助录入的方式对信息单元对应文档内容进行录入处理;
在所述信息单元在所述目标文档的权重小于等于所述第一权重阈值时,采用批量录入的方式对信息单元对应文档内容进行录入处理。 说明书 : 一种开云优惠体育网页版入口技术信息文档录入处理方法及系统技术领域[0001] 本发明申请涉及数据处理领域,尤其涉及一种开云优惠体育网页版入口技术信息文档录入处理方法及系统。背景技术[0002] 在开云优惠体育网页版入口技术信息文档录入处理的过程中,由于文档往往包含大量非结构化的文本信息、例如自然语言描述、图标和/或公式等,这些内容缺乏明确的语义结构和关联关系,难以直接应用于信息的提取、组织和检索。目前市面上的文档录入方法主要依赖文字识别或图像识别,开云优惠体育网页版入口技术文档中的关键信息分布不均,重要程度不同,如果按照统一的粒度进行处理,会导致关键信息丢失或非关键信息冗余,影响录入质量和效率。发明内容[0003] 本发明申请提供了一种开云优惠体育网页版入口技术信息文档录入处理方法及系统,以解决如何提高录入质量和效率的技术问题。[0004] 为了解决上述技术问题,本发明申请提供了一种开云优惠体育网页版入口技术信息文档录入处理方法,包括:[0005] 采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;[0006] 提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;[0007] 基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;[0008] 根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;[0009] 提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。[0010] 作为优选方案,所述采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本,包括:[0011] 对所述非结构化文本进行分词处理,得到若干词语;[0012] 识别分词结果中每个词语的词性;根据各词语的词性,对各所述词语进行命名实体识别,得到特定实体信息;[0013] 获取各所述词语在所述目标文档中的词频,从而根据所述特定实体信息和所述词频,提取所述目标文档的关键词;[0014] 采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构;采用SnowNLP分析库对所述目标文档的文本进行分析,得到情感倾向信息;[0015] 基于所述主题结构、情感倾向信息和各关键词,生成所述内容文本。[0016] 作为优选方案,所述采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构,包括:[0017] 采用LDA算法对所述目标文档的文本进行分析,获得主题概率分布情况,进而得到各主题词在所述目标文档中的概率值;[0018] 获取所述目标文档的业务领域信息,根据所述业务领域信息,通过双重点互信息方法,获取各所述主题词在目标业务领域的相关程度值;[0019] 根据所述相关程度值和所述主题词在所述目标文档中的概率值,对所述目标文档进行主题建模,得到所述目标文档的文本主题类别,进而得到所述目标文档的主题结构。[0020] 作为优选方案,所述根据所述实体信息、属性信息和关系信息构建知识图谱,包括:[0021] 根据所述实体信息,识别各所述信息单元的实体种类,获得每个种类的实体特征集合;[0022] 根据所述属性信息,对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链;[0023] 根据所述关系信息,获取关系强度和关系建立时间;根据关系强度、关系建立时间以及所述初步关系链,建立所述知识图谱。[0024] 作为优选方案,所述结构化表示信息包括层次权重;所述利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重,包括:[0025] 通过所述上下文信息和所述全局语义特征,确定所述信息单元在语境中的关联权重;[0026] 获取所述信息单元的统计特征,根据所述统计特征,确定所述信息单元的位置权重;[0027] 根据所述层次权重、在语境中的关联权重和所述位置权重,计算得到所述信息单元在所述目标文档中的权重。[0028] 作为优选方案,所述根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理:[0029] 获取第一权重阈值和第二权重阈值;其中,所述第一权重阈值小于所述第二权重阈值;[0030] 在所述信息单元在所述目标文档的权重大于所述第二权重阈值时,采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理;[0031] 在所述信息单元在所述目标文档的权重大于所述第一权重阈值,并且小于等于所述第二权重阈值时,采用辅助录入的方式对信息单元对应文档内容进行录入处理;[0032] 在所述信息单元在所述目标文档的权重小于等于所述第一权重阈值时,采用批量录入的方式对信息单元对应文档内容进行录入处理。[0033] 相应的,本发明实施例还提供了一种开云优惠体育网页版入口技术信息文档录入处理系统,包括分析模块、特征提取模块、识别模块、表示模块和录入处理模块;其中,[0034] 所述分析模块,用于采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;[0035] 所述特征提取模块,用于提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;[0036] 所述识别模块,用于基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;[0037] 所述表示模块,用于根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;[0038] 所述录入处理模块,用于提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。[0039] 作为优选方案,所述分析模块采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本,包括:[0040] 所述分析模块对所述非结构化文本进行分词处理,得到若干词语;[0041] 识别分词结果中每个词语的词性;根据各词语的词性,对各所述词语进行命名实体识别,得到特定实体信息;[0042] 获取各所述词语在所述目标文档中的词频,从而根据所述特定实体信息和所述词频,提取所述目标文档的关键词;[0043] 采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构;采用SnowNLP分析库对所述目标文档的文本进行分析,得到情感倾向信息;[0044] 基于所述主题结构、情感倾向信息和各关键词,生成所述内容文本。[0045] 作为优选方案,所述分析模块采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构,包括:[0046] 所述分析模块采用LDA算法对所述目标文档的文本进行分析,获得主题概率分布情况,进而得到各主题词在所述目标文档中的概率值;[0047] 获取所述目标文档的业务领域信息,根据所述业务领域信息,通过双重点互信息方法,获取各所述主题词在目标业务领域的相关程度值;[0048] 根据所述相关程度值和所述主题词在所述目标文档中的概率值,对所述目标文档进行主题建模,得到所述目标文档的文本主题类别,进而得到所述目标文档的主题结构。[0049] 作为优选方案,所述表示模块根据所述实体信息、属性信息和关系信息构建知识图谱,包括:[0050] 所述表示模块根据所述实体信息,识别各所述信息单元的实体种类,获得每个种类的实体特征集合;[0051] 根据所述属性信息,对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链;[0052] 根据所述关系信息,获取关系强度和关系建立时间;根据关系强度、关系建立时间以及所述初步关系链,建立所述知识图谱。[0053] 作为优选方案,所述结构化表示信息包括层次权重;所述录入处理模块利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重,包括:[0054] 所述录入处理模块通过所述上下文信息和所述全局语义特征,确定所述信息单元在语境中的关联权重;[0055] 获取所述信息单元的统计特征,根据所述统计特征,确定所述信息单元的位置权重;[0056] 根据所述层次权重、在语境中的关联权重和所述位置权重,计算得到所述信息单元在所述目标文档中的权重。[0057] 作为优选方案,所述录入处理模块根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理,包括:[0058] 所述录入处理模块获取第一权重阈值和第二权重阈值;其中,所述第一权重阈值小于所述第二权重阈值;[0059] 在所述信息单元在所述目标文档的权重大于所述第二权重阈值时,采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理;[0060] 在所述信息单元在所述目标文档的权重大于所述第一权重阈值,并且小于等于所述第二权重阈值时,采用辅助录入的方式对信息单元对应文档内容进行录入处理;[0061] 在所述信息单元在所述目标文档的权重小于等于所述第一权重阈值时,采用批量录入的方式对信息单元对应文档内容进行录入处理。[0062] 相比于现有技术,本发明申请具有如下有益效果:[0063] 本发明实施例提供了一种开云优惠体育网页版入口技术信息文档录入处理方法及系统,所述开云优惠体育网页版入口技术信息文档录入处理方法包括:采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。本发明实施例通过多尺度语义分割,得到多种粒度的信息单元,确定各信息单元在目标文档中的权重,可以按照不同的粒度进行对应的录入处理,避免关键信息丢失或非关键信息冗余,提高录入质量和效率;此外,通过识别信息单元的实体信息、属性信息和关系信息,构建知识图谱,可以得到不同层次的结构化表示信息,结合上下文信息、全局语义特征,确定信息单元的权重,可以进一步增强各信息单元之间的关联性,提高对信息单元重要性或权重识别的准确性,在录入过程中对关键信息实现准确识别,从而进一步提高了录入质量。附图说明[0064] 图1:为本发明提供的开云优惠体育网页版入口技术信息文档录入处理方法的一种实施例的流程示意图。[0065] 图2:为本发明提供的开云优惠体育网页版入口技术信息文档录入处理系统的一种实施例的流程示意图。具体实施方式[0066] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0067] 实施例一[0068] 请参照图1,图1为本发明申请提供的一种开云优惠体育网页版入口技术信息文档录入处理方法,包括步骤S1至步骤S5;其中,[0069] 步骤S1,采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档。[0070] 在本步骤中,自然语言处理(NaturalLanguageProcessing,简称NLP)是一门交叉学科,它结合了计算机科学、人工智能和语言学的知识,旨在使计算机能够理解、解释和生成人类语言。NLP的核心是构建能够理解和交流自然语言的算法,从而缩小人与机器之间的交流鸿沟。[0071] 所述采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本,包括:对所述非结构化文本进行分词处理,得到若干词语;识别分词结果中每个词语的词性;根据各词语的词性,对各所述词语进行命名实体识别,得到特定实体信息;获取各所述词语在所述目标文档中的词频,从而根据所述特定实体信息和所述词频,提取所述目标文档的关键词;采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构;采用SnowNLP分析库对所述目标文档的文本进行分析,得到情感倾向信息;基于所述主题结构、情感倾向信息和各关键词,生成所述内容文本。[0072] 示例性地,从非结构化文本中提取初步的语料,可以通过自然语言处理工具如Python的NLTK库来实现。假设有一段中文文本,使用分词工具进行分词处理,可以将句子“XX公司在YY地点设了一家新店”中的“XX公司”、“在”、“YY地点”、“开设”、“了”、“一家”和“新店”等词提取出来。[0073] 然后,通过使用词性标注库如HanLP,可以识别词语的词性。例如“XX地点/nnt”、“YY地区/ns”等,其中“nnt”代表专有名称,“ns”代表地名。完成词性识别后,可以进行命名实体识别(NER),以识别文本中的人名、地名和机构名等特定实体信息。进而,通过计算词频来进行频率分析,使用Python的collections模块,可以得到每个词的出现频次。从而确定所述目标文档的关键词。此外,通过主题结构、情感倾向信息和各关键词,生成所述内容文本。譬如,假设情感分析显示目标文档的情感倾向在开云优惠体育网页版入口技术信息文档中一般偏向中性,即目标文档主要以陈述事实或者陈述研究信息为主。[0074] 在该优选实施方式中,LDA算法指LatentDirichletAllocation算法,可以用于对目标文档进行主题分析,获得主题结构。[0075] 在一种优选实施方式中,所述采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构,包括:[0076] 采用LDA算法对所述目标文档的文本进行分析,获得主题概率分布情况,进而得到各主题词在所述目标文档中的概率值,譬如主题词可以分别为“市场”、“销售”、“增长”等词组成,也可能由“技术”、“创新”、“研发”等组成。[0077] 获取所述目标文档的业务领域信息,根据所述业务领域信息,通过双重点互信息(PMI)或者余弦相似度方法,获取各所述主题词在目标业务领域的相关程度值。[0078] 根据所述相关程度值和所述主题词在所述目标文档中的概率值,对所述目标文档进行主题建模,得到所述目标文档的文本主题类别,进而得到所述目标文档的主题结构。[0079] 通过上述分析,可以获取文本的潜在主题信息,有助于在科研或产品研发等具体领域进行有针对性的内容分析和决策支持,确保主题结构的准确性和实用性。[0080] 步骤S2,提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征。[0081] 在本步骤中,可以采用卷积神经网络(CNN)对内容文本进行局部特征提。袢∧谌菸谋镜木植坑镆逄卣,得到的局部语义特征输入到长短时记忆网络中。[0082] 如果文本中存在长距离依赖关系,那么长短时记忆网络捕捉并建模这些关系,得到长距离语义特征。[0083] 示例性地,假设输入的内容文本被分成多个句子,每个句子被编码为长度为100的词向量序列,卷积层使用3个不同的卷积核,分别为3、4、5,卷积核数量设为128,通过激活函数ReLU产生局部语义特征矩阵。[0084] 这样,在获得局部语义特征时,可以得到合适的感受野,以确保捕捉到关键的局部语义特征。此外,通过设定不同的卷积层数,可以得到网络在提取局部特征时的不同抽象层次,根据业务需求判断最优的卷积层数,以便在特征提取上达到最优平衡。并且,根据具体业务需要采用最大池化或平均池化等不同的池化方式,获取局部特征的聚合效果,从而通过判断保留信息量的不同,确定适合的池化方式,保证在特征简化的同时不丢失重要信息。[0085] 接着,这些局部语义特征被输入到长短时记忆网络(LSTM)中,以捕捉文本中的长距离依赖关系。[0086] 该长短时记忆网络的隐藏层维度可以为256,其可以有效捕捉到段落或者句子之间的语义关系,得到长距离语义特征。[0087] 这样,可以获取对于长距离依赖关系的建模能力,从而判断隐藏单元数量是否足以捕捉复杂的依赖关系,确保网络在处理数据时的有效性。[0088] 步骤S3,基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息。[0089] 在本步骤中,基于所述长距离语义特征进行多尺度语义分割,可以获得不同粒度的语义信息单元。通过分析每个语义信息单元的内容特性,自适应调整信息单元的粒度大。纬啥嗖愦蔚男畔⒔峁,若信息结构中存在显著的语义层次,则进行层次化信息表示(如步骤S4所述的结构化表示信息),构建从细粒度到粗粒度的多层次信息结构。[0090] 示例性地,可以采用kmeans聚类算法对上述长距离语义特征进行分析,初始聚类中心为5个。通过迭代更新,可以将基于长距离语义特征进行分割,得到不同的语义信息单元。在分割过程中,可以考虑信息单元的TFTDF值,例如某单元的TFTDF值明显高于其他单元,则可缩小粒度以捕捉细节信息。[0091] 通过识别各所述信息单元,可以得到对应的单元信息,所述单元信息包括实体信息、属性信息和关系信息。[0092] 譬如,识别各所述信息单元的核心实体,可以得到实体列表。对识别出的实体进行分类,可以得到每个实体的具体类型,得到实体信息。通过属性抽取算法,从文本中提取出与实体相关的属性信息,可以用于分析实体的属性特征。通过关系抽取算法,可以识别实体之间的关系,得到关系信息。此外,还可以考虑通过上下位关系推理,分析实体类型与关系类型的层次结构,得到上下位关系信息,通过属性传递推理,分析实体关系中的属性传递性,补充潜在的属性信息等,以确:笮街鑃4准确构建知识图谱,确保知识图谱的精细化。[0093] 步骤S4,根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息。[0094] 在一种优选实施方式中,根据所述实体信息,识别各所述信息单元的实体种类,获得每个种类的实体特征集合;根据所述属性信息,对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链;根据所述关系信息,获取关系强度和关系建立时间;根据关系强度、关系建立时间以及所述初步关系链,建立所述知识图谱。[0095] 譬如,根据实体信息,可以识别信息单元的实体种类,例如人物、地点、组织机构等实体类别,得到所述知识图谱的基本实体类型。进而,基于人物的姓名、出生日期等的属性信息,可以对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链,根据关系信息,获得关系强度和关系建立时间,进而在预设的约束条件下,建立所述知识图谱。[0096] 其中,所述约束条件可以根据业务逻辑和数据一致性要求,采用约束规则分析,基于实体、属性、关系需要遵循的规则得到,以确保知识一致性并获得准确的约束规则。[0097] 基于所述知识图谱和各所述单元信息,通过语义相关性分析、上下文理解等,使用图神经网络(GNN)识别文本结构特征,解析出文本的逻辑结构和语义层次,得到结构化表示信息。[0098] 步骤S5,提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。[0099] 在本步骤中,所述结构化表示信息包括层次权重;所述利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重,包括:通过所述上下文信息和所述全局语义特征,确定所述信息单元在语境中的关联权重;获取所述信息单元的统计特征,根据所述统计特征,确定所述信息单元的位置权重;根据所述层次权重、在语境中的关联权重和所述位置权重,计算得到所述信息单元在所述目标文档中的权重。[0100] 其中,信息单元在所述目标文档中的权重可以理解为基于所述层次权重、在语境中的关联权重和所述位置权重的综合权重,代表了单个信息单元在目标文档中的重要程度或关键程度,可以帮助确定具体的录入方式,为后续的录入策略提供依据。[0101] 比如,一个信息单元的权重较高,则该信息单元应该采用相对精细化的录入方式,或者应考虑优先录入。[0102] 在一些优选实施方式中,所述根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理,包括:[0103] 获取第一权重阈值和第二权重阈值;其中,所述第一权重阈值小于所述第二权重阈值。[0104] 在所述信息单元在所述目标文档的权重大于所述第二权重阈值时,采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理。[0105] 在所述信息单元在所述目标文档的权重大于所述第一权重阈值,并且小于等于所述第二权重阈值时,采用辅助录入的方式对信息单元对应文档内容进行录入处理。[0106] 在所述信息单元在所述目标文档的权重小于等于所述第一权重阈值时,采用批量录入的方式对信息单元对应文档内容进行录入处理。[0107] 这样,针对不同权重的信息单元,可以通过设计差异化的信息录入方式,确保目标文档的录入效率以及质量均得到保障,避免遗漏关键信息。[0108] 对于权重相对高的信息单元,可以采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理,或者,采用精细化的自动校验和人工补充相结合的方式;对于中等权重的信息单元,可以采用半自动录入或者辅助录入方式;对于低权重的信息单元,可以采用全自动的批量处理方法。[0109] 进一步地,可以设置质量评估指标,如准确率、完整性和一致性等,对录入结果进行自动评估,生成目标文档的质量反馈开云优惠体育网页版入口。根据质量反。欢系髡畔⒘6然、结构化表示和录入策略,更新深度学习模型的参数和知识库的内容,提高处理精度,形成闭环的持续改进机制。[0110] 相应的,参照图2,本发明实施例还提供了一种开云优惠体育网页版入口技术信息文档录入处理系统,包括分析模块201、特征提取模块202、识别模块203、表示模块204和录入处理模块205;其中,[0111] 所述分析模块201,用于采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;[0112] 所述特征提取模块202,用于提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;[0113] 所述识别模块203,用于基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;[0114] 所述表示模块204,用于根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;[0115] 所述录入处理模块205,用于提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。[0116] 作为优选方案,所述分析模块201采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本,包括:[0117] 所述分析模块201对所述非结构化文本进行分词处理,得到若干词语;[0118] 识别分词结果中每个词语的词性;根据各词语的词性,对各所述词语进行命名实体识别,得到特定实体信息;[0119] 获取各所述词语在所述目标文档中的词频,从而根据所述特定实体信息和所述词频,提取所述目标文档的关键词;[0120] 采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构;采用SnowNLP分析库对所述目标文档的文本进行分析,得到情感倾向信息;[0121] 基于所述主题结构、情感倾向信息和各关键词,生成所述内容文本。[0122] 作为优选方案,所述分析模块201采用LDA算法对所述目标文档的文本进行分析,确定所述目标文档的主题结构,包括:[0123] 所述分析模块201采用LDA算法对所述目标文档的文本进行分析,获得主题概率分布情况,进而得到各主题词在所述目标文档中的概率值;[0124] 获取所述目标文档的业务领域信息,根据所述业务领域信息,通过双重点互信息方法,获取各所述主题词在目标业务领域的相关程度值;[0125] 根据所述相关程度值和所述主题词在所述目标文档中的概率值,对所述目标文档进行主题建模,得到所述目标文档的文本主题类别,进而得到所述目标文档的主题结构。[0126] 作为优选方案,所述表示模块204根据所述实体信息、属性信息和关系信息构建知识图谱,包括:[0127] 所述表示模块204根据所述实体信息,识别各所述信息单元的实体种类,获得每个种类的实体特征集合;[0128] 根据所述属性信息,对每个实体特征集合进行验证,在通过验证后得到实体间的初步关系链;[0129] 根据所述关系信息,获取关系强度和关系建立时间;根据关系强度、关系建立时间以及所述初步关系链,建立所述知识图谱。[0130] 作为优选方案,所述结构化表示信息包括层次权重;所述录入处理模块205利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重,包括:[0131] 所述录入处理模块205通过所述上下文信息和所述全局语义特征,确定所述信息单元在语境中的关联权重;[0132] 获取所述信息单元的统计特征,根据所述统计特征,确定所述信息单元的位置权重;[0133] 根据所述层次权重、在语境中的关联权重和所述位置权重,计算得到所述信息单元在所述目标文档中的权重。[0134] 作为优选方案,所述录入处理模块205根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理,包括:[0135] 所述录入处理模块205获取第一权重阈值和第二权重阈值;其中,所述第一权重阈值小于所述第二权重阈值;[0136] 在所述信息单元在所述目标文档的权重大于所述第二权重阈值时,采用包含自动校验的录入方式对信息单元对应文档内容进行录入处理;[0137] 在所述信息单元在所述目标文档的权重大于所述第一权重阈值,并且小于等于所述第二权重阈值时,采用辅助录入的方式对信息单元对应文档内容进行录入处理;[0138] 在所述信息单元在所述目标文档的权重小于等于所述第一权重阈值时,采用批量录入的方式对信息单元对应文档内容进行录入处理。[0139] 相比于现有技术,本发明申请具有如下有益效果:[0140] 本发明实施例提供了一种开云优惠体育网页版入口技术信息文档录入处理方法及系统,所述开云优惠体育网页版入口技术信息文档录入处理方法包括:采用自然语言处理技术,对目标文档的非结构化文本信息进行分析,得到内容文本;其中,所述目标文档为开云优惠体育网页版入口技术信息文档;提取所述内容文本的局部语义特征;将所述局部语义特征输入预设长短时记忆网络,得到长距离语义特征;基于所述长距离语义特征进行多尺度语义分割,获得多种粒度的信息单元;并识别各所述信息单元的单元信息,所述单元信息包括实体信息、属性信息和关系信息;根据所述实体信息、属性信息和关系信息构建知识图谱,进而根据所述知识图谱和各所述单元信息,得到结构化表示信息;提取所述目标文档的上下文信息和全局语义特征,利用所述上下文信息、全局语义特征和结构化表示信息,确定各信息单元在所述目标文档的权重;根据各所述信息单元在所述目标文档的权重,分别对各所述信息单元对应文档内容进行录入处理。本发明实施例通过多尺度语义分割,得到多种粒度的信息单元,确定各信息单元在目标文档中的权重,可以按照不同的粒度进行对应的录入处理,避免关键信息丢失或非关键信息冗余,提高录入质量和效率;此外,通过识别信息单元的实体信息、属性信息和关系信息,构建知识图谱,可以得到不同层次的结构化表示信息,结合上下文信息、全局语义特征,确定信息单元的权重,可以进一步增强各信息单元之间的关联性,提高对信息单元重要性或权重识别的准确性,在录入过程中对关键信息实现准确识别,从而进一步提高了录入质量。[0141] 以上所述的具体实施例,对本发明的目的、技术方案和有益效果进行了进一步的详细说明,应当理解,以上所述仅为本发明的具体实施例而已,并不用于限定本发明的保护范围。特别指出,对于本领域技术人员来说,凡在本发明的精神和原则之内,所做的任何修改、等同替换、改进等,均应包含在本发明的保护范围之内。

专利地区:广东

专利申请日期:2024-10-08

专利公开日期:2024-11-29

专利公告号:CN118886487B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载