产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:一种数据集成服务智能管理方法
专利类型:发明专利
专利申请号:CN202411337197.8
专利申请(专利权)人:山东凌然智能开云优惠体育网页版入口有限公司
权利人地址:山东省烟台市中国(山东)自由贸易试验区烟台片区烟台开发区万寿山路5号内1号楼406室
专利发明(设计)人:刘帅,管国庆,孙炳刚,王立志,任瑞峰,宋志强
专利摘要:本发明涉及数据集成管理领域,具体公开一种数据集成服务智能管理方法,本发明在数据集成前检测各数据源数据的一致性和准确性并进行相应处理,进而保障数据集成后的数据质量,有利于更好地为企业业务决策提供可靠的数据支持;在数据集成前识别各数据源的敏感性数据,并进行数据脱敏,进而确保数据在集成过程中的安全性;根据数据量和数据更新频率,评估数据中台分配计算资源传输数据源数据的优先级,有利于对数据集成的流程和资源进行优化配置,降低数据集成的成本;根据数据集成后数据的访问和下载等使用情况评估数据的价值进而分类标注,有利于企业更好地了解和使用数据、挖掘数据的潜在价值、实现数据资产的有效利用。
主权利要求:
1.一种数据集成服务智能管理方法,其特征在于,包括如下步骤:
步骤一、数据源数据一致性检测处理:获取待集成的各数据源中各数据实体的基本信息,其中基本信息包括存储格式、数据内容、关联规则、更新时间、数据容量,并将待集成的不同数据源之间相同的各数据实体的基本信息进行相互比较,判断待集成的各数据源中各数据实体的基本信息是否符合一致性要求,并进行相应处理;
步骤二、数据源数据准确性检测处理:根据待集成的各数据源中各数据实体的基本信息,判断待集成的各数据源中各数据型数据实体是否符合准确性要求,并进行相应处理;
步骤三、数据源敏感性数据识别处理:识别待集成的各数据源中敏感性的各数据实体,并进行相应处理;
步骤四、数据源数据集成存储:对各数据源的数据进行集成,并存储于数据中台;
步骤五、数据集成资源优化配置:获取历史周期内各数据源集成到数据中台的数据量和各数据源的数据更新频率,分析数据中台分配计算资源传输各数据源数据的优先级系数,并进行反。
步骤六、数据源数据分类及标注:获取评估周期内数据中台内各数据实体的访问信息和下载信息,分析数据中台内各数据实体的价值指数,进一步对数据中台内各数据实体进行分类和标注。
2.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤一的具体分析过程包括:将待集成的各数据源中各数据实体进行相互比对,筛选得到待集成的不同数据源之间相同的各数据实体;
获取待集成的各数据源中各数据实体的存储格式,将待集成的不同数据源之间相同的各数据实体的存储格式进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的存储格式不一致,则待集成的该两个数据源的该数据实体的存储格式不符合一致性要求,进而判断待集成的各数据源中各数据实体的存储格式是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。
3.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤一的具体分析过程还包括:A1、数据种类获。夯袢〈傻母魇菰粗懈魇菔堤宓氖葜掷,得到待集成的不同数据源之间相同的各数据实体的数据种类,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为数值型单项数据,则执行A2,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为数值型数据集合,则执行A3,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为字符型数据,则执行A4,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为数据表,则执行A5;
A2、数值型单项数据一致性分析:将待集成的该两个不同数据源之间相同的该数据实体的数值进行相互比对,若待集成的该两个不同数据源之间相同的该数据实体的数值不同,则待集成的该两个数据源的该数据实体的数据内容不符合一致性要求;
A3、数值型数据集合一致性分析:获取待集成的该两个不同数据源之间相同的该数据实体对应的均值、方差并一一相互比对,若待集成的该两个不同数据源之间相同的该数据实体的均值、方差均相同,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求;
A4、字符型数据一致性分析:将待集成的该两个不同数据源之间相同的该数据实体的各字符串一一进行相互比对,若待集成的该两个不同数据源之间相同的该数据实体的各字符串均相同,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求;
A5、数据表一致性分析:将待集成的该两个不同数据源之间相同的该数据实体的字段数量、各字段名称、各字段类型、各字段长度、各约束条件一一进行相互比对,若待集成的该两个不同数据源之间相同的该数据实体的字段数量、各字段名称、各字段类型、各字段长度、各约束条件均相同,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求;
进而判断待集成的各数据源中各数据实体的数据内容是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。
4.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤一的具体分析过程还包括:获取待集成的各数据源中各数据实体的关联规则,将待集成的不同数据源之间相同的各数据实体的关联规则进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的关联规则不一致,则待集成的该两个数据源的该数据实体的关联规则不符合一致性要求,进而判断待集成的各数据源中各数据实体的关联规则是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源;
获取待集成的各数据源中各数据实体的数据容量,将待集成的不同数据源之间相同的各数据实体的数据容量进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的数据容量不同,则待集成的该两个数据源的该数据实体的数据容量不符合一致性要求,进而判断待集成的各数据源中各数据实体的数据容量是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。
5.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤一的具体分析过程还包括:获取待集成的各数据源中各数据实体的更新时间,将待集成的不同数据源之间相同的各数据实体的更新时间进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的更新时间的间隔时长大于设定阈值,则待集成的该两个数据源的该数据实体的更新时间不符合一致性要求,进而判断待集成的各数据源中各数据实体的更新时间是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。
6.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤二的具体分析过程为:根据待集成的各数据源中各数据实体的基本信息,筛选待集成的各数据源中各数据型数据实体的基本信息,得到待集成的各数据源中各数据型数据实体的数值,提取数据库中存储的待集成的各数据源中各数据型数据实体的历史数值范围,若待集成的某数据源中某数据型数据实体的数值超出其数据实体的历史数值范围,则待集成的该数据源中该数据型数据实体不符合准确性要求,进行拦截,并标注拦截原因类型,返回至原数据源。
7.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤三的具体分析过程为:利用关键词提取技术获取待集成的各数据源中各数据实体的各关键词,并与数据库中存储的敏感性词汇库进行比对,若某数据实体的某关键词属于敏感性词汇库内,则将该数据实体记为敏感性的数据实体,统计待集成的各数据源中敏感性的各数据实体,并进行数据脱敏处理。
8.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤五的具体分析过程为:设定历史周期的时长,获取历史周期内各数据源集成到数据中台的数据量和各数据源的数据更新频率,将其分别记为 ,表示第 个数据源的编号, ,通过分析公式 得到数据中台分配计算资源传输各数据源数据的优先级系数 ,其中 分别表示预设的数据量和数据更新频率的权值, ,表示数据源的数量,并反馈至数据中台。
9.根据权利要求1所述的一种数据集成服务智能管理方法,其特征在于:所述步骤六的具体分析过程包括:设定评估周期的时长,从数据中台调取评估周期内数据中台内各数据实体的访问信息和下载信息,获取评估周期内数据中台内各数据实体的访问次数、访问人数、访问频率,将其分别记为 ,表示第 个数据实体的编号, ,并获取评估周期内数据中台内各数据实体的下载次数、下载人数、下载频率,将其分别记为 ;
通过分析公式 得到数据中台内各
数据实体的价值指数 ,其中 和 分别表示预设的访问次数、访问
人数、访问频率的阈值和下载次数、下载人数、下载频率的阈值, 分别表示预设的访问和下载的权重, 。
10.根据权利要求9所述的一种数据集成服务智能管理方法,其特征在于:所述步骤六的具体分析过程还包括:提取数据库中存储的数据实体各重要程度等级对应的价值指数范围,根据数据中台内各数据实体的价值指数,筛选数据中台内各数据实体的重要程度等级,将数据中台内各数据实体按照相同重要程度等级进行分类,并进行标注。 说明书 : 一种数据集成服务智能管理方法技术领域[0001] 本发明涉及数据集成管理领域,涉及到一种数据集成服务智能管理方法。背景技术[0002] 在当今数字化时代,企业和组织内部各个业务部门以及外部合作伙伴会产生海量的数据,这些数据可能存储在不同的数据库、数据仓库、文件系统等多种数据源中,数据源的类型和数据格式呈现出高度的异构性。企业为了优化业务流程、提高运营效率,需要将不同业务系统的数据进行整合,且随着数据分析和数据驱动决策的重要性日益凸显,企业要想从分散的数据源中快速、准确地获取数据进行分析,这就要求对数据集成进行高效管理,以确保数据的及时性和准确性。[0003] 然而现有的数据集成管理方法在实际应用中仍存在一些局限性和不足之处。[0004] 例如,现有的公开号为CN106408448A的中国专利公开了一种智能业务整合和管理系统,包括管理服务器、数据集成服务器、标准化交换机、多个业务服务器和数据存储器,其中业务服务器通过标准化交换机与数据集成服务器连接;数据集成服务器与管理服务器连接,管理服务器与数据存储器相互连接。该发明提供的智能业务整合和管理系统具有的优点和积极效果是:通过采用全新结构,实现了各级业务管理机构之间的数据整合,使得电网业务系统中的各级业务管理机构不再彼此孤立,由此有效增强了业务协作性,并有效提高了业务效率。[0005] 但是上述专利中存在:1.在对各数据源的数据进行集成之前没有校验检查各数据源数据的质量,如数据的一致性和准确性,进而无法保障数据集成后的数据质量,将不利于更好地为企业业务决策提供可靠的数据支持,还可能发生因数据不一致或有误导致的业务冲突和决策失误等情况。[0006] 2.在对各数据源的数据进行集成过程中,可能涉及到敏感信息的传输和存储,上述专利在数据集成之前缺乏对敏感数据的识别和处理。[0007] 3.上述专利在数据集成后没有进一步进行梳理、分类和标注,如结合数据的使用情况评估数据的价值进而分类标注,将不利于企业更好地了解和使用数据、挖掘数据的潜在价值、实现数据资产的有效利用。发明内容[0008] 针对上述问题,本发明提出了一种数据集成服务智能管理方法,具体技术方案如下:一种数据集成服务智能管理方法,包括如下步骤:步骤一、数据源数据一致性检测处理:获取待集成的各数据源中各数据实体的基本信息,其中基本信息包括存储格式、数据内容、关联规则、更新时间、数据容量,并将待集成的不同数据源之间相同的各数据实体的基本信息进行相互比较,判断待集成的各数据源中各数据实体的基本信息是否符合一致性要求,并进行相应处理。[0009] 步骤二、数据源数据准确性检测处理:根据待集成的各数据源中各数据实体的基本信息,判断待集成的各数据源中各数据型数据实体是否符合准确性要求,并进行相应处理。[0010] 步骤三、数据源敏感性数据识别处理:识别待集成的各数据源中敏感性的各数据实体,并进行相应处理。[0011] 步骤四、数据源数据集成存储:对各数据源的数据进行集成,并存储于数据中台。[0012] 步骤五、数据集成资源优化配置:获取历史周期内各数据源集成到数据中台的数据量和各数据源的数据更新频率,分析数据中台分配计算资源传输各数据源数据的优先级系数,并进行反馈。[0013] 步骤六、数据源数据分类及标注:获取评估周期内数据中台内各数据实体的访问信息和下载信息,分析数据中台内各数据实体的价值指数,进一步对数据中台内各数据实体进行分类和标注。[0014] 相对于现有技术,本发明所述的一种数据集成服务智能管理方法以下有益效果:1.本发明在对各数据源的数据进行集成之前检测各数据源数据的一致性和准确性并进行相应处理,进而保障数据集成后的数据质量,有利于更好地为企业业务决策提供可靠的数据支持,避免发生因数据不一致或有误导致的业务冲突和决策失误等情况。[0015] 2.本发明在对各数据源的数据进行集成之前识别各数据源的敏感性数据,并进行数据脱敏,进而确保数据在集成过程中的安全性,保护企业和用户的隐私信息。[0016] 3.本发明通过获取各数据源集成到数据中台的数据量和各数据源的数据更新频率,评估数据中台分配计算资源传输各数据源数据的优先级,有利于对数据集成的流程和资源进行优化配置,降低数据集成的成本。[0017] 4.本发明根据数据集成后数据的访问和下载等使用情况评估数据的价值进而分类标注,有利于企业更好地了解和使用数据、挖掘数据的潜在价值、实现数据资产的有效利用。附图说明[0018] 为了更清楚地说明本发明实施例的技术方案,下面将对实施例描述所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。[0019] 图1为本发明的方法流程示意图。[0020] 图2为本发明的步骤一中数据内容一致性分析流程示意图。[0021] 图3为本发明的组成框图。具体实施方式[0022] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其它实施例,都属于本发明保护的范围。[0023] 请参阅图1和图3所示,本发明提供的一种数据集成服务智能管理方法,包括如下步骤:步骤一、数据源数据一致性检测处理:获取待集成的各数据源中各数据实体的基本信息,其中基本信息包括存储格式、数据内容、关联规则、更新时间、数据容量,并将待集成的不同数据源之间相同的各数据实体的基本信息进行相互比较,判断待集成的各数据源中各数据实体的基本信息是否符合一致性要求,并进行相应处理。[0024] 作为一种优选方案,所述步骤一的具体分析过程包括:将待集成的各数据源中各数据实体进行相互比对,筛选得到待集成的不同数据源之间相同的各数据实体。[0025] 需要说明的是,不同数据源之间相同的数据实体是指数据实体在除自身数据源之外、还在其他数据源中出现。[0026] 在一个具体实施例中,获取待集成的企业各应用平台系统的数据,将其记为待集成的各数据源的数据。[0027] 需要说明的是,待集成的各数据源的数据包含企业内部数据和企业外部数据,分散于企业各业务部门。[0028] 获取待集成的各数据源中各数据实体的存储格式,将待集成的不同数据源之间相同的各数据实体的存储格式进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的存储格式不一致,则待集成的该两个数据源的该数据实体的存储格式不符合一致性要求,进而判断待集成的各数据源中各数据实体的存储格式是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。[0029] 在一个具体实施例中,某个数据源中某个日期的存储格式是2023?09?20,而另一个数据源中对应日期的存储格式是2023/09/20,这可能会在数据集成时导致一致性问题。[0030] 需要说明的是,若待集成的某数据源的某数据实体的存储格式不符合一致性要求,则标注的拦截原因类型为“存储格式不一致”。[0031] 作为一种优选方案,参阅图2所示,所述步骤一的具体分析过程还包括:A1、数据种类获。夯袢〈傻母魇菰粗懈魇菔堤宓氖葜掷,得到待集成的不同数据源之间相同的各数据实体的数据种类,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为数值型单项数据,则执行A2,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为数值型数据集合,则执行A3,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为字符型数据,则执行A4,若待集成的某两个不同数据源之间相同的某数据实体的数据种类为数据表,则执行A5。[0032] A2、数值型单项数据一致性分析:将待集成的该两个不同数据源之间相同的该数据实体的数值进行相互比对,若待集成的该两个不同数据源之间相同的该数据实体的数值不同,则待集成的该两个数据源的该数据实体的数据内容不符合一致性要求。[0033] 在一个具体实施例中,在两个不同数据源中对比同一产品的销售数量,若一个数据源中记录的是100件,而另一个数据源中记录的是120件,则数据内容不一致。[0034] A3、数值型数据集合一致性分析:获取待集成的该两个不同数据源之间相同的该数据实体对应的均值、方差并一一相互比对,若待集成的该两个不同数据源之间相同的该数据实体的均值、方差均相同,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求。[0035] 在一个具体实施例中,在两个不同数据源中对比同一月销售额数据集,若一个数据源中月销售额数据集的均值为50万,方差为10万,而另一个数据源中月销售额数据集的均值为40万,方差为5万,则数据内容不一致。[0036] 需要说明的是,还可以通过获取待集成的该两个不同数据源之间相同的该数据实体对应的分布直方图形状并相互比对,若待集成的该两个不同数据源之间相同的该数据实体的分布直方图形状相似,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求,如在两个不同数据源中对比产品在不同地区的销售数据,一个数据源中产品在不同地区的销售数据呈现正态分布,而另一个数据源中产品在不同地区的销售数据呈现偏态分布,则数据内容不一致。[0037] A4、字符型数据一致性分析:将待集成的该两个不同数据源之间相同的该数据实体的各字符串一一进行相互比对,若待集成的该两个不同数据源之间相同的该数据实体的各字符串均相同,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求。[0038] 在一个具体实施例中,在两个不同数据源中比较客户的姓名信息,若一个数据源中记录为“张三”,另一个数据源中记录为“张山”,则数据内容存在不一致。[0039] A5、数据表一致性分析:将待集成的该两个不同数据源之间相同的该数据实体的字段数量、各字段名称、各字段类型、各字段长度、各约束条件一一进行相互比对,若待集成的该两个不同数据源之间相同的该数据实体的字段数量、各字段名称、各字段类型、各字段长度、各约束条件均相同,则待集成的该两个数据源的该数据实体的数据内容符合一致性要求,反之,则不符合一致性要求。[0040] 在一个具体实施例中,一个数据源中的客户信息表有“customer_name”字段,而另一个数据源中对应表的对应字段为“client_name”,则数据内容存在不一致。[0041] 在一个具体实施例中,一个数据源中“年龄”字段的数据类型为整数型,而另一个数据源中“年龄”字段的数据类型为字符型,则数据内容存在不一致。[0042] 在一个具体实施例中,约束条件为是否允许为空、是否唯一等。[0043] 进而判断待集成的各数据源中各数据实体的数据内容是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。[0044] 需要说明的是,若待集成的某数据源的某数据实体的数据内容不符合一致性要求,则标注的拦截原因类型为“数据内容不一致”。[0045] 作为一种优选方案,所述步骤一的具体分析过程还包括:获取待集成的各数据源中各数据实体的关联规则,将待集成的不同数据源之间相同的各数据实体的关联规则进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的关联规则不一致,则待集成的该两个数据源的该数据实体的关联规则不符合一致性要求,进而判断待集成的各数据源中各数据实体的关联规则是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。[0046] 在一个具体实施例中,电商数据中根据业务规则,每个订单都应该对应一个有效的客户和一个有效的产品,如果存在订单没有对应的客户或产品信息,或者对应关系不符合业务逻辑,说明数据存在不一致,即关联规则不一致。[0047] 需要说明的是,若待集成的某数据源的某数据实体的关联规则不符合一致性要求,则标注的拦截原因类型为“关联规则不一致”。[0048] 获取待集成的各数据源中各数据实体的数据容量,将待集成的不同数据源之间相同的各数据实体的数据容量进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的数据容量不同,则待集成的该两个数据源的该数据实体的数据容量不符合一致性要求,进而判断待集成的各数据源中各数据实体的数据容量是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。[0049] 需要说明的是,若待集成的某数据源的某数据实体的数据容量不符合一致性要求,则标注的拦截原因类型为“数据容量不一致”。[0050] 需要说明的是,数据容量是指数据占用的存储空间大。绻钜旖洗,则可能存在数据丢失或重复存储等问题。[0051] 作为一种优选方案,所述步骤一的具体分析过程还包括:获取待集成的各数据源中各数据实体的更新时间,将待集成的不同数据源之间相同的各数据实体的更新时间进行相互比较,若待集成的某两个不同数据源之间相同的某数据实体的更新时间的间隔时长大于设定阈值,则待集成的该两个数据源的该数据实体的更新时间不符合一致性要求,进而判断待集成的各数据源中各数据实体的更新时间是否符合一致性要求,若不符合一致性要求,进行拦截,并标注拦截原因类型,返回至原数据源。[0052] 需要说明的是,如果一个数据源中的数据是最新更新的,而另一个数据源中的数据更新时间较早,可能导致数据不一致。例如,在实时库存管理系统中,不同仓库的库存数据更新时间不同,可能会出现某个仓库的库存数据已经更新,而其他仓库的数据尚未同步的情况。[0053] 需要说明的是,若待集成的某数据源的某数据实体的更新时间不符合一致性要求,则标注的拦截原因类型为“更新时间不一致”。[0054] 步骤二、数据源数据准确性检测处理:根据待集成的各数据源中各数据实体的基本信息,判断待集成的各数据源中各数据型数据实体是否符合准确性要求,并进行相应处理。[0055] 作为一种优选方案,所述步骤二的具体分析过程为:根据待集成的各数据源中各数据实体的基本信息,筛选待集成的各数据源中各数据型数据实体的基本信息,得到待集成的各数据源中各数据型数据实体的数值,提取数据库中存储的待集成的各数据源中各数据型数据实体的历史数值范围,若待集成的某数据源中某数据型数据实体的数值超出其数据实体的历史数值范围,则待集成的该数据源中该数据型数据实体不符合准确性要求,进行拦截,并标注拦截原因类型,返回至原数据源。[0056] 需要说明的是,若待集成的某数据源的某数据型数据实体不符合准确性要求,则标注的拦截原因类型为“不准确”。[0057] 在本实施例中,本发明在对各数据源的数据进行集成之前检测各数据源数据的一致性和准确性并进行相应处理,进而保障数据集成后的数据质量,有利于更好地为企业业务决策提供可靠的数据支持,避免发生因数据不一致或有误导致的业务冲突和决策失误等情况。[0058] 步骤三、数据源敏感性数据识别处理:识别待集成的各数据源中敏感性的各数据实体,并进行相应处理。[0059] 作为一种优选方案,所述步骤三的具体分析过程为:利用关键词提取技术获取待集成的各数据源中各数据实体的各关键词,并与数据库中存储的敏感性词汇库进行比对,若某数据实体的某关键词属于敏感性词汇库内,则将该数据实体记为敏感性的数据实体,统计待集成的各数据源中敏感性的各数据实体,并进行数据脱敏处理。[0060] 需要说明的是,数据脱敏是指通过运用移除识别列、转换半识别列、数据替换、数据乱序等技术手段对重点管控数据进行脱敏管理。[0061] 在本实施例中,本发明在对各数据源的数据进行集成之前识别各数据源的敏感性数据,并进行数据脱敏,进而确保数据在集成过程中的安全性,保护企业和用户的隐私信息。[0062] 步骤四、数据源数据集成存储:对各数据源的数据进行集成,并存储于数据中台。[0063] 步骤五、数据集成资源优化配置:获取历史周期内各数据源集成到数据中台的数据量和各数据源的数据更新频率,分析数据中台分配计算资源传输各数据源数据的优先级系数,并进行反馈。[0064] 作为一种优选方案,所述步骤五的具体分析过程为:设定历史周期的时长,获取历史周期内各数据源集成到数据中台的数据量和各数据源的数据更新频率,将其分别记为,表示第 个数据源的编号, ,通过分析公式得到数据中台分配计算资源传输各数据源数据的优先级系数 ,其中 分别表示预设的数据量和数据更新频率的权值, ,表示数据源的数量,并反馈至数据中台。[0065] 需要说明的是,数据中台与各数据源之间传输数据的计算资源是指在数据从各种数据源流向数据中台以及在数据中台内部进行流转和处理的过程中,用于执行数据的抽取、转换、加载等操作相关的计算能力相关的资源。[0066] 在本实施例中,本发明通过获取各数据源集成到数据中台的数据量和各数据源的数据更新频率,评估数据中台分配计算资源传输各数据源数据的优先级,有利于对数据集成的流程和资源进行优化配置,降低数据集成的成本。[0067] 步骤六、数据源数据分类及标注:获取评估周期内数据中台内各数据实体的访问信息和下载信息,分析数据中台内各数据实体的价值指数,进一步对数据中台内各数据实体进行分类和标注。[0068] 作为一种优选方案,所述步骤六的具体分析过程包括:设定评估周期的时长,从数据中台调取评估周期内数据中台内各数据实体的访问信息和下载信息,获取评估周期内数据中台内各数据实体的访问次数、访问人数、访问频率,将其分别记为 ,表示第 个数据实体的编号, ,并获取评估周期内数据中台内各数据实体的下载次数、下载人数、下载频率,将其分别记为 。[0069] 通过分析公式 得到数据中台内各数据实体的价值指数 ,其中 和 分别表示预设的访问次数、访问人数、访问频率的阈值和下载次数、下载人数、下载频率的阈值, 分别表示预设的访问和下载的权重, 。[0070] 作为一种优选方案,所述步骤六的具体分析过程还包括:提取数据库中存储的数据实体各重要程度等级对应的价值指数范围,根据数据中台内各数据实体的价值指数,筛选数据中台内各数据实体的重要程度等级,将数据中台内各数据实体按照相同重要程度等级进行分类,并进行标注。[0071] 在本实施例中,本发明根据数据集成后数据的访问和下载等使用情况评估数据的价值进而分类标注,有利于企业更好地了解和使用数据、挖掘数据的潜在价值、实现数据资产的有效利用。[0072] 以上内容仅仅是对本发明的构思所作的举例和说明,所属本技术领域的技术人员对所描述的具体实施例做各种各样的修改或补充或采用类似的方式替代,只要不偏离发明的构思或者超越本发明所定义的范围,均应属于本发明的保护范围。
专利地区:山东
专利申请日期:2024-09-25
专利公开日期:2024-11-29
专利公告号:CN118885476B