开云优惠体育网页版入口

开云优惠体育网页版入口:基于大数据分析的采集噪声点挖掘方法及系统

更新时间:2026-09-01
基于大数据分析的采集噪声点挖掘方法及系统 专利申请类型:发明专利;
地区:黑龙江-齐齐哈尔;
源自:齐齐哈尔高价值专利检索信息库;

专利名称:基于大数据分析的采集噪声点挖掘方法及系统

专利类型:发明专利

专利申请号:CN202310717597.0

专利申请(专利权)人:刘富
权利人地址:黑龙江省齐齐哈尔市克东县克东镇保安街九委1组

专利发明(设计)人:凌晓华,王晓宇,章熠辉

专利摘要:本发明涉及数据噪声点挖掘技术领域,尤其涉及一种基于大数据分析的采集噪声点挖掘方法及系统。该方法包括以下步骤:对清洗大数据进行数据标准化处理,得到标准化大数据;对标准化大数据进行特征提。玫酱笫萏卣,计算特征矩阵中每个矩阵对应的矩阵方差值,确定特征矩阵中的异常矩阵,构建标准化大数据对应的数据散点图,计算数据散点图中每个数据点之间的距离值,得到数据点距离总值,确定数据散点图中的离散数据点;确定标准化大数据中的噪声数据,提取噪声数据对应的数据信号,计算数据信号对应的信号稀疏值,执行数据噪声点的噪声优化处理,得到噪声优化处理结果。本发明在于提高基于大数据分析的采集噪声点挖掘的准确性。

主权利要求:
1.一种基于大数据分析的采集噪声点挖掘方法,其特征在于,包括以下步骤:步骤S1:获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,得到清洗大数据,根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据;
步骤S2:对所述标准化大数据进行特征提。玫酱笫萏卣,构建所述大数据特征对应的特征矩阵,计算所述特征矩阵中每个矩阵对应的矩阵方差值,根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵,其中,所述计算所述特征矩阵中每个矩阵对应的矩阵方差值,包括:通过下述公式计算所述特征矩阵中每个矩阵对应的矩阵方差值:
其中,表示特征矩阵中每个矩阵对应的矩阵方差值,a表示特征矩阵的矩阵序列号,y表示特征矩阵总数, 表示第a个特征矩阵的矩阵期望值, 表示第a个特征矩阵对应的矩阵值, 表示特征矩阵的平均值;
其中,所述构建所述大数据特征对应的特征矩阵,包括:
对所述大数据特征进行降维处理,得到降维特征,对所述降维特征进行向量转化,得到特征向量;
计算所述特征向量对应的特征向量值,将所述特征向量值作为所述大数据特征对应的特征值;
计算所述特征向量之间的向量相似系数,根据所述向量相似系数和所述特征值,构建所述大数据特征对应的特征矩阵;
其中,所述计算所述特征向量之间的向量相似系数,包括:
通过下述公式计算所述特征向量之间的向量相似系数:
其中,表示特征向量之间的向量相似系数,表示特征向量的序列号,表示特征向量的数量, 表示第b个特征向量对应的向量长度, 表示特征向量中所有向量的长度平均值, 表示第b+1个特征向量对应的向量长度;
步骤S3:对所述标准化大数据进行线性转换,得到大数据线性值,根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,根据所述数据点距离总值,确定所述数据散点图中的离散数据点;
其中,所述计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,包括:通过下述公式计算所述数据散点图中每个数据点之间的距离总值:
其中,表示数据散点图中每个数据点之间的距离总值,i数据散点图中数据点的序列号,表示数据散点图中数据点的数量, 表示数据散点图中第i?1个数据点的坐标值表示数据散点图中第i个数据点的坐标值, 表示数据散点图中第q个数据点的坐标值;
步骤S4:结合所述异常矩阵和所述离散数据点,确定所述标准化大数据中的噪声数据,提取所述噪声数据对应的数据信号,计算所述数据信号对应的信号稀疏值,并计算所述数据信号对应的信噪比,根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,得到噪声优化处理结果;
其中,所述计算所述数据信号对应的信号稀疏值,包括:
识别所述数据信号中的数据时域信号和数据频域信号,对所述数据时域信号进行傅里叶变换,得到变换数据信号;
根据所述变换数据信号和所述数据频域信号,对所述数据信号进行信号重构,得到目标数据信号;
计算所述目标数据信号对应的信号信息熵,将所述信号信息熵作为所述数据信号对应的信号稀疏值;
其中,所述计算所述目标数据信号对应的信号信息熵,包括:
通过下述公式计算所述目标数据信号对应的信号信息熵:
其中,表示目标数据信号对应的信号信息熵,j表示目标数据信号对应的时间段序列号,t表示目标数据信号中的分组数, 表示目标数据信号中第j个时间段的数据信号值,表示目标数据信号中第j个时间段的数据信号值出现的概率。
2.根据权利要求1所述的基于大数据分析的采集噪声点挖掘方法,其特征在于,所述根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据,包括:调度所述数据领域的历史大数据,解析所述历史大数据中每个数据的数据架构,根据所述数据架构,确定所述历史大数据中每个数据的数据格式;
计量所述数据格式中每个格式的格式频次,根据所述格式频次,确定所述历史大数据中的标准格式;
查询所述标准格式对应的格式源代码,根据所述格式源代码,制定所述清洗大数据的格式转换器;
利用所述格式转换器对所述清洗大数据进行格式标准化处理,得到标准化大数据。
3.根据权利要求1所述的基于大数据分析的采集噪声点挖掘方法,其特征在于,所述根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,包括:获取所述标准化大数据中每个数据的数据序列,并提取所述标准化大数据中每个数据的变量数据,所述变量数据包括自变量数据和因变量数据;
分析所述自变量数据和所述因变量数据之间的变量关系,根据所述变量关系和所述大数据线性值,计算所述自变量数据和所述因变量数据对应的变量值,得到第一变量值和第二变量值;
根据所述第一变量值、所述第二变量值以及所述数据序列,构建所述标准化大数据对应的数据散点图。
4.根据权利要求1所述的基于大数据分析的采集噪声点挖掘方法,其特征在于,所述根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,包括:查询所述噪声特性对应的特性指标,提取所述特性指标对应的指标参数;
计算所述指标参数与标准指标参数的参数差,根据所述参数差,确定所述特性指标中的待优化指标;
查询所述待优化指标中每个指标的优化规则,根据所述优化规则,构建所述数据噪声点对应的噪声优化方案。
5.一种基于大数据分析的采集噪声点挖掘系统,其特征在于,用于执行如权利要求1?4中任意一项所述的基于大数据分析的采集噪声点挖掘方法,所述系统包括:数据处理模块,用于获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,得到清洗大数据,根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据;
矩阵方差计算模块,用于对所述标准化大数据进行特征提。玫酱笫萏卣,构建所述大数据特征对应的特征矩阵,计算所述特征矩阵中每个矩阵对应的矩阵方差值,根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵,其中,所述计算所述特征矩阵中每个矩阵对应的矩阵方差值,包括:通过下述公式计算所述特征矩阵中每个矩阵对应的矩阵方差值:
其中,表示特征矩阵中每个矩阵对应的矩阵方差值,a表示特征矩阵的矩阵序列号,y表示特征矩阵总数, 表示第a个特征矩阵的矩阵期望值, 表示第a个特征矩阵对应的矩阵值,表示特征矩阵的平均值;
其中,所述构建所述大数据特征对应的特征矩阵,包括:
对所述大数据特征进行降维处理,得到降维特征,对所述降维特征进行向量转化,得到特征向量;
计算所述特征向量对应的特征向量值,将所述特征向量值作为所述大数据特征对应的特征值;
计算所述特征向量之间的向量相似系数,根据所述向量相似系数和所述特征值,构建所述大数据特征对应的特征矩阵;
其中,所述计算所述特征向量之间的向量相似系数,包括:
通过下述公式计算所述特征向量之间的向量相似系数:
其中,表示特征向量之间的向量相似系数,表示特征向量的序列号,表示特征向量的数量, 表示第b个特征向量对应的向量长度, 表示特征向量中所有向量的长度平均值, 表示第b+1个特征向量对应的向量长度;
离散点确定模块,用于对所述标准化大数据进行线性转换,得到大数据线性值,根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,根据所述数据点距离总值,确定所述数据散点图中的离散数据点;
其中,所述计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,包括:通过下述公式计算所述数据散点图中每个数据点之间的距离总值:
其中,表示数据散点图中每个数据点之间的距离总值,i数据散点图中数据点的序列号,表示数据散点图中数据点的数量, 表示数据散点图中第i?1个数据点的坐标值表示数据散点图中第i个数据点的坐标值, 表示数据散点图中第q个数据点的坐标值;
噪声点优化模块,用于结合所述异常矩阵和所述离散数据点,确定所述标准化大数据中的噪声数据,提取所述噪声数据对应的数据信号,计算所述数据信号对应的信号稀疏值,并计算所述数据信号对应的信噪比,根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,得到噪声优化处理结果;
其中,所述计算所述数据信号对应的信号稀疏值,包括:
识别所述数据信号中的数据时域信号和数据频域信号,对所述数据时域信号进行傅里叶变换,得到变换数据信号;
根据所述变换数据信号和所述数据频域信号,对所述数据信号进行信号重构,得到目标数据信号;
计算所述目标数据信号对应的信号信息熵,将所述信号信息熵作为所述数据信号对应的信号稀疏值;
其中,所述计算所述目标数据信号对应的信号信息熵,包括:
通过下述公式计算所述目标数据信号对应的信号信息熵:
其中,表示目标数据信号对应的信号信息熵,j表示目标数据信号对应的时间段序列号,t表示目标数据信号中的分组数, 表示目标数据信号中第j个时间段的数据信号值,表示目标数据信号中第j个时间段的数据信号值出现的概率。 说明书 : 基于大数据分析的采集噪声点挖掘方法及系统技术领域[0001] 本发明涉及数据噪声点挖掘技术领域,尤其涉及一种基于大数据分析的采集噪声点挖掘方法及系统。背景技术[0002] 大数据分析是指用于从不同的大量、高速数据集中收集、处理和得出见解的方法、工具和应用程序,这些数据集可能来自各种来源,例如Web、移动应用、电子邮件、社交媒体和联网智能设备,它们通常表示以高速生成、形式各样的数据,从结构化(数据库表、Excel表)到半结构化(XML文件、网页),再到非结构化(图像、音频文件)应有尽有,但是数据在收集过程中由于设备的故障或者人为操作失误以及其他声音干扰,都会对数据造成干扰,产生噪声数据,进而对后续的数据分析产生影响,因此需要对数据进行噪声点的挖掘,以便于提高后续数据分析的准确性。[0003] 但是现有的基于大数据分析的采集噪声点挖掘方法主要是通过提取大数据中的冗余数据,之后标记出冗余数据对应的冗余数据节点,识别冗余数据节点的冗余节点字段,根据冗余节点字段得到大数据的噪声点,但是该方法只是对数据中的冗余数据进行处理,由于大数据中的噪声数据存在原因以及类型多种多样,使用该方法会导致大数据的噪声点的挖掘效率降低,因此,需要因此需要一种能够提高基于大数据分析的采集噪声点的挖掘效率的方法。发明内容[0004] 本发明为解决上述技术问题,提出了一种基于大数据分析的采集噪声点挖掘方法及系统,以解决至少一个上述技术问题。[0005] 一种基于大数据分析的采集噪声点挖掘方法,包括以下步骤:[0006] 步骤S1:获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,得到清洗大数据,根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据;[0007] 步骤S2:对所述标准化大数据进行特征提。玫酱笫萏卣,构建所述大数据特征对应的特征矩阵,计算所述特征矩阵中每个矩阵对应的矩阵方差值,根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵,其中,所述计算所述特征矩阵中每个矩阵对应的矩阵方差值,包括:[0008] 通过下述公式计算所述特征矩阵中每个矩阵对应的矩阵方差值:[0009][0010] 其中,E表示特征矩阵中每个矩阵对应的矩阵方差值,a表示特征矩阵的矩阵序列号,y表示特征矩阵总数,Ga表示第a个特征矩阵的矩阵期望值,ga表示第a个特征矩阵对应的矩阵值,表示特征矩阵的平均值;[0011] 步骤S3:对所述标准化大数据进行线性转换,得到大数据线性值,根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,根据所述数据点距离总值,确定所述数据散点图中的离散数据点;[0012] 步骤S4:结合所述异常矩阵和所述数据离散点,确定所述标准化大数据中的噪声数据,提取所述噪声数据对应的数据信号,计算所述数据信号对应的信号稀疏值,并计算所述数据信号对应的信噪比,根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,得到噪声优化处理结果。[0013] 在本说明书的一个实施例中,所述根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据,包括:[0014] 调度所述数据领域领域的历史大数据,解析所述历史大数据中每个数据的数据架构,根据所述数据架构,确定所述历史大数据中每个数据的数据格式;[0015] 计量所述数据格式中每个格式的格式频次,根据所述格式频次,确定所述历史大数据中的标准格式;[0016] 查询所述标准格式对应的格式源代码,根据所述格式源代码,制定所述清洗大数据的格式转换器;[0017] 利用所述格式转换器对所述清洗大数据进行格式标准化处理,得到标准化大数据。[0018] 在本说明书的一个实施例中,所述构建所述大数据特征对应的特征矩阵,包括:[0019] 对所述大数据特征进行降维处理,得到降维特征,对所述降维特征进行向量转化,得到特征向量;[0020] 计算所述特征向量对应的特征向量值,将所述特征向量值作为所述大数据特征对应的特征值;[0021] 计算所述特征向量之间的向量相似系数,根据所述向量相似系数和所述特征值,构建所述大数据特征对应的特征矩阵。[0022] 在本说明书的一个实施例中,所述计算所述特征向量之间的向量相似系数,包括:[0023] 通过下述公式计算所述特征向量之间的向量相似系数:[0024][0025] 其中,D表示特征向量之间的向量相似系数,b表示特征向量的序列号,B表示特征向量的数量,Ab表示第b个特征向量对应的向量长度, 表示特征向量中所有向量的长度平均值,Ab+1表示第b+1个特征向量对应的向量长度。[0026] 在本说明书的一个实施例中,所述根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,包括:[0027] 获取所述标准化大数据中每个数据的数据序列,并提取所述标准化大数据中每个数据的变量数据,所述变量数据包括自变量数据和因变量数据;[0028] 分析所述自变量数据和所述因变量数据之间的变量关系,根据所述变量关系和所述大数据线性值,计算所述自变量数据和所述因变量数据对应的变量值,得到第一变量值和第二变量值;[0029] 根据所述第一变量值、所述第二变量值以及所述数据序列,构建所述标准化大数据对应的数据散点图。[0030] 在本说明书的一个实施例中,所述计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,包括:[0031] 通过下述公式计算所述数据散点图中每个数据点之间的距离总值:[0032][0033] 其中,H表示数据散点图中每个数据点之间的距离总值,i数据散点图中数据点的序列号,q表示数据散点图中数据点的数量,Ki?1表示数据散点图中第i?1个数据点的坐标值,Ki表示数据散点图中第i个数据点的坐标值,Kq表示数据散点图中第q个数据点的坐标值。[0034] 在本说明书的一个实施例中,所述计算所述数据信号对应的信号稀疏值,包括:[0035] 识别所述数据信号中的数据时域信号和数据频域信号,对所述数据时域信号进行傅里叶变换,得到变换数据信号;[0036] 根据所述变换数据信号和所述数据频域信号,对所述数据信号进行信号重构,得到目标数据信号;[0037] 计算所述目标数据信号对应的信号信息熵,将所述信号信息熵作为所述数据信号对应的信号稀疏值。[0038] 在本说明书的一个实施例中,所述计算所述目标数据信号对应的信号信息熵,包括:[0039] 通过下述公式计算所述目标数据信号对应的信号信息熵:[0040][0041] 其中,P表示目标数据信号对应的信号信息熵,j表示目标数据信号对应的时间段序列号,t表示目标数据信号中的分组数,Nj表示目标数据信号中第j个时间段的数据信号值,M(Nj)表示目标数据信号中第j个时间段的数据信号值出现的概率。[0042] 在本说明书的一个实施例中,所述根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,包括:[0043] 查询所述噪声特性对应的特性指标,提取所述特性指标对应的指标参数;[0044] 计算所述指标参数与标准指标参数的参数差,根据所述参数差,确定所述特性指标中的待优化指标;[0045] 查询所述待优化指标中每个指标的优化规则,根据所述优化规则,构建所述数据噪声点对应的噪声优化方案。[0046] 一种基于大数据分析的采集噪声点挖掘系统,其特征在于,所述系统包括:[0047] 数据处理模块,用于获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,得到清洗大数据,根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据;[0048] 矩阵方差计算模块,用于对所述标准化大数据进行特征提。玫酱笫萏卣,构建所述大数据特征对应的特征矩阵,计算所述特征矩阵中每个矩阵对应的矩阵方差值,根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵,其中,所述计算所述特征矩阵中每个矩阵对应的矩阵方差值,包括:[0049] 通过下述公式计算所述特征矩阵中每个矩阵对应的矩阵方差值:[0050][0051] 其中,E表示特征矩阵中每个矩阵对应的矩阵方差值,a表示特征矩阵的矩阵序列号,y表示特征矩阵总数,Ga表示第a个特征矩阵的矩阵期望值,ga表示第a个特征矩阵对应的矩阵值,表示特征矩阵的平均值;[0052] 离散点确定模块,用于对所述标准化大数据进行线性转换,得到大数据线性值,根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,根据所述数据点距离总值,确定所述数据散点图中的离散数据点;[0053] 噪声点优化模块,用于结合所述异常矩阵和所述数据离散点,确定所述标准化大数据中的噪声数据,提取所述噪声数据对应的数据信号,计算所述数据信号对应的信号稀疏值,并计算所述数据信号对应的信噪比,根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,得到噪声优化处理结果。[0054] 本发明通过获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,可以将所述原始大数据中的一些无效数据、重复数据去除掉,提高所述原始大数据的数据质量,且通过所述数据领域可以了解所述原始大数据对应的相关处理技术手段,本发明通过对所述标准化大数据进行特征提。梢缘玫剿霰曜蓟笫葜械氖萏赜行灾,可以更直观的表达所述标准化大数据的数据表征,便于后续特征矩阵的构建;本发明通过对所述标准化大数据进行线性转换,可以将所述标准化大数据转化成数值形式,以便于将所述标准化大数据通过数值进行可视化展示,更直观的了解所述标准化大数据;本发明通过结合所述异常矩阵和所述数据离散点,确定所述标准化大数据中的噪声数据,以便于能够将所述标准化大数据中的噪声数据全部提取出来,进而便于后续所述噪声数据的噪声点分析,进而可以提高噪声点挖掘的准确性;因此,本发明实施例提供的一种基于大数据分析的采集噪声点挖掘方法及系统,能够提高基于大数据分析的采集噪声点挖掘的准确性。附图说明[0055] 通过阅读参照以下附图所作的对非限制性实施所作的详细描述,本申请的其它特征、目的和优点将会变得更明显:[0056] 图1为本发明一实施例提供的一种基于大数据分析的采集噪声点挖掘方法的流程示意图;[0057] 图2为本发明一实施例提供的一种基于大数据分析的采集噪声点挖掘系统的功能模块图。[0058] 本发明目的的实现、功能特点及优点将结合实施例,参照附图做进一步说明。具体实施方式[0059] 下面结合附图对本发明专利的技术方法进行清楚、完整的描述,显然,所描述的实施例是本发明的一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域所属的技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0060] 此外,附图仅为本发明的示意性图解,并非一定是按比例绘制。图中相同的附图标记表示相同或类似的部分,因而将省略对它们的重复描述。附图中所示的一些方框图是功能实体,不一定必须与物理或逻辑上独立的实体相对应。可以采用软件形式来实现功能实体,或在一个或多个硬件模块或集成电路中实现这些功能实体,或在不同网络和/或处理器方法和/或微控制器方法中实现这些功能实体。[0061] 应当理解的是,虽然在这里可能使用了术语“第一”、“第二”等等来描述各个单元,但是这些单元不应当受这些术语限制。使用这些术语仅仅是为了将一个单元与另一个单元进行区分。举例来说,在不背离示例性实施例的范围的情况下,第一单元可以被称为第二单元,并且类似地第二单元可以被称为第一单元。这里所使用的术语“和/或”包括其中一个或更多所列出的相关联项目的任意和所有组合。[0062] 一种基于大数据分析的采集噪声点挖掘方法,请参阅图1,包括以下步骤:[0063] 步骤S1:获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,得到清洗大数据,根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据;[0064] 本发明通过获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,可以将所述原始大数据中的一些无效数据、重复数据去除掉,提高所述原始大数据的数据质量,且通过所述数据领域可以了解所述原始大数据对应的相关处理技术手段,其中,所述原始大数据是指通过调度数据库或者相关设备采集得到的需要数据,且该数据中包含了噪声数据,如图像数据、影音数据以及文本数据等,所述数据领域是所述原始大数据对应的数据所属类型,如图像数据对应的所述数据领域为图像领域,所述清洗大数据是所述原始大数据经过去重、无效以及异常数据去除后得到的数据,可选的,对所述原始大数据进行数据清洗可以通过数据清洗工具实现,所述数据清洗工具是由脚本语言编译。[0065] 本发明通过根据所述数据领域,对所述清洗大数据进行数据标准化处理,可以将所述清洗大数据中的数据格式进行标准化处理,以便于后续提高数据的处理效率,其中,所述标准化大数据是所述清洗大数据的格式经过标准化处理后得到的数据。[0066] 作为本发明的一个实施例,所述根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据,包括:调度所述数据领域领域的历史大数据,解析所述历史大数据中每个数据的数据架构,根据所述数据架构,确定所述历史大数据中每个数据的数据格式,计量所述数据格式中每个格式的格式频次,根据所述格式频次,确定所述历史大数据中的标准格式,查询所述标准格式对应的格式源代码,根据所述格式源代码,制定所述清洗大数据的格式转换器,利用所述格式转换器对所述清洗大数据进行格式标准化处理,得到标准化大数据。[0067] 其中,所述历史数据是所述数据领域之前采集得到的数据,所述数据架构是所述历史大数据对应的数据架构组成,所述数据格式是所述历史大数据中每个数据在计算机处理时对应的格式,所述格式频次是所述数据格式每个格式出现的次数,所述格式源代码是所述标准格式对应的程序代码,所述格式转换器是用于对所述清洗大数据进行格式标准化处理。[0068] 可选地,调度所述数据领域领域的历史大数据可以通过数据调度器实现,解析所述历史大数据中每个数据的数据架构可以通过结构分析法实现,计量所述数据格式中每个格式的格式频次可以通过科学计数法实现,查询所述标准格式对应的格式源代码可以通过代码查询器实现,制定所述清洗大数据的格式转换器可以通过根据所述格式源代码进行代码编程实现。[0069] 步骤S2:对所述标准化大数据进行特征提。玫酱笫萏卣,构建所述大数据特征对应的特征矩阵,计算所述特征矩阵中每个矩阵对应的矩阵方差值,根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵;[0070] 本发明通过对所述标准化大数据进行特征提。梢缘玫剿霰曜蓟笫葜械氖萏赜行灾,可以更直观的表达所述标准化大数据的数据表征,便于后续特征矩阵的构建,其中,所述大数据特征是所述标准化大数据中每个数据的表征,可选的,可以通过主成分分析法实现。[0071] 本发明通过构建所述大数据特征对应的特征矩阵,以便于将所述大数据特征从抽象的表达转换成数值形式具象式的表达,进而便于后续计算特征方差值,其中,所述特征矩阵是所述大数据特征对应的集合方阵。[0072] 作为本发明的一个实施例,所述构建所述大数据特征对应的特征矩阵,包括:对所述大数据特征进行降维处理,得到降维特征,对所述降维特征进行向量转化,得到特征向量,计算所述特征向量对应的特征向量值,将所述特征向量值作为所述大数据特征对应的特征值,计算所述特征向量之间的向量相似系数,根据所述向量相似系数和所述特征值,构建所述大数据特征对应的特征矩阵。[0073] 其中,所述降维特征是所述大数据特征中的特征从高维度降低到低维度,可以将所述大数据特征中的特征转化为同一维度,以便于后续的处理,所述特征向量是所述降维特征对应的向量表达形式,所述特征向量值是所述特征向量对应的数值,所述向量相似系数表示所述特征向量之间的向量相似程度。[0074] 可选地,对所述大数据特征进行降维处理可以通过PCA线性降维方法实现,对所述降维特征进行向量转化可以通过Word2vec算法实现,计算所述特征向量对应的特征向量值可以通过向量的运算法则实现,如向量的加法和减法等,根据所述向量相似系数的数值大。运鎏卣髦到谢,然后根据矩阵构建函数构建所述大数据特征对应的特征矩阵,所述矩阵构建函数包括zero函数。[0075] 进一步的,作为本发明的一个可选实施例,所述计算所述特征向量之间的向量相似系数,包括:[0076] 通过下述公式计算所述特征向量之间的向量相似系数:[0077][0078] 其中,D表示特征向量之间的向量相似系数,b表示特征向量的序列号,B表示特征向量的数量,Ab表示第b个特征向量对应的向量长度, 表示特征向量中所有向量的长度平均值,Ab+1表示第b+1个特征向量对应的向量长度。[0079] 本发明通过计算所述特征矩阵中每个矩阵对应的矩阵方差值,可以通过所述矩阵方差值了解所述特征矩阵中每个矩阵的偏离程度,以便于后续确定所述特征矩阵中的异常矩阵,其中,所述矩阵方差值表示所述矩阵特征中每个矩阵之间的偏离程度。[0080] 作为本发明的一个实施例,所述计算所述特征矩阵中每个矩阵对应的矩阵方差值,包括:[0081] 通过下述公式计算所述特征矩阵中每个矩阵对应的矩阵方差值:[0082][0083] 其中,E表示特征矩阵中每个矩阵对应的矩阵方差值,a表示特征矩阵的矩阵序列号,y表示特征矩阵总数,Ga表示第a个特征矩阵的矩阵期望值,ga表示第a个特征矩阵对应的矩阵值,表示特征矩阵的平均值。[0084] 本发明通过根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵,可以得到所述特征矩阵中偏离较远的矩阵,提高了后续确定噪声数据的准确性,其中,所述异常矩阵是所述特征矩阵中偏移程度较高的矩阵,可选的,将所述矩阵方差值与预设方差值进行比较,若所述矩阵方差值大于所述预设方差值,则将所述矩阵方差值对应的所述特征矩阵作为异常矩阵,所述预设方差值是所述矩阵方差值的评判标准,可以是0.8,也可以根据实际的业务场景进行设置。[0085] 步骤S3:对所述标准化大数据进行线性转换,得到大数据线性值,根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,根据所述数据点距离总值,确定所述数据散点图中的离散数据点;[0086] 本发明通过对所述标准化大数据进行线性转换,可以将所述标准化大数据转化成数值形式,以便于将所述标准化大数据通过数值进行可视化展示,更直观的了解所述标准化大数据,其中,所述大数据线性值表示所述标准化大数据对应的数值,可选的,对所述标准化大数据进行线性转换可以通过线性函数实现,如一次线性函数。[0087] 本发明通过根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,可以通过所述数据散点图了解所述标准化大数据的分布情况,且便于后续离散数据点的确定,其中,所述数据散点图是所述标准化大数据对应的可视化图表。[0088] 作为本发明的一个实施例,所述根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,包括:获取所述标准化大数据中每个数据的数据序列,并提取所述标准化大数据中每个数据的变量数据,所述变量数据包括自变量数据和因变量数据,分析所述自变量数据和所述因变量数据之间的变量关系,根据所述变量关系和所述大数据线性值,计算所述自变量数据和所述因变量数据对应的变量值,得到第一变量值和第二变量值,根据所述第一变量值、所述第二变量值以及所述数据序列,构建所述标准化大数据对应的数据散点图。[0089] 其中,所述数据序列是所述标准化大数据中每个数据的顺序编号,所述自变量数据是所述标准化大数据中的独立变量数据,所述因变量数据是所述标准化大数据中的依赖变量数据,依赖对象为所述自变量数据,所述第一变量值和所述第二变量值分别表示所述自变量数据和所述因变量数据对应的线性值。[0090] 可选的,获取所述标准化大数据中每个数据的数据序列可以通过SQL查询语句实现,提取所述标准化大数据中每个数据的变量数据可以通过逐步回归法实现,分析所述自变量数据和所述因变量数据之间的变量关系可以通过回归分析法实现,可以根据所述变量关系确定变量关系系数,结合所述大数据线性值和所述变量关系系数计算出所述自变量数据和所述因变量数据对应的变量值,构建所述标准化大数据对应的数据散点图可以通过EdrawMax工具实现。[0091] 本发明通过计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,可以了解所述数据散点图中每个数据点之间的距离远近,进而可以判断所述数据散点图中每个数据点之间的离散程度,其中,所述数据点距离总值表示所述数据散点图中每个数据点之间的距离。[0092] 作为本发明的一个实施例,所述计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,包括:[0093] 通过下述公式计算所述数据散点图中每个数据点之间的距离总值:[0094][0095] 其中,H表示数据散点图中每个数据点之间的距离总值,i数据散点图中数据点的序列号,q表示数据散点图中数据点的数量,Ki?1表示数据散点图中第i?1个数据点的坐标值,Ki表示数据散点图中第i个数据点的坐标值,Kq表示数据散点图中第q个数据点的坐标值。[0096] 本发明通过根据所述数据点距离总值,确定所述数据散点图中的离散数据点,可以得到所述数据散点图中的距离较远的数据点,可以得到所述标准化大数据中的离散数据,其中,所述离散数据点是所述数据散点图中距离较远的数据点,可选的,可以将所述数据点距离总值与预设距离值进行比对,若所述数据点距离总值大于所述预设距离值,则将所述数据点距离总值对应的数据点作为所述数据散点图中的离散数据点。[0097] 步骤S4:结合所述异常矩阵和所述数据离散点,确定所述标准化大数据中的噪声数据,提取所述噪声数据对应的数据信号,计算所述数据信号对应的信号稀疏值,并计算所述数据信号对应的信噪比,根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,得到噪声优化处理结果;[0098] 本发明通过结合所述异常矩阵和所述数据离散点,确定所述标准化大数据中的噪声数据,以便于能够将所述标准化大数据中的噪声数据全部提取出来,进而便于后续所述噪声数据的噪声点分析,进而可以提高噪声点挖掘的准确性,其中,所述噪声数据是所述标准化大数据中因为干扰造成影响的数据。[0099] 本发明通过提取所述噪声数据对应的数据信号,可以得到所述噪声数据的电信号表达形式,以便于后续信号稀疏值的计算,其中,所述数据信号是所述噪声数据中携带信息的电信号,可选的,提取所述噪声数据对应的数据信号可以通过信号采集器实现。[0100] 本发明通过计算所述数据信号对应的信号稀疏值,可以了解所述数据信号的稀疏程度,进而便于了解所述数据信号中的信号噪声部分,其中,所述信号稀疏值表示所述数据信号的稀疏程度。[0101] 作为本发明的一个实施例,所述计算所述数据信号对应的信号稀疏值,包括:识别所述数据信号中的数据时域信号和数据频域信号,对所述数据时域信号进行傅里叶变换,得到变换数据信号,根据所述变换数据信号和所述数据频域信号,对所述数据信号进行信号重构,得到目标数据信号,计算所述目标数据信号对应的信号信息熵,将所述信号信息熵作为所述数据信号对应的信号稀疏值。[0102] 其中,所述数据时域信号是所述数据信号中随着时间变换的信号,所述数据频域信号是所述数据信号在频率域对应的信号,所述变换数据信号是所述数据时域信号经过傅里叶变换后得到对应的频域信号,所述目标数据信号是所述变换数据信号和所述数据频域信号重新构成的信号,所述信号信息熵是表示所述目标数据信号中每个频域内的信号出现的概率,可以了解信号的分离程度,进而判断出所述数据信号的信号稀疏值。[0103] 可选地,识别所述数据信号中的数据时域信号和数据频域信号可以通过MATLAB工具实现,对所述数据时域信号进行傅里叶变换可以通过傅里叶变换算法实现,对所述数据信号进行信号重构可以通过信号重构算法实现。[0104] 作为本发明的一个可选实施例,所述计算所述目标数据信号对应的信号信息熵,包括:[0105] 通过下述公式计算所述目标数据信号对应的信号信息熵:[0106][0107] 其中,P表示目标数据信号对应的信号信息熵,j表示目标数据信号对应的时间段序列号,t表示目标数据信号中的分组数,Nj表示目标数据信号中第j个时间段的数据信号值,M(Nj)表示目标数据信号中第j个时间段的数据信号值出现的概率。[0108] 本发明通过计算所述数据信号对应的信噪比,可以了解所述数据信号中有用信号的强度与干扰信号的强度的比值,进而便于后续查询所述噪声数据中的噪声点,其中,所述信噪比是所述数据信号中有用信号的能量与干扰信号的能量的比值,进一步的,所述数据信号对应的信噪比可以通过计算所述数据信号中有用信号的能量与干扰信号的能量的比值得到。[0109] 本发明通过根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,可以得到所述噪声数据产生的准确噪声点,以便于后续制定相关的噪声优化方案,其中,所述数据噪声点是所述噪声数据产生的具体原因,如声音干扰或者设备故障等,可选地,所述噪声数据中的数据噪声点可以通过根据所述信噪比和所述信号稀疏值从预设的噪声点表格中查询得到,所述预设的噪声点表格是通过分析大量的历史噪声点和所述信噪比以及所述信号稀疏值之间的映射关系构成的表格。[0110] 本发明通过提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,以便于能够去除所述数据噪声点,提高所述标准化大数据的质量,其中,所述噪声优化方案是所述数据噪声点的去除方法,可选的,提取所述数据噪声点对应的噪声特性可以通过功率谱法实现。[0111] 作为本发明的一个实施例,所述根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,包括:查询所述噪声特性对应的特性指标,提取所述特性指标对应的指标参数,计算所述指标参数与标准指标参数的参数差,根据所述参数差,确定所述特性指标中的待优化指标,查询所述待优化指标中每个指标的优化规则,根据所述优化规则,构建所述数据噪声点对应的噪声优化方案。[0112] 其中,所述特性指标是所述噪声特性中的特性项目,所述指标参数是所述特性指标中每个指标的数据,所述参数差是所述指标参数与所述标准指标参数的差值或者差距,所述待优化指标是所述特性指标中需要进行优化的指标,所述优化规则是所述待优化指标中每个指标的优化方法,可选地,查询所述噪声特性对应的特性指标可以通过Match函数实现,提取所述特性指标对应的指标参数可以通过lef函数实现,所述待优化指标中每个指标的优化规则可以通过人机交互的方式从互联网查询得到,所述数据噪声点对应的噪声优化方案可以通过将所述优化规则合并得到。[0113] 本发明通过根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,以便于提高所述标准化大数据的数据质量,其中,所述噪声优化处理结果是所述数据噪声点经过优化处理后得到的结果。[0114] 如图2所示,是本发明一实施例提供的一种基于大数据分析的采集噪声点挖掘系统的功能模块图。[0115] 本发明所述一种基于大数据分析的采集噪声点挖掘系统100可以安装于电子设备中。根据实现的功能,所述一种基于大数据分析的采集噪声点挖掘系统100可以包括数据处理模块101、矩阵方差计算模块102、离散点确定模块103及噪声点优化模块104。本发明所述模块也可以称之为单元,是指一种能够被电子设备处理器所执行,并且能够完成固定功能的一系列计算机程序段,其存储在电子设备的存储器中。[0116] 在本实施例中,关于各模块/单元的功能如下:[0117] 所述数据处理模块101,用于获取待挖掘的原始大数据和数据领域,对所述原始大数据进行数据清洗,得到清洗大数据,根据所述数据领域,对所述清洗大数据进行数据标准化处理,得到标准化大数据;[0118] 所述矩阵方差计算模块102,用于对所述标准化大数据进行特征提。玫酱笫萏卣,构建所述大数据特征对应的特征矩阵,计算所述特征矩阵中每个矩阵对应的矩阵方差值,根据所述矩阵方差值,确定所述特征矩阵中的异常矩阵,其中,所述计算所述特征矩阵中每个矩阵对应的矩阵方差值,包括:[0119] 通过下述公式计算所述特征矩阵中每个矩阵对应的矩阵方差值:[0120][0121] 其中,E表示特征矩阵中每个矩阵对应的矩阵方差值,a表示特征矩阵的矩阵序列号,y表示特征矩阵总数,Ga表示第a个特征矩阵的矩阵期望值,ga表示第a个特征矩阵对应的矩阵值,表示特征矩阵的平均值;[0122] 所述离散点确定模块103,用于对所述标准化大数据进行线性转换,得到大数据线性值,根据所述大数据线性值,构建所述标准化大数据对应的数据散点图,计算所述数据散点图中每个数据点之间的距离值,得到数据点距离总值,根据所述数据点距离总值,确定所述数据散点图中的离散数据点;[0123] 所述噪声点优化模块104,用于结合所述异常矩阵和所述数据离散点,确定所述标准化大数据中的噪声数据,提取所述噪声数据对应的数据信号,计算所述数据信号对应的信号稀疏值,并计算所述数据信号对应的信噪比,根据所述信噪比和所述信号稀疏值,查询所述噪声数据中的数据噪声点,提取所述数据噪声点对应的噪声特性,根据所述噪声特性,构建所述数据噪声点对应的噪声优化方案,根据所述噪声优化方案,执行所述数据噪声点的噪声优化处理,得到噪声优化处理结果。[0124] 详细地,本申请实施例中所述一种基于大数据分析的采集噪声点挖掘系统100中所述的各模块在使用时采用与上述图1中所述的一种基于大数据分析的采集噪声点挖掘方法一样的技术手段,并能够产生相同的技术效果,这里不再赘述。[0125] 应该了解,所述实施例仅为说明之用,在专利申请范围上并不受此结构的限制。[0126] 因此,无论从哪一点来看,均应将实施例看作是示范性的,而且是非限制性的,本发明的范围由所附权利要求而不是上述说明限定,因此旨在将落在权利要求的等同要件的含义和范围内的所有变化涵括在本发明内。不应将权利要求中的任何附关联图标记视为限制所涉及的权利要求。[0127] 以上所述仅是本发明的具体实施方式,使本领域技术人员能够理解或实现本发明。这些实施例的多种修改对本领域的技术人员来说将是显而易见的,本文中所定义的一般原理可以在不脱离本发明的精神或范围的情况下,在其它实施例中实现。因此,本发明将不会被限制于本文所示的这些实施例,而是要符合与本文所发明的原理和新颖特点相一致的最宽的范围。

专利地区:黑龙江

专利申请日期:2023-06-15

专利公开日期:2024-08-23

专利公告号:CN116955444B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载