开云优惠体育网页版入口

开云优惠体育网页版入口:一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统

更新时间:2026-09-01
一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统 专利申请类型:发明专利;
地区:辽宁-抚顺;
源自:抚顺高价值专利检索信息库;

专利名称:一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统

专利类型:发明专利

专利申请号:CN202310856388.4

专利申请(专利权)人:辽宁石油化工大学
权利人地址:辽宁省抚顺市望花区丹东路西段一号

专利发明(设计)人:张秋实,任星兆,王家骏,彭梦园,勇凤伟

专利摘要:本发明公开了一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统,包括:数据预处理、训练机器学习群智能模型、取最优融合模型、最优融合模型预测及可视化。本发明不仅能实时监测溢流工况,还能实现溢流的超前预测,并可视化当前及未来时间段的溢流发生概率,并能在预测到溢流工况时给出针对性AI操作建议,进一步帮助避免溢流发生;本发明融合了多种机器学习模型并对其进行改进,这其中概括了大部分主流预测算法,并根据用户提供的录井数据进行训练和新样本数据预测评估,通过多种误差评估结果结合出最优融合模型,相比单个模型的预测能够提供更高的预测精度,解决溢流早期特征不明显,容易发生误报警的情况。

主权利要求:
1.一种钻井溢流工况智能预测模型的训练、预测方法,其特征在于,包括:数据预处理步骤、训练机器学习群智能模型步骤、取最优融合模型步骤、最优融合模型预测及可视化步骤,其中:数据预处理步骤:采集原始录井数据、新井录井数据和待预测井录井数据这三组数据,对原始录井数据依次进行数据清洗、PCA属性降维、数据集划分与归一化和SMOTE非平衡数据处理操作,对新井录井数据和待预测井录井数据进行数据清洗、数据集划分与归一化和取溢流关键特征列操作;其中,原始录井数据和新井录井数据是临近井的不同井数据;
训练机器学习群智能模型步骤:基于经过了数据预处理步骤的所述原始录井数据,分别用于训练改进粒子群算法优化的长短期记忆网络模型IPSO?LSTM、改进粒子群算法IPSO优化的BP神经网络模型IPSO?BP,同时设置改进粒子群算法的同类算法:遗传算法GA、退火算法SA,和长短期记忆网络LSTM的同类算法ARIMA时间序列模型作为对比参照,组成另外七种模型,分别是遗传算法优化的长短期记忆网络模型GA?LSTM、遗传算法优化的ARIMA时间序列模型GA?ARIMA、遗传算法优化的BP神经网络模型GA?BP、退火算法优化的长短期记忆网络模型SA?LSTM、退火算法优化的BP神经网络模型SA?BP、退火算法优化的ARIMA时间序列模型SA?ARIMA、改进粒子群算法优化的ARIMA时间序列模型IPSO?ARIMA,以及两个不使用优化算法,作为参照的BP神经网络模型和LSTM长短期记忆网络模型共11种模型;
取最优融合模型步骤:基于经过了数据清洗、数据集划分与归一化和取溢流关键特征列三步操作的新井录井数据,使用所述11种模型分别对该份数据进行预测,对比11种模型各自的预测结果和8项误差评估值:MAPE、MAE、RMSE、R?squared、准确率、召回率、F1Score和精确率,择优选出回归和分类这两个阶段分别的最优模型,组合成最优融合模型;
最优融合模型预测及可视化步骤:基于所述的最优融合模型和经过了数据清洗、数据集划分与归一化和取溢流关键特征列三步操作的待预测井录井数据,使用最优融合模型对待预测井录井数据依次进行两步预测:先使用回归模型进行超前预测,再使用分类模型进行溢流预测,得到最终的溢流预测结果,并将预测结果可视化展示在井下溢流风险概率预测系统中;
其中,所述数据预处理步骤具体包括:先对采集的发生溢流前后五天的录井数据进行缺失值填充、光滑噪声数据、识别并删除离群点和无效数据这三步数据清洗过程,将录井数据标准化;再对d维原始录井数据进行PCA数据降维处理:将原始录井数据按列组成n行d维矩阵X,将X的每一行减去本行的均值,求出X的协方差矩阵,以及协方差矩阵的特征值和对应的特征向量,再将特征向量根据对应的特征值大小从上到下按行排列,取前m行组成矩阵P,Y=PX即为降维到m维的数据,作为经过PCA数据降维方法处理后的溢流重要特征;
所述训练机器学习群智能模型步骤具体包括:基于经过了预处理的原始录井数据,分别训练11种模型,根据各模型所属流程阶段不同可分为回归阶段:LSTM参照回归模型、IPSO?LSTM优化回归模型、GA?LSTM优化回归模型、SA?LSTM优化回归模型、IPSO?ARIMA优化回归模型、GA?ARIMA优化回归模型、SA?ARIMA优化回归模型,以及分类阶段:BP参照分类模型、IPSO?BP优化分类模型、GA?BP优化分类模型、SA?BP优化分类模型,即使用IPSO、GA、SA三种优化算法与两种回归模型LSTM、ARIMA和一种分类模型BP神经网络分别交叉组合,形成9种优化模型,再附加未进行优化的BP神经网络分类模型和LSTM回归模型;
取最优融合模型步骤中,使用所述11种模型对经过了数据清洗和取溢流关键特征列的新井录井数据进行预测,并分别计算误差值:
1)对于回归模型LSTM、IPSO?LSTM、GA?LATM、SA?LSTM、IPSO?ARIMA、GA?ARIMA、SA?ARIMA,分别计算这7个模型的预测值与真实值的MAPE、MAE、RMSE和R?squared这4项误差评估值;
2)对于分类模型BP、IPSO?BP、GA?BP、SA?BP,分别计算这4个模型的预测值与真实值的准确率、召回率、F1Score和精确率这4项误差评估值;
基于统计的各回归、分类模型的预测结果和误差评估值,分别选出所述回归、分类的最优模型,按照回归模型在前,分类模型在后,且分类模型的输入数据为回归模型的预测结果数据的规则组合为最优融合模型;
最优融合模型预测及可视化步骤中:使用最优融合模型对经过数据清洗并取溢流关键特征列的待预测井录井数据进行预测:先将所述溢流关键特征列数据送入所述最优融合模型内的回归模型中预测出指定时间步长的具体数值,再将回归模型预测输出的数据送入最优融合模型内的分类模型中,根据所述回归模型预测的未来时间段溢流关键特征列数据来分类预测未来时间段发生溢流的概率,并将模型预测结果展示在所述井下溢流风险概率预测系统中。
2.根据权利要求1所述的一种钻井溢流工况智能预测模型的训练、预测方法,其特征在于:改进粒子群算法IPSO中,在PSO粒子群算法的基础上,使用了以下优化:
1)相较于固定赋值C1=C2=2,实现非线性更新粒子个体学习因子C1和群体学习因子C2:粒子迭代前期C1大C2。VちW佣懒⑿裕缓笃贑1小C2大,使得尽快收敛至全局最优位置;
2)改善惯性权重:惯性权重w使用如下公式进行非线性更新,经过与线性递减、随机惯性递减以及多种非线性递减对比,此更新方式改善效果最佳:;
3)设置r1、r2两个随机搜索系数,避免粒子陷入局部最优解。
3.根据权利要求1所述的一种钻井溢流工况智能预测模型的训练、预测方法,其特征在于:IPSO、GA、SA三种优化算法与分类、回归模型的结合,具体为:
1)将分类模型的F1Score与回归模型的平均绝对误差MAE作为上述三个优化算法的适应度值,来设计三个优化算法的适应度函数,以寻找分类模型F1Score值最大和回归模型平均绝对误差值最小为目标进行全局迭代寻优,最终获得最优解;
2)将BP神经网络的隐含层层数、每层神经元个数、每层神经元的权重初始值W和阈值b、神经网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大小这6个影响BP神经网络性能的超参数作为优化算法的寻优目标;
3)将LSTM长短期记忆网络的LSTM层层数、LSTM层神经元个数、Dense全连接层层数、Dense层神经元个数、LSTM长短期记忆网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大小这6个影响LSTM长短期记忆网络预测效果的超参数作为优化算法的寻优目标;
4)将ARIMA时序网络的自回归阶数、差分次数和移动平均的阶数这3个影响ARIMA时序网络预测效果的超参数作为优化算法的寻优目标;
5)IPSO改进粒子群算法每轮循环迭代寻优时达到指定误差即可退出本轮优化,否则达到设定的最大迭代次数时停止优化、GA和SA优化算法则为损失函数连续10轮变化量小于
0.0001时会默认本轮已收敛,退出本轮优化,通过上述设定来提高模型训练效率。
4.根据权利要求1所述的一种钻井溢流工况智能预测模型的训练、预测方法,其特征在于:将回归模型和融合模型的预测结果可视化展示在井下溢流风险概率预测系统中:将回归模型预测的结果和最优融合模型的预测结果以折线图形式展示在所述井下溢流风险概率预测系统预测页面中,并同时展示当前时刻的溢流发生概率和针对此时刻钻井情况的AI建议。
5.根据权利要求1所述的一种钻井溢流工况智能预测模型的训练、预测方法,其特征在于:对新井录井数据和待预测井录井数据进行数据清洗、数据集划分与归一化和取溢流关键特征列三步操作中:
1)新井录井数据和待预测井录井数据的溢流关键特征列即为原始录井数据经PCA属性降维后选出的溢流关键特征列;
2)对11种模型的训练和预测验证这两个过程使用了不同的数据集,在对11种模型的训练阶段使用原始录井数据,在预测验证模型能力时使用新井录井数据,这样设计的目的在于避免模型发生过拟合,提高模型可信度。 说明书 : 一种钻井溢流工况智能预测模型的训练、预测方法及井下溢
流风险概率预测系统技术领域[0001] 本发明涉及机器学习领域和钻井工程领域,尤其涉及一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统。背景技术[0002] 在石油开采过程中若发生井漏、溢流、井喷、井眼坍塌等钻井事故,不仅会影响钻井成本、污染环境,甚至会造成人员伤亡。其中,溢流是所有钻井事故中出现频率最高的一类,也是影响钻井施工安全较为常见的井下复杂事故之一。溢流不仅会造成储层严重损害,增加勘探开发成本与降低油气开采效率,更重要的是如果没有及时采取措施,则可能引发卡钻、井塌和井喷等重大的灾难,造成更为严重的恶劣影响。因此,钻井过程中的井下溢流风险概率预测系统的研发具有非常重要的意义。[0003] 传统的钻井溢流工况主要靠人工监测各项录井数据,根据经验分析录井曲线变化来判断井下此时是否发生溢流,或有发生溢流的征兆。这与监测人员的经验与责任意识息息相关,容易导致误判,不可控因素较多。[0004] 目前,已提出的通过贝叶斯网络、神经网络等方法对人工选取的多项录井参数进行学习和识别的技术还存在以下局限性:[0005] (1)只能实时监测或从历史钻井数据中识别出溢流工况,有些也达到了一定的准确度,但并不能实现溢流工况的超前预测。根据油气钻井经验,有接近70%的井喷事件在溢流被发现后30分钟内发生,这其中又有一半在10分钟内发生。因此可见仅靠实时监测难以满足需要。因此,本发明能够实现溢流工况的超前预测,并输出实时和未来时刻发生溢流的概率;[0006] (2)溢流工况发生的早期特征识别准确率不高,经常发生误报警。因此,本发明融合了多个主流机器学习算法和模型,并对算法进行改进,最终融合模型的溢流工况识别准确率更高;[0007] (3)在具体的网络模型训练过程中,目前几乎所有论文和实践中都是针对同一个样本数据进行分割,再将分割出的训练集和测试集进行模型学习,但由于本质仍基于同一份样本数据,容易存在过拟合的风险。因此,本发明在评估融合模型各个方法的预测能力时使用另一份新的录井数据,相对来说模型更具可信度和泛化能力。发明内容[0008] 本发明提出了一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统。该方法及系统目的在于实现溢流的超前预测,在将要发生溢流时准确识别并预警,及时提醒人员采取措施来避免发生溢流事故,进而间接防止溢流演变为更严重的井喷灾难。[0009] 本发明技术方案如下:[0010] 一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统,包括:数据预处理、训练机器学习群智能模型、取最优融合模型、最优融合模型预测及可视化,其中:[0011] 数据预处理步骤:采集原始录井数据、新井录井数据和待预测井录井数据这三组数据,对原始录井数据依次进行数据清洗、PCA属性降维、数据集划分与归一化SMOTE非平衡数据处理操作,对新井录井数据和待预测井录井数据进行数据清洗、数据集划分与归一化和取溢流关键特征列操作;[0012] 训练机器学习群智能模型步骤:基于经过了数据预处理步骤的所述原始录井数据,分别用于训练改进粒子群算法(ImprovedParticleSwarmOptimization,IPSO)优化的长短期记忆网络(LongShort?TermMemory,LSTM)模型IPSO?LSTM、改进粒子群算法IPSO优化的BP神经网络模型IPSO?BP,同时设置改进粒子群算法的同类算法:遗传算法(GeneticAlgorithm,GA)、退火算法(SimulatedAnnealing,SA),和长短期记忆网络LSTM的同类算法ARIMA时间序列模型(AutoregressiveIntegratedMovingAverage)作为对比参照,组成另外七种模型,分别是遗传算法优化的长短期记忆网络模型GA?LSTM、遗传算法优化的ARIMA时间序列模型GA?ARIMA、遗传算法优化的BP神经网络模型GA?BP、退火算法优化的长短期记忆网络模型SA?LSTM、退火算法优化的BP神经网络模型SA?BP、退火算法优化的ARIMA时间序列模型SA?ARIMA、改进粒子群算法优化的ARIMA时间序列模型IPSO?ARIMA,以及两个不使用优化算法,作为参照的BP神经网络模型和LSTM长短期记忆网络模型共11种模型;[0013] 取最优融合模型步骤:基于经过了数据清洗、数据集划分与归一化和取溢流关键特征列三步操作的新井录井数据,使用所述11种模型分别对该份数据进行预测,对比11种模型各自的预测结果和8项误差评估值:MAPE(MeanAbsolutePercentageError)、MAE(MeanAbsoluteError)、RMSE(RootMeanSquaredError)、R?squared、准确率、召回率、F1Score和精确率,择优选出回归和分类这两个阶段分别的最优模型,组合成最优融合模型;[0014] 最优融合模型预测及可视化步骤:基于所述的最优融合模型和经过了数据清洗、数据集划分与归一化和取溢流关键特征列三步操作的待预测井录井数据,使用最优融合模型对待预测井录井数据依次进行两步预测:先使用回归模型进行超前预测,再使用分类模型进行溢流预测,得到最终的溢流预测结果,并将预测结果可视化展示在井下溢流风险概率预测系统中。[0015] 进一步的,所述数据处理步骤包括:先对采集的发生溢流前后五天的录井数据进行缺失值填充、光滑噪声数据、识别并删除离群点和无效数据这三步数据清洗过程,将录井数据标准化;再对d维原始录井数据进行PCA数据降维处理:将录井数据按列组成n行d维矩阵X,将X的每一行减去本行的均值,求出X的协方差矩阵,以及协方差矩阵的特征值和对应的特征向量,再将特征向量根据对应的特征值大小从上到下按行排列,取前m行组成矩阵P,Y=PX即为降维到m维的数据,作为经过PCA数据降维方法处理后的溢流重要特征。[0016] 进一步的,所述训练机器学习群智能模型步骤包括:基于经过了预处理的原始录井数据,分别训练11种模型,根据各模型所属流程阶段不同可分为回归阶段:LSTM参照回归预测模型、IPSO?LSTM优化回归预测模型、GA?LSTM优化回归预测模型、SA?LSTM优化回归预测模型、IPSO?ARIMA优化回归预测模型、GA?ARIMA优化回归预测模型、SA?ARIMA优化回归预测模型,以及分类阶段:BP参照分类模型、IPSO?BP优化分类预测模型、GA?BP优化分类预测模型、SA?BP优化分类预测模型,即使用IPSO、GA、SA三种优化算法与两种回归模型LSTM、ARIMA和一种分类模型BP神经网络分别交叉组合,形成9种优化模型,再附加未进行优化的BP神经网络分类模型和LSTM回归模型。[0017] 进一步的,改进粒子群算法IPSO中,在PSO粒子群算法的基础上,使用了以下优化:[0018] 1)相较于固定赋值C1=C2=2,实现非线性更新粒子个体学习因子C1和群体学习因子C2:粒子迭代前期C1大C2。VちW佣懒⑿裕缓笃贑1小C2大,使得尽快收敛至全局最优位置;[0019] 2)改善惯性权重:对比线性递减更新、A、B两种非线性递减以及随机生成惯性权重四种权重更新方法,优选B型非线性递减方式,收敛速度明显提高;[0020] 3)设置r1、r2两个随机搜索系数,避免粒子陷入局部最优解;[0021] 进一步的,IPSO、GA、SA三种优化算法与分类、回归模型的结合,具体为:[0022] 1)将分类预测模型的F1Score与回归预测模型的平均绝对误差MAE作为上述三个优化算法的适应度值,来设计三个优化算法的适应度函数,以寻找分类模型F1Score值最大和回归模型平均绝对误差值最小为目标进行全局迭代寻优,最终获得最优解;[0023] 2)将BP神经网络的隐含层层数、每层神经元个数(每层可不同)、每层神经元的权重初始值W和阈值b(每层可不同)、神经网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大小这6个影响BP神经网络性能的超参数作为优化算法的寻优目标;[0024] 3)将LSTM长短期记忆网络的LSTM层层数、LSTM层神经元个数、Dense全连接层层数、Dense层神经元个数、LSTM长短期记忆网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大小这6个影响LSTM长短期记忆网络预测效果的超参数作为优化算法的寻优目标;[0025] 4)将ARIMA时序网络的自回归(AR)阶数、差分(Difference)次数和移动平均(MA)的阶数这3个影响ARIMA时序网络预测效果的超参数作为优化算法的寻优目标;[0026] 5)IPSO改进粒子群算法每轮循环迭代寻优时达到指定误差即可退出本轮优化,否则达到设定的最大迭代次数时停止优化、GA和SA优化算法则为损失函数连续10轮变化量小于0.0001时会默认本轮已收敛,退出本轮优化,通过上述设定来提高模型训练效率。[0027] 进一步的,取最优融合模型步骤中,使用所述11种模型对经过了数据清洗和取溢流关键特征列的新井录井数据进行预测,并分别计算误差值:[0028] 1)对于回归模型LSTM、IPSO?LSTM、GA?LATM、SA?LSTM、IPSO?ARIMA、[0029] GA?ARIMA、SA?ARIMA,分别计算这7个模型的预测值与真实值的MAPE、MAE、RMSE和R?squared这4项误差评估值;[0030] 2)对于分类模型BP、IPSO?BP、GA?BP、SA?BP,分别计算这4个模型的预测值与真实值的准确率、召回率、F1Score和精确率这4项误差评估值;[0031] 基于统计的各回归、分类模型的预测结果和误差评估值,分别选出所述回归、分类的最优模型,按照回归模型在前,分类模型在后,且分类模型的输入数据为回归模型的预测结果数据的规则组合为最优融合模型。[0032] 进一步的,最优融合模型预测及可视化步骤中:使用最优融合模型对经过数据清洗并取溢流关键特征列的待预测井录井数据进行预测:先将所述溢流关键特征列数据送入所述最优融合模型内的回归模型中预测出指定时间步长的具体数值,再将回归模型预测输出的数据送入最优融合模型内的分类模型中,根据所述回归模型预测的未来时间段溢流关键特征列数据来分类预测未来时间段发生溢流的概率,并将模型预测结果展示在所述井下溢流风险概率预测系统中。[0033] 进一步的,将回归模型和融合模型的预测结果可视化展示在井下溢流风险概率预测系统中:将回归模型预测的结果和最优融合模型的预测结果以折线图形式展示在所述井下溢流风险概率预测系统预测页面中,并同时展示当前时刻的溢流发生概率和针对此时刻钻井情况的AI建议。[0034] 进一步的,对新井录井数据和待预测井录井数据进行数据清洗、数据集划分与归一化和取溢流关键特征列三步操作中:[0035] 1)新井录井数据和待预测井录井数据的溢流关键特征列即为原始录井数据经[0036] PCA属性降维后选出的溢流关键特征列;[0037] 2)本发明中对11种模型的训练和预测验证这两个过程使用了不同的数据集,在对11种模型的训练阶段使用原始录井数据,在预测验证模型能力时使用新井录井数据,这样设计的目的在于避免模型发生过拟合,提高模型可信度。[0038] 本发明的技术效果和优点:[0039] (一)技术效果[0040] 本发明提出的一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统,其实现了如下技术效果:[0041] 1.该钻井溢流工况智能预测模型的训练、预测方法实现了对输入的录井数据进行数据预处理,并使用11组机器学习模型组成的机器学习群智能模型对录井数据进行训练和学习,得到适用于此井的最优融合模型,最终使用此最优融合模型对该井进行溢流超前预测,在将要发生溢流时准确识别并预警,及时提醒人员采取措施来避免发生溢流事故,进而间接防止溢流演变为更严重的井喷灾难;[0042] 2.该井下溢流风险概率预测系统使用python和PyQt5设计封装GUI可视化界面,该系统内置了上述钻井溢流工况智能预测模型的训练、预测方法,实现了对模型的训练和预测、录井数据导入和溢流关键特征选取等操作的人机交互,以及将上述最优融合模型的回归预测结果(溢流关键特征历史及未来数值曲线)和分类预测结果(溢流发生概率)可视化,并根据录井数据结合预测溢流发生概率信息提供AI操作建议。[0043] (二)优点[0044] 1.不仅能实时监测溢流工况,还能实现溢流的超前预测,并可视化当前及未来时间段的溢流发生概率,并能在预测到溢流工况时给出针对性AI操作建议,进一步帮助避免溢流发生;[0045] 2.本发明融合了多种机器学习模型并对其进行改进,这其中概括了大部分主流预测算法,并根据用户提供的录井数据进行训练和新样本数据(新井录井数据)预测评估,通过多种误差评估结果结合出最优融合模型,相比单个模型的预测能够提供更高的预测精度,解决溢流早期特征不明显,容易发生误报警的情况;[0046] 3.对模型使用新样本数据(新井录井数据)进行预测评估,而非目前几乎所有论文和实践都是针对同一个样本数据进行分割,再将分割出的训练集和测试集进行模型学习,使用新样本数据能够更客观反应预测模型的泛化性能,避免模型训练中的过拟合和数据泄露问题;[0047] 4.基于该钻井溢流工况智能预测模型的训练、预测方法,提供了支持人机交互的井下溢流风险概率预测系统,并将预测结果可视化,方便油田现场人员操作。附图说明[0048] 图1所示为本发明实施例一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统整体设计示意图;[0049] 图2所示为本发明实施例一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统的流程图;[0050] 图3所示为本发明实施例中数据预处理步骤的流程图;[0051] 图3(A)所示为本发明具体实施例的数据预处理步骤中PCA属性降维方法的碎石图;[0052] 图3(B)所示为本发明具体实施例的数据预处理步骤中一种数据标注结果示意图;[0053] 图4所示为本发明实施例的一种IPSO改进粒子群算法的流程图;[0054] 图5所示为本发明实施例一种各优化算法与各机器学习模型进行结合的流程图;[0055] 图5(A)所示为本发明具体实施例的一种使用IPSO改进粒子群算法对LSTM长短期记忆网络进行全局寻优的第一种结果示意图;[0056] 图5(B)所示为本发明实施例的一种使用IPSO改进粒子群算法对LSTM长短期记忆网络进行全局寻优的第二种结果示意图;[0057] 图5(C)所示为本发明具体实施例的一种LSTM长短期记忆网络和ARIMA时序网络模型经过某轮优化后的预测效果对比图;[0058] 图6所示为本发明实施例一种模型评优与融合过程的流程图;[0059] 图7所示为本发明具体实施例中井下溢流风险概率预测系统的操作流程图;[0060] 图7(A)所示为本发明具体实施例的井下溢流风险概率预测系统第一种界面设计图;[0061] 图7(B)所示为本发明具体实施例的井下溢流风险概率预测系统第二种界面设计图;[0062] 图7(C)所示为本发明具体实施例的井下溢流风险概率预测系统第三种界面设计图。具体实施方式[0063] 为使本发明实施例的目的、技术方案和优点更加清楚,下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整的描述,显然,所描述的实施例是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0064] 本说明书提供了如实施例或流程图所述的方法操作步骤,但基于常规或者无创造性的劳动可以包括更多或者更少的操作步骤。实施例中列举的步骤顺序仅仅为众多步骤执行顺序中的一种方式,不代表唯一的执行顺序。在实际中的系统或装置产品执行时,可以按照实施例或者附图所示的方法顺序执行或者并行执行。[0065] 需要说明的是,本文的钻井溢流工况智能预测模型的训练、预测方法可用于钻井工程领域或应用于溢流工况的识别、预测,也可用于除钻井工程领域和溢流工况之外的其他情况,本文钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统的应用领域和目标工况不做限定。[0066] 本发明提供一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统,用于溢流的超前预测,基于多种机器学习模型对历史录井数据和新井录井数据进行训练和预测验证,优选出最能够准确预测待预测井的模型,并以可交互的软件和模型预测结果可视化的方式展示。[0067] 如图1所示为本发明实施例一种钻井溢流工况智能预测模型的训练、预测方法的可视化部分示意图,其包含数据预处理、训练机器学习群智能模型、取最优融合模型和最优融合模型预测及可视化四个步骤。[0068] 如图2所示为本发明实施例一种钻井溢流工况智能预测模型的训练、预测方法及井下溢流风险概率预测系统的流程图,其中具体包括如下步骤:[0069] 步骤201,数据预处理。在本步骤中,对原始录井数据进行数据预处理操作,对新井录井数据进行数据清洗和取溢流关键特征列操作。其中,数据预处理操作包括数据清洗、PCA属性降维、数据集划分与归一化和SMOTE非平衡数据处理四个步骤。取溢流关键特征列操作为根据原始录井数据的PCA属性降维结果来选择新井录井数据的溢流关键特征列,具体的,PCA属性降维会根据输入的数据来提取最关键最具代表性的特征列,能够在保证数据质量的前提下缩减数据项(数据预处理流程具体见图3)。[0070] 其中,原始录井数据和新井录井数据是临近井的不同井数据,用于更准确地评估训练好的模型,两份录井数据具体可包含不同数据内容,一般按时间序列记录,包含机械钻速、出口流量、入口流量、泵冲速、立管压力、总池体积、大钩悬重、扭矩、出口电导率等数据。[0071] 步骤202,基于处理后的原始录井数据,分别训练并保存11个机器学习的分类、回归模型。在本步骤中,使用经过上述数据预处理操作的原始录井数据分别训练各个回归或分类机器学习模型,分别为改进粒子群算法优化的长短期记忆网络模型IPSO?LSTM、改进粒子群算法IPSO优化的BP神经网络模型IPSO?BP、改进粒子群算法优化的ARIMA时间序列模型IPSO?ARIMA、遗传算法优化的长短期记忆网络模型GA?LSTM、遗传算法优化的BP神经网络模型GA?BP、遗传算法优化的ARIMA时间序列模型GA?ARIMA、退火算法优化的长短期记忆网络模型SA?LSTM、退火算法优化的BP神经网络模型SA?BP、退火算法优化的ARIMA时间序列模型SA?ARIMA、BP神经网络模型和LSTM长短期记忆网络模型。其中,这11种模型可根据应用场景和目的不同分为7个所述回归模型(LSTM、IPSO?LSTM、IPSO?ARIMA、GA?LSTM、GA?ARIMA、SA?LSTM、SA?ARIMA)和4个所述分类模型(BP神经网络、IPSO?BP、GA?BP、SA?BP),也可以根据所使用的优化算法不同分为未优化模型(LSTM、BP神经网络)、IPSO改进粒子群算法优化(IPSO?LSTM、IPSO?ARIMA、IPSO?BP)、GA遗传算法优化(GA?LSTM、GA?ARIMA、GA?BP)和SA退火算法优化(SA?LSTM、SA?ARIMA、SA?BP)。[0072] 进一步的,IPSO改进粒子群算法是在PSO粒子群算法的基础上改进而来,其中改进过程如图4所示,IPSO改进粒子群算法由速度和位置这两个核心属性组成,速度表示粒子下一步迭代时移动的方向和距离,位置是所求解问题的一个解,速度和位移更新公式分别为:[0073][0074] 其中,速度公式由三项组成,第一项为权重部分,由惯性权重和粒子自身速度构成,表示粒子对先前自身运动状态的信任;第二项为认知部分,表示粒子本身的思考,即粒子自己经验的部分,可理解为粒子当前位置与自身历史最优位置之间的距离和方向;第三项为群体部分,表示粒子之间的信息共享与合作,即来源于群体中其他优秀粒子的经验,为粒子当前位置与群体历史最优位置之间的距离和方向。式中,w为惯性权重,k为迭代次数,d为粒子维度序号,c1为个体学习因子,c2为群体学习因子,r1、r2为区间[0,1]内的随机数,k kvid 为粒子i在第k次迭代中第d维的速度向量,xid 为粒子i在第k次迭代中第d维的位置向k量,pid,pbest为粒子i在第k次迭代中第d维的历史最优位置,即在第k次迭代后,第i个粒子搜k索得到的最优解,pd,gbest为群体在第k次迭代中第d维的历史最优位置,即在第k次迭代后,整个粒子群体中的最优解。[0075] 其中,IPSO改进粒子群算法对速度更新公式的惯性权重w、c1个体学习因子、c2群体学习因子、r1、r2随机数进行改良,惯性权重w使用如下公式进行非线性更新,经过与线性递减、随机惯性递减以及多种非线性递减对比,此更新方式改善效果最佳:[0076][0077] 对于c1个体学习因子、c2群体学习因子使用如下公式更新,以实现粒子迭代前期C1大C2。VちW佣懒⑿裕缓笃贑1小C2大,尽快收敛至全局最优。其中,max_iter是IPSO改进粒子群算法的最大迭代次数,iteration是当前循环次数:[0078][0079][0080] 对于位移更新公式,为上一步的位置+下一步的速度,如下所示:[0081][0082] 其中,IPSO改进粒子群算法、GA遗传算法、SA退火算法这三种优化算法的原理均为使用一组基本个体,每个个体携带待优化模型的一些超参数作为自身属性,以应用这些超参数之后模型的误差最小或准确率最高为目标进行迭代优化。[0083] 具体的,三个优化算法在优化LSTM长短期记忆网络时均设置LSTM层层数、LSTM层神经元个数、Dense全连接层层数、Dense层神经元个数、LSTM长短期记忆网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大小这6个影响LSTM长短期记忆网络预测效果的超参数作为优化算法基本个体的属性,以样本真实值和LSTM长短期记忆网络的预测值两者的平均绝对误差MAE作为优化算法的适应度值来设计适应度函数;[0084] 具体的,三个优化算法在优化ARIMA时序网络时均设置自回归(AR)阶数、差分(Difference)次数和移动平均(MA)的阶数这3个影响ARIMA时序网络预测效果的超参数作为优化算法的适应度值来设计适应度函数;[0085] 具体的,三个优化算法在优化BP神经网络时均设置隐含层层数、每层神经元个数(每层可不同)、每层神经元的权重初始值W和阈值b(每层可不同)、神经网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大小这6个影响BP神经网络性能的超参数作为优化算法的适应度值来设计适应度函数;[0086] 具体的,这11个机器学习模型均设计为使用IPSO改进粒子群算法、GA遗传算法和SA退火算法这三个优化算法,通过设置适应度函数,算法不断循环迭代更新和计算每轮的适应度值,以达到最优适应度值为目标,此时即找到最优模型,优化算法停止并保存最优模型(如图5所示)。[0087] 步骤203,加载11个机器学习模型,分别对处理后的新井录井数据进行预测,保存每个模型的预测结果和各项误差评估信息。此步骤中,使用上述7个所述回归模型(LSTM、IPSO?LSTM、IPSO?ARIMA、GA?LSTM、GA?ARIMA、SA?LSTM、SA?ARIMA)和4个所述分类模型(BP神经网络、IPSO?BP、GA?BP、SA?BP),共11个训练好的机器学习模型对处理后的新井录井数据进行预测。其中,新井录井数据在步骤201中经过数据清洗、PCA属性降维、数据集划分与归一化和SMOTE非平衡数据处理四个步骤的数据预处理操作。[0088] 步骤204,模型评优与融合。此步骤中,对上述7个所述回归模型(LSTM、IPSO?LSTM、IPSO?ARIMA、GA?LSTM、GA?ARIMA、SA?LSTM、SA?ARIMA)和4个所述分类模型(BP神经网络、IPSO?BP、GA?BP、SA?BP),共11个机器学习模型的预测结果和各项误差评估数据进行评优,按误差评估值大小排序来筛选取信的预测结果并对其进行综合参考,组成最优融合模型。[0089] 具体的,上述回归模型LSTM、IPSO?LSTM、GA?LATM、SA?LSTM、IPSO?ARIMA、GA?ARIMA、SA?ARIMA,分别计算这7个模型的预测值与真实值的MAPE、MAE、RMSE和R?squared这4项误差评估值。[0090] 具体的,上述分类模型BP、IPSO?BP、GA?BP、SA?BP,分别计算这4个模型的预测值与真实值的准确率、召回率、F1Score和精确率这4项误差评估值。[0091] 其中,回归模型的评优主要考虑平均绝对误差MAE的评估值,其平均绝对误差MAE看重预测结果与真实结果的绝对误差大。美创砟P偷脑げ庑Ч。其中,计算公式如下所示,其中y表示样本数据的真实值,表示样本数据的预测值:[0092][0093] 其中,分类模型的评优主要考虑F1Score值,其是统计学中用来衡量二分类模型的一种指标,同时兼顾了分类模型的准确率和召回率,是精确率和召回率的调和平均,用于综合考虑模型预测的准确性和完整性。其中,F1Score值的计算过程如下:[0094] 先定义如下混淆矩阵,其中,TP(TruePositive)表示真正例数,即实际为正例,模型预测也为正例的样本数;FP(FalsePositive)表示假正例数,即实际为负例,模型预测为正例的样本数;FN(FalseNegative)表示假负例数,即实际为正例,模型预测为负例的样本数;TN(TrueNegative)表示真负例数,即实际为负例,模型预测也为负例的样本数:[0095][0096] 再计算精确率(precision):[0097][0098] 然后计算召回率(recall):[0099][0100] 最后,可计算得出F1Score值:[0101][0102] 步骤205,取待预测井录井数据的溢流关键特征列并进行数据清洗,再加载最优融合模型对处理后的待预测井录井数据进行预测。在此步骤,使用上述最优融合模型对数据清洗后的待预测井录井数据的溢流关键特征列进行预测。[0103] 步骤206,对最优融合模型的预测结果进行可视化展示,并根据当前录井信息给出AI建议。在此步骤,可视化内容包括曲线展示溢流关键特征列的过去与未来的数值和发生溢流的概率、当前发生溢流的概率数值,以及未来时间段的溢流发生概率的数值曲线,如图7(C)所示。[0104] 图3所示为本发明实施例中数据预处理步骤的流程图。在此需要提到,本发明中对于原始录井数据需要进行数据清洗、PCA属性降维、数据集划分与归一化和SMOTE非平衡数据处理,共四步数据预处理步骤,而对新井录井数据和待预测井录井数据则只进行数据清洗、数据集划分与归一化和取溢流关键特征列操作。具体的,图3包括如下步骤:[0105] 步骤301,数据清洗。此步骤是为了解决数据质量问题,在实际获取的录井数据中,通常不可避免地会存在一些数据问题,常见为缺失部分数据、存在?9999或0的无效填充数据,对于此类问题,如果缺失少量数据则采用均值填充方法,即取时序前后五个点的平均值来填充,如果缺失大块数据则直接删除此部分数据。[0106] 步骤302,PCA属性降维,提取溢流的关键特征列数据。此步骤是为了选出录井数据中导致溢流的最关键特征,同时也是压缩数据维度、提高训练效率的重要手段,此步骤主要进行以下工作:[0107] (1)主成分分析,主成分分析法运用“降维”思想,把多个特征变换成少数综合指标(主成分)的多元统计方法,每个主成分都是原始数据的线性组合,彼此相互独立,保留了原始数据的绝大部分信息。主成分分析的本质是通过原始数据的相关性,寻求综合替代对象,并且保证了转化过程中的信息损失最小。根据标准化后的数据集计算协方差矩阵R:[0108][0109] 计算矩阵R的特征值λ1≥λ2≥…≥λn≥0及对应的特征向量u1,u2,…,un,其中uj=(u1j,u2j,…,unj),unj表示第j个特征向量的第n个分量;由特征向量组成n个新的指标变量:[0110][0111] 式中,y1是第1主成分,y2是第2主成分,…,yn是第n主成分。计算各主成分yj贡献率bj(j=1,2,...,n)及y1,y2,…,yn(p≤n)的累计贡献率αp。[0112][0113] (2)溢流特征筛。菀缌鞑脑蚪岷咸卣鞑问涞南喙匦陨秆∮糜谠げ庖缌鞯墓丶卣鞑问,将多个有一定相关性的指标进行线性组合,以最少的维度解释原数据中尽可能多的信息为目标进行降维,降维后的各变量间彼此线性无关,最终确定的新变量是原始变量的线性组合,且越往后主成分在方差中的比重也。酆显畔⒌哪芰υ饺。其中,分析的碎石图结果如图3(A)所示,当折线由陡峭突然变得平稳时,陡峭到平稳对应的因子个数即为参考提取因子个数。[0114] 步骤303,数据集划分与归一化。此步骤是为了避免模型训练结果出现过拟合问题。在此步骤中,会将原始录井数据划分为训练集、验证集、测试集,新井录井数据和待预测井录井数据则不进行此步骤。具体的,训练集、验证集和测试集的划分比例为70%、30%和30%,其中验证集用于验证模型训练效果,测试集用于测试训练好的模型在划分的新数据上的预测效果。其中,归一化是为了解决数据之间的量纲不统一问题,例如特征1和特征2都是对气压进行量,但特征1的样本数据值是帕,而特征2的样本数据值为兆帕,如果不进行无量纲化处理,则特征2对模型的影响明显要大于特征1对模型的影响,本发明使用min?max方法进行归一化处理,其将原始数据进行线性缩放,以数据中的最大值和最小值为范围,将数据映射在[0,1]的范围内,公式如下所示:[0115][0116] 步骤304,SMOTE非平衡数据处理。此步骤是为了解决数据严重不平衡问题,由于实际生产中发生溢流的情况极少,录井数据中非溢流数据与溢流数据比例可达到1:10以上,存在数据严重不平衡问题,不平衡数据会导致溢流预测模型的训练结果偏向数据量较大的类别(未发生溢流)。具体的,进行如下工作来使两者保持相对平衡的数据组成:[0117] a)在训练集中使用基于过采样改进的SMOTE非平衡数据处理方法,测试集和验证集保留原有的比例不变;[0118] b)根据钻井日报表标注溢流段数据,如图3(B)所示,其中“tag”列即为溢流标签列,[0119] 其中,0表示“未发生溢流”,1表示“发生溢流”。[0120] 图4所示为本发明实施例的一种IPSO改进粒子群算法的流程图。其中具体包括如下步骤:[0121] 步骤401,初始化IPSO改进粒子群算法中粒子的属性,并限定粒子活动范围。在本步骤中,定义粒子的属性并对其进行初始化,并规定每个属性的变化范围,防止粒子在全局寻优过程中越界。具体的,粒子的属性包括粒子个数、改进粒子群算法最大迭代次数、速度更新公式的c1和c2值、惯性权重w、所有粒子的初始速度、全局最优适应度、自身最优适应度此8项,并对8项属性每项的取值区间上下界、区间开闭、数值类型进行限定。其中,数值类型有整数型int、浮点型float、字符串类型str和数组类型list四种。其中,区间开闭使用0和1控制,0表示“开区间”,1表示“闭区间”。[0122] 步骤402,每个粒子基于位移公式和改进的速度更新公式运动,并在每轮迭代中更新粒子个体和群体的最优适应度值。在此步骤,每个粒子根据上述位移公式和改进的速度公式,在到达最大迭代次数前不断更新粒子的速度和位置,同时在每轮迭代中计算并更新粒子的适应度值,适应度值即为使用当前粒子各属性值训练上述机器学习模型后,上述机器学习模型返回的结果值。其中,分类预测机器学习模型返回的结果值为其F1Score值大。毓樵げ饣餮澳P头祷氐慕峁滴淦骄晕蟛頜AE值大小。[0123] 步骤403,当粒子达到指定误差值或最大迭代次数时停止运动,退出IPSO改进粒子群算法。在此步骤,改进粒子群算法在每轮循环中计算当前误差值大。⑴卸鲜欠翊锏搅酥付ㄎ蟛钪祷虻鼻把反问锏搅俗畲蟮问,若已达到则退出循环。其中,当前误差值即每轮计算的上述F1Score值或平均绝对误差MAE值大小。[0124] 步骤404,粒子寻得最优结果,结束运动。在此步骤,改进粒子群算法达到最大迭代次数,返回粒子在所有轮的迭代期间的最好适应度值,并结束运动,退出改进粒子群算法的循环迭代过程。[0125] 图5所示为本发明实施例一种各优化算法与各机器学习模型进行结合的流程图。其中具体包括如下步骤:[0126] 步骤501,初始化各优化算法,并分别为BP神经网络模型、LSTM长短期记忆网络模型和ARIMA时序模型设计适应度函数。在此步骤,首先对各个优化算法进行初始化,三个优化算法针对每个机器学习模型相同的超参数进行寻优,设置相同的适应度函数。其中,BP神经网络模型需要寻优的超参数为隐含层层数、每层神经元个数、每层神经元的权重初始值W和阈值b、神经网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大。籐STM长短期记忆网络模型需要寻优的超参数为LSTM层层数、LSTM层神经元个数、Dense全连接层层数、Dense层神经元个数、LSTM长短期记忆网络的每轮迭代训练次数epoch值和神经网络每次更新权重参数所使用的样本数量batchSize大。籄RIMA时序网络模型需要寻优的超参数为自回归(AR)阶数、差分(Difference)次数和移动平均(MA)的阶数。[0127] 步骤502,基于设计的适应度函数,使用各优化算法对上述三个模型的超参数进行寻优,并保存最优模型。在此步骤,分别使用IPSO改进粒子群算法、GA遗传算法和SA退火算法对上述三个机器学习模型进行寻优。其中,IPSO改进粒子群算法对LSTM长短期记忆网络的部分寻优过程记录如图5(A)、图5(B)所示,LSTM长短期记忆网络和ARIMA时序网络模型经过某轮优化后的预测效果对比图如图5(C)所示。其中,图5(A)为设置部分定量LSTM长短期记忆网络模型的超参数(激活函数、LSTM长短期记忆网络模型的记忆窗口长度),使用IPSO改进粒子群算法对其进行寻优,并记录寻优结果(训练集、测试集和验证集的RMSE误差计算结果以及寻得的最佳超参数值)。其中,图5(B)为图5(A)其中两组的代码控制台输出结果。其中,图5(C)可明显看出在此轮优化下LSTM长短期记忆网络模型相比ARIMA时序网络模型在波动较大处预测曲线更贴近真实数据。[0128] 图6所示为本发明实施例一种模型评优与融合过程的流程图。其中具体包括如下步骤:[0129] 步骤601,分别计算7个回归模型预测的MAPE、MAE、RMSE、R?squared以及4个分类模型预测的准确率、召回率、精确率、F1Score各4项误差评估值,以及共11个机器学习模型的预测结果。在此步骤,对上述各4项误差评估值进行计算并保存,分别挑选RMSE、R?squared和F1Score作为评价回归模型和分类模型的误差评估值代表,作为模型评优与融合的依据。[0130] 步骤602,将7个回归模型先按照RMSE计算结果递增排序、再按R?squared计算结果递减排序,取排名前3的模型预测结果并逐行逐特征列取此3个模型的均值作为输出的回归预测结果。其中,R?squared的计算公式如下:[0131][0132] 其中,TSS表示的是y的变动的程度,正比于方差,其计算公式为。[0133][0134] 其中,RSS表示的是模型和真实值的残差,其计算公式为:[0135][0136] 其中,ESS表示的是模型对y的变动的预测,其计算公式为:[0137][0138] 步骤603,将4个分类模型按照F1Score值大小递减排序,取排名前3的预测模型的是否发生溢流二分类预测结果及预测溢流概率。其中,溢流二分类预测结果为0或者1,0表示“预测不发生溢流”,1表示“预测将发生溢流”。[0139] 步骤604,根据二分类预测结果中多数方即为是否发生溢流的最终预测结果,并取发生溢流概率的均值作为最终的溢流预测概率值。在此步骤,由于上述回归和上述分类模型均选择奇数个结果作为参考,因此一定会出现一种二分类结果占多数的情况,将此种情况作为最终模型的预测结果。其中,由于连续预测了未来一段时间的溢流发生概率,取IPSO?BP、GA?BP和SA?BP三个模型在每个时间点分别的预测溢流发生概率值的平均数作为模型输出的此时刻溢流预测概率和未来时间段的溢流预测概率值。[0140] 图7所示为本发明具体实施例中井下溢流风险概率预测系统的操作流程图。其中具体包括如下步骤:[0141] 步骤701,输入数据库连接信息导入或点选本地文件导入录井数据,预览导入的录井数据,操作界面如图7(A)所示,以填写数据库连接或上传本地文件的方式导入原始录井数据。[0142] 步骤702,根据PCA属性降维结果定位溢流关键特征后,点击“导入数据”按钮,将溢流关键特征列数据导入最优融合模型,执行预测。在此步骤,由于不同地理位置或录井数据的数据质量不同可能会得出不同的PCA属性降维结果,且各个井场的录井数据中数据列的名称也可能不同,因此要手动根据原始录井数据的PCA属性降维分析出的溢流关键特征列选择关键参数所在的列,操作界面如图7(B)所示。[0143] 步骤703,可视化展示待预测井录井数据的回归预测结果和基于当前录井数据的AI建议,点击“预测未来溢流概率”按钮,展示未来时间段的溢流发生概率曲线,操作界面如图7(C)所示。[0144] 本文中应用了具体实施例对本文的原理及实施方式进行了阐述,以上实施例的说明只是用于帮助理解本文的方法及其核心思想;同时,对于本领域的一般技术人员,依据本文的思想,在具体实施方式及应用范围上均会有改变之处,综上所述,本说明书内容不应理解为对本文的限制。

专利地区:辽宁

专利申请日期:2023-07-13

专利公开日期:2024-11-19

专利公告号:CN116796647B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载