产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:电网智能物联平台管理方法及系统
专利类型:发明专利
专利申请号:CN202411260696.1
专利申请(专利权)人:珠海市阿普顿电气有限公司
权利人地址:广东省珠海市香洲区科融路33号901-904
专利发明(设计)人:张晓易
专利摘要:本发明公开了电网智能物联平台管理方法及系统,涉及电网管理技术领域,将配电网优化问题分解为多个子问题,每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略。管理系统先通过将大规模优化问题分解为可并行求解的子问题,然后在动态环境中进行学习和调整,实时适应电网的变化,提供更灵活和智能的决策方案,协调每个子问题的调度方案,使得整体管理达到全局最优,提高配电网的运行效率和可靠性。
主权利要求:
1.电网智能物联平台管理方法,其特征在于:所述管理方法包括以下步骤:管理系统将配电网优化问题分解为多个子问题,将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略;
通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略;
依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中;
基于 值使用ε?greedy策略进行探索为子问题找到初始调度策略,包括以下步骤:概率ε初始设置为0.9,每次迭代缩小0.1,生成一个0到1之间的随机数r,根据生成的随机数r进行调度策略选择,若随机数r小于概率ε,随机选择一个调度策略,若随机数r大于等于概率ε,选择 值最大的调度策略;
将选择的调度策略应用在仿真环境中,获取子问题的新状态信息,对选择的调度策略利用奖励函数结合新状态信息进行 值更新,表达式为:,式中, 为更新后的 值,
为更新前的 值, 为学习率,取值范围为 , 为奖励函数, 为折扣因子,取值范围为 , 表示新状态信息 下所有调度策略的最大 值;
重复迭代对选择的多个调度策略进行 值更新,当概率ε=0.1时,选择 值最大的调度策略作为初始调度策略;
将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,包括以下步骤:为每个子问题定义当前状态信息,状态信息包括电压水平、负荷需求、发电能力以及可再生能源输出:将输入的状态信息进行归一化处理后输入到多层感知DQN网络模型中;
多层感知器DQN网络模型通过前向传播计算出Q值向量,Q值向量中每个Q值代表在当前状态下选择的相应调度策略,选择Q值最大的调度策略作为子问题的调度策略;
所述多层感知DQN网络模型包括输入层、隐藏层以及输出层;
输入层:接收归一化后的状态信息向量;
隐藏层:设置为若干个,每个隐藏层均包含神经元,隐藏层之间采用ReLU激活函数;
输出层:输出一个Q值向量,其中每个元素对应一个调度策略的Q值;
将子问题的状态信息用向量s表示,维度为n,输入层接收的状态向量为:;
设多层感知器DQN网络模型中有 个隐藏层,则每个隐藏层的计算表示为:,式中, 是第 层的输出,表示第层隐
藏层, 是第 层的输出, 是第层的权重矩阵,维度为 ,其中是第层的神经元数量, 是第 层的偏置向量,维度为 , 是激活函数;
在经过 个隐藏层后,输出层将产生 值向量 ,维度为 ,其中 是调度策略的数量,表达式为: , 是输出层的权重矩阵,维度为, 是输出层的偏置向量,维度为 , 是 值向量,包含每个调度策略的 值;
对于某个调度策略, 值的计算表达式为: ,式中,为 值, 是输出层中对应调度策略 的第 个输入神经元的权重, 是第 层的第个神经元的激活值, 是对应调度策略 的偏置;
所述奖励函数的获取步骤为:
在仿真环境中应用调度策略时,获取可再生能源利用率、能量损耗以及约束违背指数,将可再生能源利用率、能量损耗以及约束违背指数综合计算获取奖励函数,表达式为:,式中, 为奖励函数,
为可再生能源利用率, 为能量损耗, 为约束违背指数, 、、 分别为可再生能源利用率、能量损耗以及约束违背指数的调节系数,且 、 、均大于0。
2.根据权利要求1所述的电网智能物联平台管理方法,其特征在于:通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略,包括以下步骤:获取每个子问题的初始调度策略后,初始化子问题的拉格朗日乘子 ;
对于每个子问题根据当前的拉格朗日乘子和其他子问题初始调度策略,求解子问题的局部优化问题后得到更新后的调度策略向量;
基于更新后的调度策略向量更新全局一致性变量,根据更新后的全局一致性变量和更新后的调度策略向量更新拉格朗日乘子;
重复进行调度策略向量更新步骤,当迭代次数等于次数阈值时,判断满足收敛条件,输出每个子问题最后一次更新得到的调度策略向量作为子问题的最终调度策略。
3.根据权利要求2所述的电网智能物联平台管理方法,其特征在于:求解子问题的局部优化问题后得到更新后的调度策略向量,函数表达式为:,式中, 为第 个
子问题在第 次迭代中的调度策略向量,即更新后的调度策略向量, 为第 个子问题在第 次迭代中的调度策略向量, 为第 个子问题在第 次迭代中的拉格朗日乘子,为步长参数, 为全局一致性变量,是各个子问题调度策略的平均值, 为子问题的目标函数, 为子问题的调度策略与全局一致性变量的距离;
基于更新后的调度策略向量更新全局一致性变量,表达式为: ,式中, 为更新后的全局一致性变量, 为子问题的数量, 为更新后的调度策略向量,根据更新后的全局一致性变量和更新后的调度策略向量更新拉格朗日乘子,表达式为: ,式中, 为更新后的拉格朗日乘子, 为更新后的全局一致性变量, 为更新后的调度策略向量,为步长参数。
4.根据权利要求3所述的电网智能物联平台管理方法,其特征在于:所述约束违背指数的计算表达式为: ,式中, 为第 个状态偏离值, 为状态数量,且状态偏离值的计算表达式为: ,式中, 为状态偏离值, 为实时状态取值, 为状态约束范围。
5.根据权利要求4所述的电网智能物联平台管理方法,其特征在于:所述可再生能源利用率的计算表达式为: ,式中, 是可再生能源所提供的总能量,是配电网中总的能量供应;
所述能量损耗的计算表达式为: ,式中, 为第 条线路的功率损耗,为线路 的输电时间,为线路数量。
6.电网智能物联平台管理系统,用于实现权利要求1?5任一项所述的管理方法,其特征在于:包括子问题划分模块、策略输出模块、仿真模块:子问题划分模块:将配电网优化问题分解为多个子问题;
策略输出模块:将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略;
仿真模块:依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中。 说明书 : 电网智能物联平台管理方法及系统技术领域[0001] 本发明涉及电网管理技术领域,具体涉及电网智能物联平台管理方法及系统。背景技术[0002] 在电力行业,智能电网的迅速发展使信息通信技术正以前所未有的广度、深度与电网生产、企业管理快速融合,配电房作为配网系统中的关键节点,担负着为用户分配电力的重担,传统模式的配电房存在日常巡视难以完全覆盖全部台区和点位、人员数量不足设备巡视不到位、环境监测信息记录不全不能完成集中监控管理、难以掌握设备全部工况、系统实时运行情况监测不全等问题,从功能响应到运维管理都无法与智能电网的建设要求相匹配;[0003] 在互联网开云优惠体育网页版入口发展的驱动下,物联网技术在电力系统中也同样取得了蓬勃发展,与传统电网管理相比,基于物联网技术的电网管理系统在信息获取、数据整合、状态感知及差异化运维方面具有不可替代的优势。[0004] 现有技术存在以下不足:[0005] 1、现有管理方法在面对大规模的配电网系统时,往往计算复杂度高,难以有效处理多约束、多目标的优化问题,且易陷入局部最优解,并且管理策略通常基于预设规则和静态模型,难以应对电网负载、发电量和故障的动态变化,导致策略不够灵活、响应速度慢;[0006] 2、管理方法通常侧重于全局优化或局部优化,很难同时兼顾全局和局部的协调,导致某些区域可能存在资源浪费或不合理的负荷分配。[0007] 基于此,本发明提出电网智能物联平台管理方法及系统,先通过将大规模优化问题分解为可并行求解的子问题,然后在动态环境中进行学习和调整,实时适应电网的变化,提供更灵活和智能的决策方案,协调每个子问题的调度方案,使得整体管理达到全局最优,提高配电网的运行效率和可靠性。发明内容[0008] 本发明的目的是提供电网智能物联平台管理方法及系统,以解决背景技术中不足。[0009] 为了实现上述目的,本发明提供如下技术方案:电网智能物联平台管理方法,所述管理方法包括以下步骤:[0010] 管理系统将配电网优化问题分解为多个子问题,将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略;[0011] 通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略;[0012] 依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中。[0013] 在一个优选的实施方式中,将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,包括以下步骤:[0014] 为每个子问题定义当前状态信息,状态信息包括电压水平、负荷需求、发电能力以及可再生能源输出:[0015] 将输入的状态信息进行归一化处理后输入到多层感知DQN网络模型中;[0016] 多层感知器DQN网络模型通过前向传播计算出Q值向量,Q值向量中的每个Q值代表在当前状态下选择的相应调度策略,选择Q值最大的调度策略作为子问题的调度策略。[0017] 在一个优选的实施方式中,所述多层感知DQN网络模型包括输入层、隐藏层以及输出层;[0018] 输入层:接收归一化后的状态信息向量;[0019] 隐藏层:设置为若干个,每个隐藏层均包含神经元,隐藏层之间采用ReLU激活函数;[0020] 输出层:输出一个Q值向量,其中每个元素对应一个调度策略的Q值;[0021] 将子问题的状态信息用向量s表示,维度为n,输入层接收的状态向量为:;[0022] 设多层感知器DQN网络模型中有 个隐藏层,则每个隐藏层的计算表示为:,式中, 是第 层的输出,表示第层隐藏层, 是第 层的输出, 是第层的权重矩阵,维度为 ,其中是第层的神经元数量, 是第 层的偏置向量,维度为 , 是激活函数;[0023] 在经过 个隐藏层后,输出层将产生 值向量 ,维度为 ,其中 是调度策略的数量,表达式为: , 是输出层的权重矩阵,维度为 , 是输出层的偏置向量,维度为 , 是 值向量,包含每个调度策略的 值;[0024] 对于某个调度策略, 值的计算表达式为: ,式中,为 值, 是输出层中对应调度策略 的第个输入神经元的权重, 是第层的第个神经元的激活值, 是对应调度策略 的偏置。[0025] 在一个优选的实施方式中,基于 值使用ε?greedy策略进行探索为子问题找到初始调度策略,包括以下步骤:[0026] 概率ε初始设置为0.9,每次迭代缩小0.1,生成一个0到1之间的随机数r,根据生成的随机数r进行调度策略选择,若随机数r小于概率ε,随机选择一个调度策略,若随机数r大于等于概率ε,选择 值最大的调度策略;[0027] 将选择的调度策略应用在仿真环境中,获取子问题的新状态信息,对选择的调度策略利用奖励函数结合新状态信息进行 值更新,表达式为:,式中, 为更新后的 值,为更新前的 值, 为学习率,取值范围为 , 为奖励函数, 为折扣因子,取值范围为 , 表示新状态信息 下所有调度策略的最大 值;[0028] 重复迭代对选择的多个调度策略进行 值更新,当概率ε=0.1时,选择 值最大的调度策略作为初始调度策略。[0029] 在一个优选的实施方式中,所述奖励函数的获取步骤为:[0030] 在仿真环境中应用调度策略时,获取可再生能源利用率、能量损耗以及约束违背指数,将可再生能源利用率、能量损耗以及约束违背指数综合计算获取奖励函数,表达式为: ,式中, 为奖励函数,为可再生能源利用率, 为能量损耗, 为约束违背指数, 、、 分别为可再生能源利用率、能量损耗以及约束违背指数的调节系数,且 、 、均大于0。[0031] 在一个优选的实施方式中,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略,包括以下步骤:[0032] 获取每个子问题的初始调度策略后,初始化子问题的拉格朗日乘子 ;[0033] 对于每个子问题根据当前的拉格朗日乘子和其他子问题初始调度策略,求解子问题的局部优化问题后得到更新后的调度策略向量;[0034] 基于更新后的调度策略向量更新全局一致性变量,根据更新后的全局一致性变量和更新后的调度策略向量更新拉格朗日乘子;[0035] 重复进行调度策略向量更新步骤,当迭代次数等于次数阈值时,判断满足收敛条件,输出每个子问题最后一次更新得到的调度策略向量作为子问题的最终调度策略。[0036] 在一个优选的实施方式中,求解子问题的局部优化问题后得到更新后的调度策略向量,函数表达式为: ,式中, 为第 个子问题在第 次迭代中的调度策略向量,即更新后的调度策略向量, 为第 个子问题在第 次迭代中的调度策略向量, 为第 个子问题在第 次迭代中的拉格朗日乘子, 为步长参数, 为全局一致性变量,是各个子问题调度策略的平均值,为子问题 的目标函数, 为子问题 的调度策略与全局一致性变量的距离;[0037] 基于更新后的 调度策略 向量更新全局一致性变量,表达式 为:,式中, 为更新后的全局一致性变量, 为子问题的数量,为更新后的调度策略向量,根据更新后的全局一致性变量和更新后的调度策略向量更新拉格朗日乘子,表达式为: ,式中, 为更新后的拉格朗日乘子, 为更新后的全局一致性变量, 为更新后的调度策略向量, 为步长参数。[0038] 在一个优选的实施方式中,所述约束违背指数的计算表达式为:,式中, 为第 个状态偏离值, 为状态数量,且状态偏离值的计算表达式为: ,式中, 为状态偏离值, 为实时状态取值, 为状态约束范围。[0039] 在一个优选的实施方式中,所述可再生能源利用率的计算表达式为:,式中, 是可再生能源所提供的总能量, 是配电网中总的能量供应;[0040] 所述能量损耗的计算表达式为: ,式中, 为第 条线路的功率损耗,为线路 的输电时间,为线路数量。[0041] 电网智能物联平台管理系统,包括子问题划分模块、策略输出模块、仿真模块:[0042] 子问题划分模块:将配电网优化问题分解为多个子问题;[0043] 策略输出模块:将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略;[0044] 仿真模块:依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中。[0045] 在上述技术方案中,本发明提供的技术效果和优点:[0046] 本发明通过将配电网优化问题分解为多个子问题,每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略。管理系统先通过将大规模优化问题分解为可并行求解的子问题,然后在动态环境中进行学习和调整,实时适应电网的变化,提供更灵活和智能的决策方案,协调每个子问题的调度方案,使得整体管理达到全局最优,提高配电网的运行效率和可靠性。附图说明[0047] 为了更清楚地说明本申请实施例或现有技术中的技术方案,下面将对实施例中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明中记载的一些实施例,对于本领域普通技术人员来讲,还可以根据这些附图获得其他的附图。[0048] 图1为本发明的方法流程图。具体实施方式[0049] 为使本发明实施例的目的、技术方案和优点更加清楚,下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0050] 实施例1:请参阅图1所示,本实施例所述电网智能物联平台管理方法,所述管理方法包括以下步骤:[0051] 管理系统将配电网优化问题分解为多个子问题,每个子问题对应于一个区域,每个子问题独立优化各自的调度策略,调度策略包括负荷分配和能量管理策略,将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略,使得每个子问题的初始调度策略逐渐趋向于一个协调的全局最优解,依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中。[0052] 本申请通过将配电网优化问题分解为多个子问题,每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略。管理系统先通过将大规模优化问题分解为可并行求解的子问题,然后在动态环境中进行学习和调整,实时适应电网的变化,提供更灵活和智能的决策方案,协调每个子问题的调度方案,使得整体管理达到全局最优,提高配电网的运行效率和可靠性。[0053] 实施例2:管理系统将配电网优化问题分解为多个子问题,每个子问题对应于一个区域,每个子问题独立优化各自的调度策略,调度策略包括负荷分配和能量管理策略,包括以下步骤:[0054] 将整个配电网划分为若干个区域,每个区域根据地理位置、负荷特性、可再生能源分布等因素确定。每个区域独立进行优化,为每个区域定义独立的子问题,主要包括:[0055] 负荷分配策略:确定区域内的负荷如何在各个节点之间分配,以最小化能量损耗并满足需求。[0056] 能量管理策略:管理区域内的能源资源(如太阳能、风能等),在满足负荷需求的同时,最大化可再生能源的利用并确保电压稳定。[0057] 为每个区域定义状态向量,状态向量包括:[0058] 电压水平:各节点的电压值。[0059] 负荷需求:各负荷节点的需求量。[0060] 发电能力:区域内各发电源的实时发电量。[0061] 可再生能源输出:区域内太阳能、风能等可再生能源的输出情况。[0062] 将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,包括以下步骤:[0063] 为每个子问题定义当前状态信息,状态信息通常包括电压水平、负荷需求、发电能力以及可再生能源输出:[0064] 电压水平:区域内各节点的电压值。[0065] 负荷需求:各负荷节点的实时需求量。[0066] 发电能力:区域内各发电源的实时发电量。[0067] 可再生能源输出:太阳能、风能等可再生能源的当前输出。[0068] 将输入的状态信息进行归一化处理,使其适合输入到神经网络中。这一步通常包括:[0069] 数据标准化:将不同量纲的状态信息转化为统一的范围(例如[0,1])。[0070] 数据预处理:对噪声数据进行平滑或过滤处理,以提高模型的输入质量。[0071] 多层感知器DQN网络模型通过前向传播计算出Q值向量,Q值向量中的每个Q值代表在当前状态下选择相应调度策略后,预期能获得的长期回报,对于每个子问题来说,选择Q值最大的调度策略作为当前状态下的调度决策。[0072] 多层感知DQN网络模型包括输入层、隐藏层以及输出层;[0073] 输入层:接收归一化后的状态信息向量。[0074] 隐藏层:设置为若干个,每个隐藏层均包含神经元,隐藏层之间可以采用ReLU(Rectified?Linear?Unit)激活函数。隐藏层的数量和神经元的个数可以根据问题的复杂性调整。[0075] 输出层:输出一个Q值向量,其中每个元素对应一个可能的调度策略的Q值。[0076] 将子问题的状态信息用向量s表示,维度为n,输入层接收的状态向量为:;[0077] 设多层感知器DQN网络模型中有 个隐藏层,则每个隐藏层的计算表示为:,式中, 是第 层的输出,表示第层隐藏层, 是第 层的输出(对于第一层 ), 是第层的权重矩阵,维度为 ,其中 是第 层的神经元数量, 是第 层的偏置向量,维度为 ,是激活函数(通常使用 )。[0078] 在经过 个隐藏层后,输出层将产生 值向量 ,维度为 ,其中 是调度策略的数量,表达式为: ,其中, 是输出层的权重矩阵,维度为 , 是输出层的偏置向量,维度为 , 是 值向量,包含每个可能调度策略的 值。[0079] 对于某个调度策略, 值的计算表达式为: ,式中,为 值, 是输出层中对应调度策略 的第个输入神经元的权重, 是第层的第个神经元的激活值, 是对应调度策略 的偏置。[0080] 基于 值使用ε?greedy策略进行探索为子问题找到初始调度策略,包括以下步骤:[0081] 在ε?greedy策略中,多层感知DQN网络模型会在每次选择调度策略时,以概率ε选择一个随机调度策略(探索),以概率选择当前估计Q值最高的调度策略(利用),这有助于在找到最优调度策略的同时避免陷入局部最优解;[0082] 概率ε初始设置为0.9,每次迭代缩小0.1,生成一个0到1之间的随机数r,用于决定此次决策是进行探索还是利用,根据生成的随机数r进行调度策略选择,若随机数r小于概率ε,随机选择一个调度策略,若随机数r大于等于概率ε,选择 值最大的调度策略;[0083] 将选择的调度策略应用在仿真环境中,获取子问题的新状态信息,例如,执行调度策略可能会导致各个节点的电压、负荷需求、发电量等参数发生变化,将发生变化的电压、负荷需求、发电量等参数作为新状态信息,对选择的调度策略利用奖励函数结合新状态信息进行 值更新,表达式为: ,式中, 为更新后的 值, 为更新前的 值, 为学习率,取值范围为 ,为奖励函数,为折扣因子,取值范围为 , 表示新状态信息下所有调度策略的最大 值;[0084] 重复迭代对选择的多个调度策略进行 值更新,当概率ε=0.1时,选择 值最大的调度策略作为初始调度策略。[0085] 本申请中,奖励函数的获取步骤为:[0086] 在仿真环境中应用调度策略时,获取可再生能源利用率、能量损耗以及约束违背指数,将可再生能源利用率、能量损耗以及约束违背指数综合计算获取奖励函数,表达式为: ,式中, 为奖励函数,为可再生能源利用率, 为能量损耗, 为约束违背指数, 、、 分别为可再生能源利用率、能量损耗以及约束违背指数的调节系数,且 、 、均大于0。[0087] 奖励函数取值越大,表明调度策略的综合性能越好。[0088] 可再生能源利用率的计算表达式为: ,式中, 是可再生能源所提供的总能量(千瓦时), 是配电网中总的能量供应(包括所有能源来源的能量,千瓦时),可再生能源利用率越大,表明调度策略对可再生能源的利用效率越高,越应该被使用。[0089] 能量损耗的计算表达式为: ,式中, 为第 条线路的功率损耗, 为线路的输电时间, 为线路数量,能量损耗越大,表明调度策略造成的能源消耗越大,越不应该被使用。[0090] 约束违背指数的计算表达式为: ,式中, 为第 个状态偏离值, 为状态数量,且状态偏离值的计算表达式为:,式中, 为状态偏离值, 为实时状态取值,为状态约束范围,约束违背指数越大,表明调度策略在仿真环境中导致状态信息偏离约束条件的值越大,越不应该被使用。[0091] 在初期训练时,管理系统可能会随机选择不同的调度策略,即使这些调度策略可能在短期内看起来不是最优的(如导致稍高的能量损耗),但这些探索可以帮助网络更好地理解状态空间和动作之间的关系。[0092] 通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略,使得每个子问题的初始调度策略逐渐趋向于一个协调的全局最优解,包括以下步骤:[0093] 获取每个子问题的初始调度策略后,初始化子问题的拉格朗日乘子[0094] 对于每个子问题根据当前的拉格朗日乘子和其他子问题初始调度策略,独立求解子问题的局部优化问题后得到更新后的调度策略向量,函数表达式为:,式中, 为第 个子问题在第 次迭代中的调度策略向量,即更新后的调度策略向量, 为第 个子问题在第 次迭代中的调度策略向量, 为第 个子问题在第 次迭代中的拉格朗日乘子,为步长参数, 为全局一致性变量,是各个子问题调度策略的平均值, 为子问题的目标函数, 为子问题的调度策略与全局一致性变量的距离。[0095] 基于更新后的 调度策略 向量更新全局一致性变量,表达式 为:,式中, 为更新后的全局一致性变量, 为子问题的数量,为更新后的调度策略向量。[0096] 根据更新后的全局一致性变量和更新后的调度策略向量更新拉格朗日乘子,表达式为: ,式中, 为更新后的拉格朗日乘子, 为更新后的全局一致性变量, 为更新后的调度策略向量,为步长参数;[0097] 重复进行调度策略向量更新步骤,当迭代次数等于次数阈值时,判断满足收敛条件,输出每个子问题最后一次更新得到的调度策略向量作为子问题的最终调度策略。[0098] 依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中,包括以下步骤:[0099] 将每个子问题的最终调度策略导入仿真环境,作为仿真模拟的起点,在仿真环境中运行配电网,根据导入的调度策略模拟配电网在一定时间范围内的运行情况,根据仿真结果和数据分析,对调度策略进行调整和修正。例如,如果某个区域的能量损耗较高,可以调整其负荷分配策略,将修正后的调度策略重新导入仿真环境,并准备进行下一次仿真迭代,重复仿真运行和调度策略调整的过程,每次迭代后策略会逐步优化,以更接近全局最优解,当最终调度策略的Q值大于等于Q值阈值后,判断满足收敛条件,为每个子问题输出全局最优调度策略并应用在配电网中。[0100] 实施例3:本实施例所述电网智能物联平台管理系统,包括子问题划分模块、策略输出模块、仿真模块:[0101] 子问题划分模块:将配电网优化问题分解为多个子问题,每个子问题对应于一个区域,每个子问题独立优化各自的调度策略,调度策略包括负荷分配和能量管理策略,子问题划分结果发送至策略输出模块;[0102] 策略输出模块:将每个子问题的当前状态信息输入多层感知DQN网络模型,多层感知DQN网络模型为每个子问题输出Q值,基于Q值使用ε?greedy策略进行探索为子问题找到初始调度策略,通过ADMM算法更新每个子问题拉格朗日乘子,并根据拉格朗日乘子调整每个子问题的初始调度策略后,得到每个子问题的最终调度策略,使得每个子问题的初始调度策略逐渐趋向于一个协调的全局最优解,子问题的最终调度策略信息发送至仿真模块;[0103] 仿真模块:依据每个子问题的最终调度策略在仿真环境中模拟配电网的运行情况,进行多次迭代不断调整和修正最终调度策略,满足收敛条件后,为每个子问题输出全局最优调度策略并应用在配电网中。[0104] 上述公式均是去量纲取其数值计算,公式是由采集大量数据进行软件模拟得到最近真实情况的一个公式,公式中的预设参数由本领域的技术人员根据实际情况进行设置。[0105] 应理解,本文中术语“和/或”,仅仅是一种描述关联对象的关联关系,表示可以存在三种关系,例如,A和/或B,可以表示:单独存在A,同时存在A和B,单独存在B这三种情况,其中A,B可以是单数或者复数。另外,本文中字符“/”,一般表示前后关联对象是一种“或”的关系,但也可能表示的是一种“和/或”的关系,具体可参考前后文进行理解。[0106] 应理解,在本申请的各种实施例中,上述各过程的序号的大小并不意味着执行顺序的先后,各过程的执行顺序应以其功能和内在逻辑确定,而不应对本申请实施例的实施过程构成任何限定。[0107] 本领域普通技术人员可以意识到,结合本文中所公开的实施例描述的各示例的单元及算法步骤,能够以电子硬件、或者计算机软件和电子硬件的结合来实现。这些功能究竟以硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本申请的范围。所属领域的技术人员可以清楚地了解到,为描述的方便和简洁,上述描述的系统、装置和单元的具体工作过程,可以参考前述方法实施例中的对应过程,在此不再赘述。[0108] 以上所述,仅为本申请的具体实施方式,但本申请的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本申请揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本申请的保护范围之内。因此,本申请的保护范围应以所述权利要求的保护范围为准。
专利地区:广东
专利申请日期:2024-09-10
专利公开日期:2024-11-29
专利公告号:CN118798579B