开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于近端策略优化算法优化网络流量调度方法

更新时间:2026-09-01
一种基于近端策略优化算法优化网络流量调度方法 专利申请类型:发明专利;
地区:广西-桂林;
源自:桂林高价值专利检索信息库;

专利名称:一种基于近端策略优化算法优化网络流量调度方法

专利类型:发明专利

专利申请号:CN202211042072.3

专利申请(专利权)人:桂林电子开云优惠体育网页版入口大学
权利人地址:广西壮族自治区桂林市七星区金鸡路1号

专利发明(设计)人:陈俊彦,王勇,黄雪锋,廖岑卉珊,谢小兰,李欣梅,肖微

专利摘要:本发明涉及深度学习技术领域,具体涉及一种基于近端策略优化算法优化网络流量调度方法,针对软件定义网络的数据平面具有时间特征和空间特征,为了全局地考虑网络的时空相关性,提出了使用门控循环单元和图注意力网络方法提取状态信息中的时序相关性和空间相关性,为深度强化学习的决策提供包含更多环境的隐含信息,从而解决网络流量工程问题,充分利用网络资源动态调整网络负载,有效缓解网络链路拥塞,进而优化网络性能。

主权利要求:
1.一种基于近端策略优化算法优化网络流量调度方法,其特征在于,包括下列步骤:构建ASTPPO系统架构;
所述ASTPPO系统架构包括数据交换层、控制层和智能决策层,所述数据交换层由支持SDN工作协议的SDN交换机组成,所述控制层与数据交换层通过南向接口连接,与智能决策层通过北向接口连接,所述智能决策层输出链路权重用于路由策略更新;
采集网络链路信息和网络拓扑信息;
分别生成状态信息和奖励值;
分别生成状态信息和奖励值的过程,具体为控制层的信息收集器处理网络链路信息,生成输入智能决策层中智能体的状态信息,控制层的奖励函数模块处理信息收集器采集的网络链路信息,生成输入智能决策层智能体的奖励值,状态信息和奖励值均通过北向接口传输给智能体;
以所述状态信息和所述奖励值为输入,获得动作值并转发;
以所述状态信息和所述奖励值为输入,获得动作值并转发的过程,具体为所述智能体接收状态信息和奖励值作为智能体算法的输入,使用智能体算法生成网络拓扑中的链路权重作为智能体决策的动作值,用于网络流量调度策略优化,随后通过北向接口将动作值传输给控制层的流表下发器;
所述智能体算法中设计门控循环单元模块、自注意力机制模块和图注意力网络模块进行特征提。渲型ü趴匮返ピ?椴痘袷淙胱刺氖毙蛳喙匦畔,并使用自注意力机制模块计算权重,通过图注意力网络模块捕获输入状态的空间相关信息;
基于所述动作值生成SDN流表,下发所述SDN流表进行流量调度。
2.如权利要求1所述的基于近端策略优化算法优化网络流量调度方法,其特征在于,在采集网络链路信息和网络拓扑信息的过程中,控制层的信息收集器每隔一段时间通过南向接口从数据交换层的SDN交换机采集网络链路信息,控制层的拓扑发现器每隔一段时间通过南向接口从数据交换层的SDN交换机采集网络拓扑信息。
3.如权利要求2所述的基于近端策略优化算法优化网络流量调度方法,其特征在于,在基于所述动作值生成SDN流表,下发所述SDN流表进行流量调度的过程中,控制层的流表下发器接收智能体下发的动作值,并结合拓扑发现器采集的网络拓扑信息生成SDN流表,通过南向接口把SDN流表下发给数据交换层的SDN交换机。 说明书 : 一种基于近端策略优化算法优化网络流量调度方法技术领域[0001] 本发明涉及深度学习技术领域,具体涉及一种基于近端策略优化算法优化网络流量调度方法。背景技术[0002] 近年来,随着互联网快速发展,网络的规模日趋庞大,社交媒体、高清影视、在线游戏以及5G的普及使得网络流量迅速增长,传统的转发网络压力日益见长。为了适应网络规模的持续增长,更灵活、更智能、流量承载能力更高的网络架构,即软件定义网络(SoftwareDefinedNetworking,SDN)应运而生。在对于智能化SDN网络的优化目标中,流量工程(TrafficEngineering,TE)优化是一个重要领域。针对各种网络场景的TE优化目标,存在大量基于流的路由、链路状态协议或覆盖网络等等技术的方案。在相关文献中解决的一个基本TE问题是域内TE,即同一个自治域的网络如运营商网络、数据中心网络或园区网等等,其中经典的优化目标是最小化自管理网络域内的最大链路负载,这已经被证实是一个NP?hard问题。[0003] 在过去的几年里,研究人员将机器学习(MachineLearning,ML)应用于复杂的网络控制和管理问题,尤其是深度强化学习(DeepReinforcementLearning,DRL)技术应用在网络控制上取得了显著开云优惠体育网页版入口。但现有的DRL应用于SDN的研究还没有关注到SDN网络的特性,这使得DRL算法在SDN网络性能优化的表现有所局限。定制化的深度强化学习模型在特定的网络场景下表现较优,但在其他网络环境的场景下的泛化能力有待验证。而通过其他网络如CNN、RNN或GNN进行优化的DRL算法仅考虑到了网络时序相关性或网络空间相关性,没有全局地考虑网络的时空相关性。发明内容[0004] 本发明的目的在于提供一种基于近端策略优化算法优化网络流量调度方法,解决现有强化学习方法未考虑网络时序相关性或网络空间相关性,在SDN网络性能优化效果不佳的问题。[0005] 为实现上述目的,本发明提供了一种基于近端策略优化算法优化网络流量调度方法,包括下列步骤:[0006] 构建ASTPPO系统架构;[0007] 采集网络链路信息和网络拓扑信息;[0008] 分别生成状态信息和奖励值;[0009] 以所述状态信息和所述奖励值为输入,获得动作值并转发;[0010] 基于所述动作值生成SDN流表,下发所述SDN流表进行流量调度。[0011] 其中,所述ASTPPO系统架构包括数据交换层、控制层和智能决策层,所述数据交换层由支持SDN工作协议的SDN交换机组成,所述控制层与数据交换层通过南向接口连接,与智能决策层通过北向接口连接,所述智能决策层输出链路权重用于路由策略更新。[0012] 其中,在采集网络链路信息和网络拓扑信息的过程中,控制层的信息收集器每隔一段时间通过南向接口从数据交换层的SDN交换机采集网络链路信息,控制层的拓扑发现器每隔一段时间通过南向接口从数据交换层的SDN交换机采集网络拓扑信息。[0013] 其中,分别生成状态信息和奖励值的过程,具体为控制层的信息收集器处理网络链路信息,生成输入智能决策层中智能体的状态信息,控制层的奖励函数模块处理信息收集器采集的网络链路信息,生成输入智能决策层智能体的奖励值,状态信息和奖励值均通过北向接口传输给智能体。[0014] 其中,以所述状态信息和所述奖励值为输入,获得动作值并转发的过程,具体为所述智能体接收状态信息和奖励值作为智能体算法的输入,使用智能体算法生成网络拓扑中的链路权重作为智能体决策的动作值,用于网络流量调度策略优化,随后通过北向接口将动作值传输给控制层的流表下发器。[0015] 其中,所述智能体算法中设计门控循环单元模块、自注意力机制模块和图注意力网络模块进行特征提。渲型ü趴匮返ピ?椴痘袷淙胱刺氖毙蛳喙匦畔,并使用自注意力机制模块计算权重,通过图注意力网络模块捕获输入状态的空间相关信息,最终使输出的动作值具有较好的优化性能和泛化能力。[0016] 其中,在基于所述动作值生成SDN流表,下发所述SDN流表进行流量调度的过程中,控制层的流表下发器接收智能体下发的动作值,并结合拓扑发现器采集的网络拓扑信息生成SDN流表,通过南向接口把SDN流表下发给数据交换层的SDN交换机。[0017] 本发明提供了一种基于近端策略优化算法优化网络流量调度方法,针对软件定义网络的数据平面具有时间特征和空间特征,为了全局地考虑网络的时空相关性,提出了使用门控循环单元和图注意力网络方法提取状态信息中的时序相关性和空间相关性,使深度强化学习能够关注到网络的空间信息和时序信息,为强化学习的决策提供包含更多环境的隐含信息,从而解决网络TE问题,充分利用网络资源,实现了在负载均衡上有较高的可用性和较好的性能。附图说明[0018] 为了更清楚地说明本发明实施例或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。[0019] 图1是本发明的一种基于近端策略优化算法优化网络流量调度方法的ASTPPO系统架构示意图。[0020] 图2是本发明的ASTPPO基础模型中的智能体架构图。[0021] 图3是本发明的门控循环单元模块输入输出示意图。具体实施方式[0022] 下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描述的实施例是示例性的,旨在用于解释本发明,而不能理解为对本发明的限制。[0023] 以下为说明书中对应的术语缩写说明:[0024] 基于注意机制和时空相关性的近端策略优化算法(ASTPPO:ProximalPolicyOptimizationbasedonAttentionmechanismandSpatio?Temporalcorrelation);[0025] 门控循环单元(GRU:GateRecurrentUnit);[0026] 自注意力机制模块(self?attention);[0027] 图注意力网络(GAT:GraphAttentionNetwork);[0028] 多层感知器(MLP:Multi?LayerPerceptron);[0029] 深度强化学习(DRL:DeepReinforcementLearning)。[0030] 本发明提供了一种基于近端策略优化算法优化网络流量调度方法,包括下列步骤:[0031] S1:构建ASTPPO系统架构;[0032] S2:采集网络链路信息和网络拓扑信息;[0033] S3:分别生成状态信息和奖励值;[0034] S4:以所述状态信息和所述奖励值为输入,获得动作值并转发;[0035] S5:基于所述动作值生成SDN流表,下发所述SDN流表进行流量调度。[0036] 具体的,ASTPPO系统结构由三个平面组成:数据交换层、控制层和智能决策层,如图1所示。数据交换层主要由支持SDN工作协议(OpenFlow、P4等)的SDN交换机组成,实现网络流量数据转发。控制层由运行SDN控制器程序的服务器组成,实现网络状态采集、智能体奖励生成、网络拓扑发现和SDN流表下发等功能。智能决策层由运行智能体程序的服务器组成,生成网络流量调度决策。中间控制层与数据交换层通过南向接口连接,与智能决策层通过北向接口连接。[0037] 以下结合系统结构以及具体实施步骤对本发明进一步详细说明:[0038] S2、采集网络链路信息和网络拓扑信息,具体为控制层的信息收集器每隔一段时间通过南向接口从数据交换层的SDN交换机采集网络链路信息。控制层的拓扑发现器每隔一段时间通过南向接口从数据交换层的SDN交换机采集网络拓扑信息。[0039] 上述步骤S2中所述网络链路信息,包括当前时刻的网络链路流量Tτ、网络链路利τ τ τ?1用率U、网络链路流量需求P以及前一时间片的动作A ,如式1所示。[0040] Sτ=[Tτ,Uτ,Pτ,Aτ?1]4×m(1)[0041] 式中,m为网络中各交换机之间存在的链路的数量;Tτ为τ时刻网络中每条链路实τ际通过流量的集合,如式2所示;U 为τ时刻网络中每条链路利用率的集合,如式3所示,链路利用率即链路通过的流量与链路带宽的比值,如式4所示,其中ci为第i条链路的链路带宽;τP为τ时刻网络中每条链路需要通过流量的集合,如式5所示。[0042][0043][0044][0045][0046] S3、控制层的信息收集器处理网络链路信息,生成输入智能决策层智能体的状态信息,通过北向接口传输给智能体。控制层的奖励函数模块处理信息收集器采集的网络链路信息,生成输入智能决策层智能体的奖励值,通过北向接口传输给智能体。[0047] 上述步骤S3中所述输入智能决策层智能体的状态信息,包含过去l个,采用滑动窗τ口的方法输入序列,τ时刻的智能体输入为式6,其中x为τ时刻的网络链路信息,如式7。[0048] Xτ=[xτ?l,xτ?l+1,…,xτ]l×d×m(6)[0049] xτ=Sτ(7[0050] 上述步骤S3中所述奖励函数,从负载均衡和拥塞规避两个优化目标进行设计。负τ载均衡即最小化链路利用率全距F ∈[0,1],链路利用率全距为所有链路中利用率最大值τ与最小值的差值,如式8所示;拥塞规避即最小化拥塞系数Ω ∈[0,1],拥塞系数为满载链路(即链路利用率值为1)的数量与网络链路总数m的比值,如式9所示。[0051] Fτ=max(Uτ)?min(Uτ)(8)[0052][0053] 在本发明中,链路利用率的全距设置为正向奖励,而拥塞系数设置为负向奖励。对于负载均衡,链路利用率全距越。悄芴逵Φ玫皆蕉嗟慕崩,因此链路利用率全距和奖励的关系为负相关。本发明设计链路利用率的全距设置为正向奖励,这能够激励智能体对负载均衡的优化。对于拥塞规避,拥塞系数越。悄芴逵Φ玫皆蕉嗟慕崩,因此拥塞系数的优化和奖励也是呈负相关。由于现实中对于网络的拥塞的容忍度是较低的,因此本发明设计拥塞系数为负向奖励。奖励函数的计算公式如式10所示,其中α1、α2、α3、α4和α5为可调系数,可对奖励值R的范围和两个优化目标的权重进行调整。[0054] R=α1?log((Fτ+α2)α3)?α4*(Ωτ)α5(10)[0055] S4、智能决策层的智能体接收状态信息和奖励值作为智能体算法的输入,使用智能体算法生成网络拓扑中的链路权重作为智能体决策的动作值,用于网络流量调度策略优化。随后通过北向接口将动作值传输给控制层的流表下发器。[0056] 上述步骤S4所述智能体决策的动作值为每条链路赋权重,如式11。[0057][0058] 上述步骤S4所述智能体算法,算法结构采用近端策略优化算法的Actor?Critic网络结构。考虑到网络信息的时序相关性和空间相关性,设计了门控循环单元模块、自注意力机制模块、图注意力网络模块三个主要组件负责不同的任务进行特征提。涑鼍哂惺毙蛳喙睾涂占湎喙氐囊含信息。算法通过GRU捕获输入状态的时序相关信息,随后使用自注意力机制对GRU输出值计算每个元素权重,并通过全连接(FC)得到GAT的输入,最后通过GAT捕获输入状态的空间相关信息,输出具有时序相关和空间相关的隐含信息。同时,使用skip?connect方法将输入状态的关键原始信息和经过特征提取的隐含信息共同输入MLP中,并通过注意力机制计算隐含信息和关键原始信息的权重,平衡隐含信息和关键原始信息的比重。最后,Actor网络通过MLP层输出智能决策层的动作值,Critic网络通过MLP层输出策略梯度算法所需的估计值,并通过策略梯度算法更新Actor网络和Critic网络的可学习参数。Actor和Critic网络使用同样的结构,但不共享网络参数。整体架构图如图2所示。[0059] S4.1、使用GRU模块捕获状态信息的时序相关信息。首先,将状态信息Xτ输入到门t t控循环单元模块,分别计算更新门门控信号z和重置门门控信号r ,如式12和式13所示,其z z r r t?1 t τ中W、U 、W和U 为可学习参数,h 为上一GRU单元的输出,x为X 的第t个时序信号。其次计t′算当前时间步的隐层输出h ,如式14,其中W、U为可学习参数。最后,计算当前GRU单元输出th,如式15。[0060] zt=σ(Wzxt+Uzht?1)(12)[0061] rt=σ(Wrxt+Urht?1)(13)[0062] ht'=tanh(Wxt+rt⊙Uht?1)(14)[0063] ht=zt⊙ht?1+(1?zt)⊙ht'(15)[0064] 本发明中状态信息Xτ共包含l个网络链路信息,有2层循环的GRU单元,如图3所示。2×l×d×m因此GRU模块输出为隐含序列H∈R ,该序列含有时序相关的隐藏信息,如式16所示。[0065] H=[h1,h2,…,h2l]2×l×d×m(16)[0066] S4.2、使用自注意力机制模块对GRU输出的隐含序列计算其每个元素权重。将上一步骤输出的隐含序列H输入到自注意力机制模块,首先计算Q、K和V矩阵,如式17、18、19,其中WQ、WK和WV为可学习参数。随后计算出每一个矩阵的注意力,如式20,得到如式21的注意力a a A矩阵H 。最后将H 与GRU输出的隐含序列H做哈达玛积,得到自注意力模块输出H ,如式22所示,其中WA为可学习参数矩阵。[0067] Q=WQH(17)[0068] K=WKH(18)[0069] V=WVH(19)[0070][0071][0072] HA=WA(H⊙Ha)(22)[0073] S4.3、使用GAT模块捕获状态信息的空间相关信息。经过自注意力模块的输出HA∈d×m A'R 进行转置得到GAT输入H ,如式23。随后计算eij,如式24,eij表示j节点的特征对i节点的重要性。然后将eij通过leakyReLU激活函数和softmax归一化得到注意力系数αij,如式25,e其中W 为可学习参数。最后,将注意力系数与对应的节点特征做线性变换,再通过σ激活函h数变换后,作为节点特征的输出 如式26,其中W为可学习参数。所有节点特征为GAT的输G G出H,如式27。H是经过特征提取的具有时序相关和空间相关的隐含信息。[0074][0075][0076] αij=Softmaxj(leakyReLU(eij))(25)[0077][0078][0079] S4.4、使用skip?connect方法捕获状态信息的关键原始信息(即链路利用率Uτ),将其和经过特征提取的隐含信息共同输入MLP中,并通过注意力机制计算隐含信息和关键G原始信息的权重,平衡隐含信息和关键原始信息的比重。图注意力网络的输出H 与状态信τ息的链路利用率U拼接,如式28。拼接之后再使用注意力机制使模型更关注直接特征或隐a' τ τ含特征的某一部分,如式29,其中H 为H的自注意力输出,即为H的权重。计算出关键原始A' τ信息和隐含信息的注意力值H 后,将其输入MLP层,如式30,得到Y。[0080] Hτ=[HG||Uτ]m×(d+1)(28)[0081] HA'=WA(Hτ⊙Ha')(29)[0082][0083] S4.5、Actor网络将上一步骤MLP层的输出Yτ拆分为多维正态分布的输入参数均值τ τ矩阵μ和标准差矩阵logstd,如式31。再从生成的分布中采样出动作,如式32。随后对采样输出进行线性映射作为智能体决策的动作,如式33,映射范围为[α,β]。[0084][0085] Aτ'=sample(NormalDistributions(μτ,logstdτ))(32)[0086][0087] S4.6、使用近端策略优化算法的策略梯度进行可学习参数更新。Actor网络的学习CLIP参数更新如式34所示,其中θ为Actor网络的学习参数,αθ是可调参数,L (θ)是Actor网络的损失函数,如式35所示,其中E表示累计回报期望;r(θ)是新策略和旧策略之间的概率比,如式36所示,其中θ为Actor网络的学习参;A是t时刻的估计优势函数,采用广义优势估计(GeneralizedAdvantageEstimation,GAE)的方法对优势函数进行估计,如式37所示,其中λ和γ为可调参数,N为需要计算的关联范围内的步数,V(·)为Critic输出的估计值,ω为Critic网络的学习参数,R为t+1时刻奖励;ε为表示允许更新的范围的限制的超参数。当新策略和旧策略之间的概率比落在(1?ε)和(1+ε)范围之外,则优势函数将被裁剪。[0088][0089][0090][0091][0092] Critic网络的学习参数更新如式38所示,其中αω是可调参数,J(ω)是Critic网络的损失函数,如式39所示。[0093][0094][0095] 在步骤S5中控制层的流表下发器接收智能体下发的动作值,并结合拓扑发现器采集的网络拓扑信息生成网络流量转发路径。随后将转发路径转换为SDN流表,通过南向接口把SDN流表下发给数据交换层的SDN交换机。SDN交换机根据流表信息进行网络流量的转发,实现网络负载的动态调整,有效缓解网络链路拥塞,进而优化网络性能。[0096] 以上所揭露的仅为本发明一种较佳实施例而已,当然不能以此来限定本发明之权利范围,本领域普通技术人员可以理解实现上述实施例的全部或部分流程,并依本发明权利要求所作的等同变化,仍属于发明所涵盖的范围。

专利地区:广西

专利申请日期:2022-08-29

专利公开日期:2024-11-19

专利公告号:CN115550268B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载