开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于深度强化学习的车辆最优控制方法发明专利

更新时间:2026-09-14
一种基于深度强化学习的车辆最优控制方法发明专利 专利申请类型:发明专利;
地区:海南-海口;
源自:海口高价值专利检索信息库;

专利名称:一种基于深度强化学习的车辆最优控制方法

专利类型:发明专利

专利申请号:CN202410447443.9

专利申请(专利权)人:海南大学
权利人地址:海南省海口市人民大道58号

专利发明(设计)人:羊秋玲,费汉生,黄喜文,黄向党

专利摘要:本发明公开一种基于深度强化学习的车辆最优控制方法,步骤1,建立策略网络和相互独立的价值网络;步骤2,控制车辆运行,收集样本;步骤3,将数据st、at输入价值网络获取两个价值评分并取其中较小值来计算预测得分;将状态st+1输入到策略网络得到动作at+1,将数据st+1、at+1分别输入两个价值网络中两个价值评分并根据价值评分和预测得分来确定TD误差,对价值网络进行更新;步骤4,每更新两次价值网络后对策略网络进行更新;步骤5,重复步骤2至4进行网络参数调优,直至策略网络达到预期的效果,输出最终更新得到的策略网络。本发明能够优化控制车辆的过程中确保稳定性。

主权利要求:
1.一种基于深度强化学习的车辆最优控制方法,其特征在于,包括如下步骤:步骤1,建立策略网络和两个相互独立的价值网络,并初始化网络参数;
步骤2,在仿真系统中控制车辆以最优的速度沿已规划路径行驶,提取车辆当前状态st,将状态st输入到策略网络中得到t时刻的动作at,车辆根据所述动作与仿真系统交互获得t+
1时刻车辆的状态st+1,根据奖励函数计算出奖励rt,将四元组(st,at,st+1,rt)作为数据样本;基于数据样本构建经验池;
步骤3,从经验池中随机抽取数据样本并将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分;将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定TD误差,基于TD误差对两个价值网络进行更新;
步骤4,每更新两次价值网络之后对策略网络进行一次更新;
步骤5,重复步骤2至步骤4,进行网络参数调优,直至达到最大迭代次数或策略网络达到预期的效果,输出最终更新得到的策略网络,所述状态、动作以及奖励分别定义如下:
状态定义:车辆行驶速度v,车辆转向角θ,并将已规划路径抽象为一系列距离相同的点P={p1,p2,p3,....pn},从中取前m个点记为P={p0,p1,p2,p3,....pm},3
动作定义:动作即为车辆根据当前情况选择的策略,由加减速和转向组成;
奖励定义:奖励公式如下:
R=Rover+Rspeedup+Rlengthen+Rdeviation+F1(α,v)+F2(v,ld)2
Rspeedup=?μv+μ′v?150
2
Rlengthen=?ωld+ω′ld?150
其中μ、μ′、ω、ω′、ρ、ρ'为预设常数,根据预先实验确定;Rover为道路奖励;Rspeedup为速度提高奖励;Rlengthen为前视距离变长奖励;Rdeviation为路径拟合奖励;F1(α,v)为速度奖励;
F2(v,ld)为前视距离奖励,v为车速;ld为前视距离;α为路径曲率,F1(α,v)和F2(v,ld)均根据先验经验设定。
2.根据权利要求1所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,还包括如下步骤:将所述最终更新得到的策略网络作为最优策略用于智能车的部署。
3.根据权利要求1所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,所述路径曲率采用平均曲率,公式如下:i
其中p∈P为规划路径抽象点的前m个。
4.根据权利要求1所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,基于深度强化学习TD3构建所述策略网络和两个相互独立的价值网络,其中,所述策略网络,用于利用VQ将夹角集合A进行离散化处理,获得离散向量;将离散向量输入时域卷积网络,获得卷积向量,所述时域卷积网络的激活函数采用LekeReluactivation,并在每层的输入进行中心化处理;将卷积向量与[θ,v,derror]向量进行合并并输入全连接层,输出下一时刻的预测动作;
所述价值网络,用于利用VQ将夹角集合A进行离散化处理,获得离散向量A;将离散向量A与[θ,v,derror,ld,speed]向量进行合并并输入全连接层中,输出价值评分。
5.根据权利要求4所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分 公式如下:式中,Qθ1和Qθ2为价值网络,γ为折扣率,w1,new和w2,new是更新过价值网络的参数, 和 分别是对当前数据st、at的价值评分。
6.根据权利要求5所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定TD误差,基于TD误差对两个价值网络进行更新,具体公式如下:式中,β为学习率, 为对当前策略的预测得分,δ1,j和δ2,j为预测得分与价值网络得分的差值,Qθ1和Qθ2为价值网络, 表示对参数进行求导,w1,now和w2,now是价值网络的参数,w1,new和w2,new是更新过价值网络的参数。
7.根据权利要求6所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,所述策略网络更新,公式如下:式中,τ为学习率, 表示对参数进行求导, 为策略网络, 是策略网络的参数,是更新过策略网络的参数,Qθ1和Qθ2为价值网络,θ1和θ2分别为两个价值网络的参数。
8.根据权利要求7所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,还包括如下步骤:在策略网络中引入了噪声,噪声从截断正态分布中随机抽。沟貌呗酝绺踊娜ザ晕粗鹘刑剿,公式如下:a←πθ(s)+εε~clip(N(0,σ),?C,C)
式中,ε表示噪声,N(0,σ)表示均值为0,方差为σ的正态分布,clip表示裁剪操作,?c和c表示裁剪的范围。 说明书 : 一种基于深度强化学习的车辆最优控制方法技术领域[0001] 本发明涉及自动驾驶技术领域,尤其涉及一种基于深度强化学习的车辆最优控制方法。背景技术[0002] 自动驾驶已经被真实应用在我们的生活里面,并且其安全能和可靠性已经经过严格的测试。自动驾驶需要很多的关键技术的融合,如SLAM、路径规划等。然而自动驾驶面临复杂多变的道路环境条件,其规则难以抽象为公式或简单逻辑。随着深度表示学习的发展,强化学习领域已经成为一个强大的学习框架。强化学习作为机器学习的一个分支,旨在训练智能体在智能体与未知环境不断交互的过程中,通过强化和惩罚的方式完成任务。RL在移动车辆方面已经有很多优秀的研究工作,一些研者如使用RL进行局部的避障、端到端的自动驾驶、自动泊车。对车辆最优控制控制的较多侧重车俩的纵向速度或者车辆的横向控制。然而很少关注车辆整体最优控制问题,本专利讨论的是运动规划中的一个子问题,即在确保车辆的动态稳定性的前提下以近似最优速度控制车辆贴合规划路径进行移动,并最小化移动时间。[0003] 保证车辆的动态稳定性是最优控制的前提,动态稳定性指的是车辆不会发生侧移、倾翻、移动停顿等。MPC(ModelPredictControl)在车辆上的控制应用广泛,MPC目的是稳定车辆的行为,同时跟踪指定的路径,通过对车辆的运动学进行建模,优化约束目标函数,求解出最优控制数值。如在使用MPC沿着特定轨道高速驾驶赛车。预测系统未来动态、求解优化问题、控制是MPC在每一个时刻的循环计算过程。MPC在每个控制周期都需要重新利用未来N步的模型计算得到当前执行的控制指令,MPC利用了一个比原始空间模型大很多的模型(更高的计算成本)仅仅只得到当前一步的最优控制值,其对对计算硬件性能具有一定的要求。显然,对于搭载低性能处理器的车辆这种方法不适合,如AutomatedGuidedVehicle采用的往往是低性能的处理器。[0004] 与MPC相关的有purepursuitcontrol,纯追踪控制是简单的几何控制器,对计算能力要求很低,在树莓派这样的低性能单板机上也能高速运行,成为了一种流行的前轮转向车路径跟踪算法。purepursuit是一种P类控制器,前馈距离过短会引起车运动的横向震荡,过长则会导致在路径弯曲点的拟合度不足。工程上常常让前馈距离随速度增大而增大。尽管如此,它们的性能相当受限于相对较低的速度,需要配合适合的速度控制器才能让purepursuit适用在高速场合。因此,亟需一个对计算资源要求低、控制率高的最优化控制的模型。由于最优控制受车辆动态能力的影响,例如加速度、摩檫力、离心力等,还需要要求控制模型具有较强的鲁棒性来确保车辆在运动过程中稳定。发明内容[0005] 为了解决上述技术问题,本发明提出一种基于深度强化学习的车辆最优控制方法,是在基于一定的先验知识下强化学习方法,确保车辆在动态稳定性的前提下以近似最优速度控制车辆贴合规划路径进行移动,并最小化移动时间。[0006] 为了达到上述目的,本发明的技术方案如下:[0007] 一种基于深度强化学习的车辆最优控制方法,包括如下步骤:[0008] 步骤1,建立策略网络和两个相互独立的价值网络,并初始化网络参数;[0009] 步骤2,在仿真系统中控制车辆以最优的速度沿已规划路径行驶,提取车辆当前状态st,将状态st输入到策略网络中得到t时刻的动作at,车辆根据所述动作与仿真系统交互获得t+1时刻车辆的状态st+1,根据奖励函数计算出奖励rt,将四元组(st,at,st+1,rt)作为数据样本;基于数据样本构建经验池;[0010] 步骤3,从经验池中随机抽取数据样本并将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分;将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定TD误差,基于TD误差对两个价值网络进行更新;[0011] 步骤4,每更新两次价值网络之后对策略网络进行一次更新;[0012] 步骤5,重复步骤2至步骤4,进行网络参数调优,直至达到最大迭代次数或策略网络达到预期的效果,输出最终更新得到的策略网络。[0013] 优选地,还包括如下步骤:将所述最终更新得到的策略网络作为最优策略用于智能车的部署。[0014] 优选地,所述状态、动作以及奖励分别定义如下:[0015] 状态定义:车辆行驶速度v,车辆转向角θ,并将已规划路径抽象为一系列距离相同的点P={p1,p2,p3,....pn},从中取前m个点记为P={p0,p1,p2,p3,....pm},3[0016] 动作定义:动作即为车辆根据当前情况选择的策略,由加减速和转向组成;[0017] 奖励定义:奖励公式如下:[0018] R=Rover+Rspeedup+Rlengthen+Rdeviation+F1(α,v)+F2(v,ld)[0019] Rspeedup=?μv2+μ′v?150[0020] Rlengthen=?ωld2+ω′ld?150[0021][0022] 其中μ、μ′、ω、ω′、ρ、ρ'为预设常数,根据预先实验确定;Rover为道路奖励;Rspeedup为速度提高奖励;Rlengthen为前视距离变长奖励;Rdeviation为路径拟合奖励;F1(α,v)为速度奖励;F2(v,ld)为前视距离奖励,v为车速;ld为前视距离;α为路径曲率,F1(α,v)和F2(v,ld)均根据先验经验设定。[0023] 优选地,所述路径曲率采用平均曲率,公式如下:[0024][0025] 其中pi∈P为规划路径抽象点的前m个。[0026] 优选地,基于深度强化学习TD3构建所述策略网络和两个相互独立的价值网络,其中,[0027] 所述策略网络,用于利用VQ将夹角集合A进行离散化处理,获得离散向量;将离散向量输入时域卷积网络,获得卷积向量,所述时域卷积网络的激活函数采用LekeReluactivation,并在每层的输入进行中心化处理;将卷积向量与[θ,v,derror]向量进行合并并输入全连接层,输出下一时刻的预测动作;[0028] 所述价值网络,用于利用VQ将夹角集合A进行离散化处理,获得离散向量A;将离散向量A与[θ,v,derror,ld,speed]向量进行合并并输入全连接层中,输出价值评分。[0029] 优选地,将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分 公式如下:[0030][0031] 式中,Qθ1和Qθ2为价值网络,γ为折扣率,w1,new和w2,new[0032] 是更新过价值网络的参数, 和 分别是对当前数据st、at的价值评分。[0033] 优选地,将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定TD误差,基于TD误差对两个价值网络进行更新,具体公式如下:[0034][0035][0036][0037] 式中,β为学习率, 为对当前策略的预测得分,δ1,j和δ2,j为预测得分与价值网络得分的差值,Qθ1和Qθ2为价值网络, 表示对参数进行求导,w1,now和w2,now是价值网络的参数,w1,new和w2,new是更新过价值网络的参数。[0038] 优选地,所述策略网络更新,公式如下:[0039][0040] 式中,τ为学习率, 表示对参数进行求导, 为策略网络, 是策略网络的参数, 是更新过策略网络的参数,Qθ1和Qθ2为价值网络,θ1和θ2分别为两个价值网络的参数。[0041] 优选地,还包括如下步骤:在策略网络中引入了噪声,噪声从截断正态分布中随机抽。沟貌呗酝绺踊娜ザ晕粗鹘刑剿,公式如下:[0042] a←πθ(s)+εε~clip(N(0,σ),?c,c)[0043] 式中,ε表示噪声,N(0,σ)表示均值为0,方差为σ的正态分布,clip表示裁剪操作,?c和c表示裁剪的范围。[0044] 基于上述技术方案,本发明的有益效果是:本发明提出了一种结合purepursuit算法的RL最优控制SQ?PAO(StateQuantizeforPursuitApproximateOptimalcontrol)方法,用于沿着已知的任意路径以最优速度贴合路径驾驶车辆。我们根据先验线性知识设计奖励函数,指导智能体快速地进行学习;对输入智能体的序列状态使用VQ进行稀疏离散化,以降低表征车辆状态的空间大,把无限的空间限定在了一定有限的空间内,智能体在有限空间里面输出动作,对相似的状态(包含训练之外的状态)也能做出近似行为。VQ降低了状态微小变化带来的行为输出跃变,提高了模型的鲁棒性。智能体学习在加速(和减速),以及随速度自适应的的前馈距离大。允沟迷诼肪渡系拿恳坏隳芙谱钣呕,保证动态稳定性。附图说明[0045] 图1是一个实施例中一种基于深度强化学习的车辆最优控制方法流程图;[0046] 图2是一个实施例中对车辆二维平面模型示意图;[0047] 图3是一个实施例中策略网络结构示意图;[0048] 图4是一个实施例中价值网络的结构结构示意图;[0049] 图5是一个实施例中速度奖励空间图,表明速度v、路径曲度α与奖励的关系;[0050] 图6是一个实施例中前视距离奖励空间图,表明前视距离ld、速度v与奖励的关系。具体实施方式[0051] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述。[0052] 如图1至4所示,本实施例提供一种基于深度强化学习的车辆最优控制方法。包括如下具体步骤:[0053] 步骤1,建立策略网络和两个相互独立的价值网络,并初始化网络参数。[0054] 本实施例中,按照TD3框架建立一个策略网络和两个相互独立的价值网络。策略网络通过输入状态变量获得一个确定的动作,建立的神经网络结构如下:神经网络的输入为环境的状态,神经网络的输出为智能体将要采取的动作。价值网络和价值网络的输入量都是仿真环境状态变量与上次决策采取的动作,输出量是Q(s,a),指的是对应仿真环境状态与动作条件下所获得的评分奖励值。网络参数的初始化方式为随机初始化。[0055] 所述策略网络πθ的结构,对输入模型和路径相关的夹角集合A使用VQ进行离散化,对离散化后A送入时域卷积网络(TCN)进行处理,最后送入全连接层进行行为输出。TCN的隐藏层通道量为[32,32,32,1],Dilated分别取[1,2,4,8]。对于TCN中Relu出现梯度消失,在Block中改为采用LekeReluactivation,并在每层的输入进行中心化。取TCN最后一层输出的8个维度数据与[θ,v,derror]在通道上进行合并,送入全连接网络进行行为输出。最后把转向和速度动作施加到车辆上。其中,车辆转向角度是的公式为:[0056][0057] 其中L为车前轴到后轴的距离,ey(k)为k时刻前馈点与车前进方向的横向误差,前视距离ld为前馈点和车后轴中心的距离。[0058] 所述的价值网络的结构就是将策略网络的TCN块去掉,将离散化的A与[θ,v,derror,ld,speed]进行合并并送入全连接网络得到近似的Q(s,a)输出。[0059] 步骤2,控制车辆运行,收集数据样本。在仿真系统中控制车辆以最优的速度沿已规划路径行驶,提取车辆当前状态st,将状态st输入到策略网络中得到t时刻的动作at,车辆根据所述动作与仿真系统交互获得t+1时刻车辆的状态st+1,根据奖励函数计算出奖励rt,将四元组(st,at,st+1,rt)作为数据样本;基于数据样本构建经验池。[0060] 本实施例中,参见图3,根据车辆行驶情况,选定模拟器进行仿真,控制车辆以最优的速度沿已规划路径行驶,同时也要保证车辆的稳定性。从模拟器中提取当前状态st,并将状态st输入到策略网络中得到动作at,让车辆做出该动作。在经历一个离散的时间步长t后,再重新从模拟器获取车辆的状态st+1,并根据奖励函数计算出奖励rt。然后将st,at,st+1,rt组成一个数组存入经验池B中。[0061] 所述的状态,动作,奖励的定义如下:[0062] 状态定义:车辆行驶速度v,车辆转向角θ。并将已规划路径抽象为一系列距离相同的点P={p1,p2,p3,....pn},从中取前17个点记为P={p0,p1,p2,p3,....p16},然后将车辆速度方向与车辆后轴连线中点分别与p0,p1,p2,p3,....p16连线的夹角集合记为A={α0,α1,α2,α3,....α16}。车辆后轴中点到规划路径之间的距离记为derror。最后将v,θ,A,derror组成一个20维向量作为当前状态向量S。[0063] 动作定义:动作即为车辆根据当前情况选择的策略,由加减速和转向组成。[0064] 奖励定义:奖励公式如下:。[0065] R=Rover+Rspeedup+Rlengthen+Rdeviation+F1(α,v)+F2(v,ld)[0066] Rspeedup=?0.0205v2+4.368v?150[0067] Rlengthen=?0.1252ld2+8.9663ld?150[0068][0069] 其中函数的系数根据多次实验结果确定。Rover为道路奖励,是评价车辆是否太过于偏离规划的路径,要是偏离距离太大就给一个?500的奖励并结束该回合。为了提高车辆的行驶速度,我们设置了速度提高奖励Rspeedup和前视距离变长奖励Rlengthen。其中Rspeedup是为了鼓励速度的提高,在低速时,Rspeedup生效。而Rlengthen为了鼓励提高前视距离,来适应高速度场景,并在前视距离过短时,Rlengthen生效。Rdeviation为路径拟合奖励,是评价当前车辆是否贴合规划路径,车辆行驶路线与规划路线越相似,获得的奖励也就越高。[0070] F1(α,v)为速度奖励,是我们根据先验经验所设定的,根据前方路径的弯曲程度来设定车辆的经验速度,当车辆速度高于或低于经验速度一定范围时,对车辆进行处罚。F2(v,ld)为前视距离奖励,也是根据先验经验设定,根据前视距来设定车辆速度,车辆过快或过慢车辆也会受到惩罚。[0071] 通过经验所设置的速度奖励和前视距离奖励如图5,图6所示。速度奖励是关于速度和前方路径曲率的函数,路径曲率使用平均曲率代替。[0072][0073] 其中pi∈P为规划路径抽象点的前m个。[0074] 图5中最上面的线表示路径的平均曲率α和经验速度V之间的线性经验关系V=f1(α)。然后使用函数f1(α)用作区分高速和低速惩罚的阈值,Rv=F1(α,v)表示与高速和低速相关的奖励曲面。[0075] 前视距离奖励F2(v,ld)为关于车速v和前视距离ld之间的函数。图6中最上面的线表示车速v和经验预测距离Ld之间的线性关系Ld=f2(v)。然后使用f2(v)用作区分过长和过短的前视距离的阈值,并且Rld=F2(v,ld)表示与这种前视距离偏差相关联的回报表面。[0076] 步骤3,更新价值网络。从经验池中随机抽取一个四元组,将数据st、at输入两个价值网络中分别获取两个价值评分并取其中较小值来计算t+1时刻的预测得分;将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定TD误差,基于TD误差对两个价值网络进行更新。[0077] 具体地,从经验池B中随机抽取一个四元组(st,at,st+1,rt)。然后让两个价值网络根据st,at做预测,并根据两个预测值中小的一个计算t+1时刻的预测得分 公式如下:[0078][0079] 式中,Qθ1和Qθ2为价值网络,γ为折扣率,w1,new和w2,new[0080] 是更新过价值网络的参数, 和 分别是对当前数据st、at的评分。[0081] 让策略网络根据St+1预测出t+1时刻做出的动作at+1,之后让两个价值网络根据st+1、at+1进行预测,并根据两个预测值中小的一个计算TD误差,使用TD误差对两个价值网络进行更新,公式如下:[0082][0083][0084] 式中,β为学习率, 为对当前策略的预测得分,δ1,j和δ2,j为预测得分于价值网络得分的差值,Qθ1和Qθ2为价值网络, 表示对参数进行求导,w1,now和w2,now是价值网络的参数,w1,new和w2,new是更新过价值网络的参数。[0085] 步骤4,更新策略网络。本实施例中,在更新两次价值网络之后,更新一次策略网络。在经验池中随机取n个四元组(st,at,st+1,rt),分别输入到策略网络中对其进行评分,然后使用该评分对策略网络进行跟新,具体公式如下:[0086][0087] 式中,τ为学习率, 表示对参数进行求导, 策略网络, 是策略网络的参数,是更新过策略网络的参数,Qθ1和Qθ2为价值网络,θ1和θ2分别为两个价值网络的参数。[0088] 步骤5,重复步骤2至步骤4,不断更新各网络的参数,直至达到最大迭代次数或策略网络达到预期的效果,并将最终更新得到的策略网络作为最优策略用于智能车的部署。[0089] 在一个实施例的一种基于深度强化学习的车辆最优控制方法中还包括对策略网络进行调整的过程,该过程包括如下步骤:[0090] 在策略网络πθ中引入了噪声,噪声从截断正态分布中随机抽。沟貌呗酝绺踊娜ザ晕粗鹘刑剿,公式如下:[0091] a←πθ(s)+ε ε~clip(N(0,σ),?c,c)[0092] 式中,ε表示噪声,N(0,σ)表示均值为0,方差为σ的正态分布,clip表示裁剪操作,?c和c表示裁剪的范围。[0093] 应该理解的是,虽然上述流程图中的各个步骤按照箭头的指示依次显示,但是这些步骤并不是必然按照箭头指示的顺序依次执行。除非本文中有明确的说明,这些步骤的执行并没有严格的顺序限制,这些步骤可以以其它的顺序执行。而且,上述流程图中的至少一部分步骤可以包括多个子步骤或者多个阶段,这些子步骤或者阶段并不必然是在同一时刻执行完成,而是可以在不同的时刻执行,这些子步骤或者阶段的执行顺序也不必然是依次进行,而是可以与其它步骤或者其它步骤的子步骤或者阶段的至少一部分轮流或者交替地执行。[0094] 以上所述仅为本发明所公开的一种基于深度强化学习的车辆最优控制方法的优选实施方式,并非用于限定本说明书实施例的保护范围。凡在本说明书实施例的精神和原则之内,所作的任何修改、等同替换、改进等,均应包含在本说明书实施例的保护范围之内。

专利地区:海南

专利申请日期:2024-04-15

专利公开日期:2024-11-29

专利公告号:CN118372851B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载