产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:一种舞台环境下的移动智能体动态路径规划方法
专利类型:发明专利
专利申请号:CN202210465123.7
专利申请(专利权)人:浙江工业大学
权利人地址:浙江省杭州市拱墅区潮王路18号
专利发明(设计)人:刘安东,张柏鑫,倪洪杰,曹瀚仁
专利摘要:本发明公开了一种舞台环境下的移动智能体动态路径规划方法,属于智能机器人路径规划技术领域;首先通过构建全局地图获取移动智能体周围的障碍物信息,将障碍物分类成动态障碍物和静态障碍物,然后建立局部地图通过LSTM网络编码动态障碍物信息,通过社会注意力机制计算每个动态障碍物的重要性来实现更好的避障。通过构建新的奖励函数来应对动静态障碍物的不同躲避情况,从而实现在舞台复杂环境下的移动智能体的路径规划问题。提出新的经验池更新方法提高网络训练的收敛速度,同时对本发明所提的方法进行仿真实验,证实该算法的优越性,具有很强的实用价值。
主权利要求:
1.一种舞台环境下的移动智能体动态路径规划方法,其特征在于,包括以下步骤:
1)基于gym库建立移动智能体和动静态障碍物的仿真环境模型;
2)设计马尔可夫决策过程,马尔可夫决策过程通过五元组表示,设计状态空间S、动作空间A、P表示为状态转移函数、R表示为奖励函数和衰减因子γ;
设定状态空间S,其中动态障碍物的状态为SD=[Px,Py,Vx,Vy,r,Vpref]、静态障碍物的状态为SS=[Px,Py,r]、移动智能体的状态为ST=[Px,Py,Gx,Gy,Vx,Vy,θ,r,Vpref]、联合状态ut=[ST,SS,SD];其中(Px,Py)为移动智能体和动静态障碍物的当前位置,(Gx,Gy)为所设定的目标点的位置,θ为移动智能体的航向角,r为移动智能体和动静态障碍物的半径大。琕pref为移动智能体的首选速度,(Vx,Vy)为移动智能体和动态障碍物的移动速度;
动作空间A为线速度和角速度,为了符合动力学约束,角速度分成18等分在[?π/4,π/4]区间内,线速度按照指数函数 x取1,2,3,4,5可获得5个变化平滑的线速度;动作空间共有90种动作组合;
P表示为状态转移函数通过移动智能体在仿真环境下的实际交互来转移状态;
R表示为奖励函数设置为:
其中Gx,y是目标点的位置信息,Px,y是移动智能体的当前位置信息,ds是移动智能体和静态障碍物之间的距离,dd是移动智能体和动态障碍物之间的距离;
3)设计神经网络结构;
4)使用最佳互惠碰撞避免算法ORCA,通过模仿学习预训练来初始化网络参数;模仿学习结束之后然后通过移动智能体在仿真环境下的实际交互进行训练来优化网络参数;
5)通过自适应时刻估计方法Adam训练神经网络得到最优值函数:
6)通过最大化累计回报来设定最优策略:
其中,ut表示当前移动智能体和障碍物的联合状态,at表示动作空间的集合,γ表示衰*减因子,Δt表示两个动作之间的时间间隔,Vpref表示移动智能体的首选速度,V表示为最优值函数,P表示为状态转移函数,R表示为奖励函数; 表示下一时刻的联合状态;
7)根据最优策略来选择当前时刻的动作at直到移动智能体到达目标。
2.根据权利要求1所述的一种舞台环境下的移动智能体动态路径规划方法,其特征在于,所述步骤1)中基于gym库建立仿真环境模型,将移动智能体和动态障碍物设定为半径为
0.3米的圆,而将静态障碍物定义为半径在0.5米到1米之间的圆形或者为面积在1平方米到
1.5平方米之间的四边形。
3.根据权利要求1所述的一种舞台环境下的移动智能体动态路径规划方法,其特征在于,所述步骤3)中的神经网络结构包括:输入层、长短期记忆神经网络模块LSTM、社会注意力机制及输出层;
其中输入层:输入层即为上述步骤2)中的联合状态ut=[ST,SS,SD];长短期记忆神经网络模块LSTM:通过LSTM模块将移动智能体周围的障碍物排序,并且固定网络层输出参数;社会注意力机制:通过社会注意力机制模块分析出移动智能体与周围动态障碍物发生碰撞的概率,并且以分数的形式展现出来;输出层:输出层通过对网络参数的加权线性组合输出最*优值函数V(ut)。
4.根据权利要求1所述的一种舞台环境下的移动智能体动态路径规划方法,其特征在于,所述步骤3)中网络运行流程如下:首先将移动智能体和障碍物的状态信息输入进神经网络结构,然后根据状态信息将障碍物分为动态障碍物和静态障碍物,将移动智能体的状态和动态障碍物的状态输入LSTM模块,再输入进社会注意力机制模块,再将经过处理的状态、得到的交互特征和静态障碍物状态输入两层全连接层,最后通过激活函数对其进行归一化处理得到最优值函数。
5.根据权利要求1所述的一种舞台环境下的移动智能体动态路径规划方法,其特征在于,所述步骤4)中移动智能体在仿真环境下交互时将当前的状态信息、动作信息和奖励信息作为一条经验存储到经验池中,通过TD?error来给每一条经验添加重要性,TD?error是某个时刻动作的值函数和当前网络的最优值函数的一个差值,假如差值越大则说明当前的经验比较差;通过定义:α
Pt=(|δt|+ε)
其中Pt是选择当前经验的概率,α、ε为常数,δt为TD?error,ε为了防止TD?error为0后,当前经验不再被随机抽取用于更新模型的参数;
根据不同经验给经验赋予不同的概率,从而提高选取优秀经验的概率,提高网络的收敛速度;在每一集交互过程中当移动智能体碰到障碍物或者超过单次集运行的最大时间时结束当前集;然后将经验通过梯度反向传播来更新网络参数。 说明书 : 一种舞台环境下的移动智能体动态路径规划方法技术领域[0001] 本发明涉及智能机器人路径规划技术领域,具体涉及一种舞台环境下的移动智能体动态路径规划方法。背景技术[0002] 为了满足基层文化多样化服务需求,需要在基层小型文化服务综合体活动空间中开展文化演出、会议议事、展览阅览以及民俗活动等文化服务功能。有分类配置的文化设施不能满足居民对综合文化需求的期望。小型文化服务综合体可以较好的解决该问题,其着力点是推行多功能活动空间建设,它可以集成民俗活动、展览、会议、阅览等功能,形成一体化的场馆服务载体,既满足了农村基层文化的多样性和自组织性的需求,又探索出一条满足我国新农村公共文化服务要求的新模式。[0003] 为了减少土地资源的浪费,提高空间利用效率,就需要各种智能移动体协助完成多种功能空间相互快速组合以及切换,因服务空间不同,其功能空间内的配置设施和使用要求也不同,为了达到小型文化综合体“一厅多用”要求,往往要通过智能移动体协助完成多种功能空间相互快速组合以及切换,实现在小型综合体空间内拥挤环境下的动态路径规划等,从而满足单一空间多种文化服务需求。[0004] 小型文化综合体空间是一个典型的人、机、物共存环境,在功能空间切换过程中,空间内多个物体装备需要有其他装备物情况下进行轨迹规划运动,实现空间功能的切换服务,所以在切换过程中如何快速地躲避动静态障碍物,到达目标点,需要我们设计动态路径规划算法控制智能移动体,且文化综合体空间内环境拥挤,对动态路径规划算法要求较高。[0005] 传统的动态路径规划算法依赖于传感器的快速刷新来感知周围障碍物的信息,规划出来的路径也会随着动态障碍物的变化,出现绕路或者不自然轨迹的问题。不能够预测周围动态障碍物的运动趋势,缺乏适应性。对于以上问题,亟需提出一种可以区分动静态障碍物以及预测动态障碍物趋势的动态路径规划方法。发明内容[0006] 针对现有技术中存在的问题,本发明的目的在于提供一种舞台环境下的移动智能体动态路径规划方法,该方法通过在深度强化学习方法的基础上设计了新的马尔可夫决策过程和网络结构,通过引入社会注意力机制给动态障碍物添加注意力分数,使用长短期记忆神经网络来解决前馈网络维数不固定的问题,构建新的奖励函数来应对动静态障碍物的不同躲避情况,提出新的经验池更新方法提高网络训练的收敛速度,从而让移动智能体实现区分动静态障碍物以及预测动态障碍物的运动趋势。为了实现上述目的,本发明采用的技术方案如下:[0007] 一种舞台环境下的移动智能体动态路径规划方法,包括以下步骤:[0008] 1)基于gym库建立移动智能体和动静态障碍物的仿真环境模型;[0009] 2)设计马尔代夫决策过程,设计状态空间S、动作空间A、转移概率P、奖励R和折扣因子γ;[0010] 3)设计神经网络结构;[0011] 4)使用最佳互惠碰撞避免算法(ORCA),通过模仿学习预训练来初始化网络参数;模仿学习结束之后然后通过移动智能体在仿真环境下的实际交互进行训练来优化网络参数;[0012] 5)通过自适应时刻估计方法(Adam)训练神经网络得到最优值函数:[0013] V*(ut)=∑γΔt·Vpref·P(ut,at)[0014] 6)通过最大化累计回报来设定最优策略:[0015][0016] 其中,ut表示当前移动智能体和障碍物的联合状态,at表示动作空间的集合,γ表*示衰减因子,Δt表示两个动作之间的时间间隔,Vpref表示首选速度,V 表示在最优值函数,P表示为状态转移函数,R表示为奖励函数; 表示下一时刻的联合状态[0017] 7)根据最优策略来选择当前时刻的动作at直到移动智能体到达目标。[0018] 进一步的,所述步骤1)中将移动智能体和动态障碍物设定为半径为0.3米的圆,而将静态障碍物定义为半径在0.5米到1米之间的圆形或者为面积在1平方米到1.5平方米之间的四边形。[0019] 进一步的,所述步骤2)中,设定状态空间S,其中动态障碍物的状态为SD=[Px,Py,Vx,Vy,r,Vpref]、静态障碍物的状态为SS=[Px,Py,r],移动智能体的状态为ST=[Px,Py,Gx,Gy,Vx,Vy,θ,r,Vpref]联合状态ut=[ST,SS,SD].其中(Px,Py)为移动智能体和动静态障碍物的当前位置,(Gx,Gy)为所设定的目标点的位置,θ为移动智能体的航向角,r为移动智能体和动静态障碍物的半径大。琕pref为移动智能体的首选速度,(Vx,Vy)为移动智能体和动态障碍物的移动速度;[0020] 动作空间A为线速度和角速度,为了符合动力学约束,角速度分成18等分在[?π/4,π/4]区间内,线速度按照函数 x取1,2,3,4,5可获得5个变化平滑的线速度,动作空间共有90中动作组合;[0021] 转移概率P通过轨迹预测模型来近似计算;[0022][0023] 奖励R设置为:[0024] 其中Gx,y是目标点的位置信息,Px,y是移动智能体的当前位置信息,ds是移动智能体和静态障碍物之间的距离,dd是移动智能体和动态障碍物之间的距离;折扣因子γ取0.9。[0025] 进一步的,所述步骤3)中的网络结构由以下模块组成:1、输入层:输入层即为上述步骤而中的联合状态ut=[ST,SS,SD]。2、长短期记忆神经网络模块(LSTM):通过LSTM模块可以将移动智能体周围的障碍物排序,并且可以固定网络层输出参数。3、社会注意力机制:通过社会注意力机制模块可以分析出移动智能体与周围动态障碍物发生碰撞的概率,并且以分数的形式展现出来。4、输出层:输出层通过对网络参数的加权线性组合输出最优值函数*V(ut)。[0026] 进一步的,所述步骤3)中网络运行流程如下:首先将移动智能体和障碍物的状态信息输入进网络,然后根据状态信息将障碍物分为动态障碍物和静态障碍物,将移动智能体的状态和动态障碍物的状态输入LSTM模块,再输入进社会注意力机制模块,再将经过处理的状态、得到的交互特征和静态障碍物状态输入两层全连接层,最后通过激活函数对其进行归一化处理得到最优值函数。[0027] 进一步的,所述步骤4)中移动智能体在仿真环境下交互时将当前的状态信息、动作信息和奖励信息作为一条经验存储到经验池中,当经验达到最大容量时,将新的经验取代奖励低的旧的经验存储,从而提高选取优秀经验的概率,提高网络的收敛速度。在每一集交互过程中当移动智能体碰到障碍物或者超过单次集运行的最大时间时结束当前集。然后将经验通过梯度方向传播来更新网络参数。[0028] 本发明有益效果是:设计了新的马尔可夫决策过程来适应综合体空间内障碍物复杂的情况,设计了新的网络结构,来实现对动静态障碍物分类处理,实现对动态障碍物的预测,设计了新的奖励函数来应对不同障碍物的情况,提出新的经验池更新方法来提高神经网络的训练效率,使用模仿学习来对网络进行预训练,提高网络的收敛速度;从而让移动智能体在综合体空间内实现高效的动态规划方法。附图说明[0029] 图1是本发明实施例的方法实现流程图;[0030] 图2是本发明实施例中网络结构图;[0031] 图3是本发明实施例中仿真结果图;[0032] 图4是本发明实施例中网络训练总奖励图。具体实施方式[0033] 下面结合附图及具体实施例,对本发明作进一步的详细说明。[0034] 本发明的目的在于提供一种舞台环境下的移动智能体动态路径规划方法,该方法通过在深度强化学习方法的基础上设计了新的马尔可夫决策过程和网络结构,通过引入社会注意力机制给动态障碍物添加注意力分数,使用长短期记忆神经网络来解决前馈网络维数不固定的问题,构建新的奖励函数来应对动静态障碍物的不同躲避情况,提出新的经验池更新方法提高网络训练的收敛速度,从而让移动智能体实现区分动静态障碍物以及预测动态障碍物的运动趋势。[0035] 在本实施例中,仿真环境如图3所示,设规划地图的范围为10*10,路径规划的起始点为(0,?10),目标点为(0,7.5),静态障碍物位置随机分布,为长方形或者正方形,动态障碍物为半径大小为0.5的圆形。[0036] 一种舞台环境下的移动智能体动态路径规划算法,具体步骤如下:[0037] 1)基于gym库建立移动智能体和动静态障碍物的仿真环境模型;[0038] 2)设计马尔代夫决策过程,设计状态空间S、动作空间A、转移概率P、奖励R和折扣因子γ;[0039] 3)设计神经网络结构;[0040] 4)使用最佳互惠碰撞避免算法(ORCA),通过模仿学习预训练3000集来初始化网络参数;然后通过移动智能体在仿真环境下的实际交互进行训练来优化网络参数。[0041] 5)通过自适应时刻估计方法(Adam)训练神经网络得到最优值函数:[0042] V*(ut)=∑γΔt·Vpref·P(ut,at)[0043] 6)通过最大化累计回报来设定最优策略:[0044][0045] 其中,ut表示当前移动智能体和障碍物的联合状态,a表示动作空间的集合,γ表*示衰减因子,Δt表示两个动作之间的时间间隔,Vpref表示首选速度,V 表示在最优值函数,P表示为状态转移函数,R表示为奖励函数; 表示下一时刻的联合状态[0046] 7)根据最优策略来选择当前时刻的动作at直到移动智能体到达目标。[0047] 以上是本发明的较佳实施例,凡依本发明技术方案所作的改变,所产生的功能作用未超出本发明技术方案的范围时,均属于本发明的保护范围。
专利地区:浙江
专利申请日期:2022-04-29
专利公开日期:2024-11-29
专利公告号:CN114815834B