本发明属于无人机集群路径规划领域,具体为融合经验共享与平衡奖励actor-critic网络的编队路径规划方法。
背景技术:
0、技术背景
1、近年来,随着人工智能技术的飞速发展,强化学习在无人机领域展现出巨大潜力。相比于单架无人机,无人机编队更能满足日益增长的实际需求。随着无人机的飞行环境愈加复杂,飞行任务需求日益增多,如何平衡编队要求,在考虑避免与障碍物碰撞的同时,实现无人机之间的避碰和整体队形的要求,高效完成编队路径规划任务,对现有的无人机编队路径规划方法带来了新的挑战,近年来成为研究热点,受到了研究者的广泛关注。
2、针对编队路径规划问题,yan c.等将q-learning应用于无人机路径规划中,但只针对特定障碍物的场景同时未考虑编队问题。li b.等基于ddpg算法,在无人机编队路径规划中均取得了不错的效果,但是模型训练时间长且会随着环境复杂程度的提升导致模型难以收敛。yu c.等研究了多智能体近端策略优化算法,采用集中值函数的方法在多智能体路径规划问题中验证了该算法的效果。wang l等利用强化学习来估计环境状态价值的方法,完成了多个智能体分离的路径规划,但未考虑智能体之间的编队问题。chen y.f.等采用多智能体深度确定性策略梯度方法,对每架无人机的轨迹进行独立管理,实现了多无人机简单路径规划。但由于其优化目标在于提升各个无人机之间的竞争公平性及降低整体能耗,未考虑无人机避障及能耗等条件对路径的约束。如何结合无人机编队路径规划特点,进一步对强化学习算法进行优化,实现安全高效的无人机编队路径规划任务,仍然需要进行进一步的研究。
技术实现思路
1、本发明的目的在于提供融合经验共享与平衡奖励actor-critic网络的编队路径规划方法,该方法在考虑避免与障碍物碰撞的同时,可以很好地实现无人机之间的避碰和整体队形的要求,同时具有收敛速度快的优点。
2、为实现上述目的,本发明采用以下技术方案:
3、融合经验共享与平衡奖励actor-critic网络的编队路径规划方法,包括:
4、步骤1构建无人机编队路径规划的任务场景,包括无人机数量,编队队形,自身位置,起点位置,终点位置和障碍信息。
5、步骤2利用平衡奖励设定式求解编队奖励设定值和无人机在到达终点时的奖励设定值具体方法为:
6、(2.1)首先定义奖励的稀疏性评价模型和信息性评价模型,具体如下:
7、奖励的稀疏性评价模型表示为:
8、
9、式中,为奖励的支撑集,这里s为局部状态,s为全局状态,为智能体奖励,a为局部动作,为联合动作。
10、奖励的信息性评价模型表示为:
11、
12、式中,l(·)为单调非减的凹函数,为满足的最优差,为最优策略,h为回合数,为总回合数。
13、(2.2)利用奖励的信息性评价模型式(2)求最优解具体为:
14、
15、式中,为子目标,为总目标,满足
16、(2.3)对式(3)求最优解,得
17、(2.4)定义平衡奖励设定式为:
18、
19、式中,d为先验知识,λ≥0;
20、(2.5)利用向前逐步选择法对平衡奖励设定式(4)进行求解,得到编队奖励设定值和无人机在到达终点时的奖励设定值
21、步骤3建立每个无人机的actor网络和critic网络,通过智能体间经验共享策略,得到maac网络模型的策略损失函数l(θi)和值函数的损失函数l(φi),学习更新网络参数,得到更高的学习效率。
22、步骤4设定无人机编队路径规划的状态空间s、动作空间a、避障奖励robs和机间避碰奖励ruav,由步骤2求解出的平衡奖励得到编队奖励rfrmation和路径规划奖励rpath,计算无人机编队路径规划的总奖励函数r。
23、步骤5训练经验共享结合平衡奖励的maac的无人机编队路径规划模型。
24、步骤6将训练好的经验共享结合平衡奖励的maac算法应用到实际飞行场景中,得到编队路径规划路线。
25、本发明具有以下优点:
26、1.本发明在actor-critic算法基础上,提出经验共享优化策略,通过在智能体之间分享经验来实现更高效的学习,解决了传统强化学习算法中仅使用每个智能体自已的采样轨迹的经验来更新价值网络的损失函数所造成的学习效率低的问题。
27、2.本发明在编队路径规划的奖励设定中使用奖励的稀疏性和信息性评价模型来设定平衡的编队路径规划奖励,并将其应用在经验共享maac算法中,实现无人机编队和路径规划的平衡学习,有利于引导学习最优路径。
28、附图表说明
29、图1为本发明方法的流程图。
30、图2为本发明提出的方法和maddpg算法训练获得的总体奖励对比。
31、图3为各个无人机的累积奖励。
32、图4为本发明方法下无人机编队路径规划曲线。
1.融合经验共享与平衡奖励actor-critic网络的编队路径规划方法,其特征在于,该方法包括以下步骤:
2.融合经验共享与平衡奖励actor-critic网络的编队路径规划方法,其特征在于,步骤3中的建立每个无人机的actor网络和critic网络,通过智能体间经验共享策略,得到maac网络模型的策略损失函数l(θi)和值函数的损失函数l(φi),学习更新网络参数,得到更高的学习效率,具体包括以下步骤:
3.融合经验共享与平衡奖励actor-critic网络的编队路径规划方法,其特征在于,步骤4中的设定无人机编队路径规划的状态空间s、动作空间a、避障奖励rob、和机间避碰奖励ruav,由步骤2求解出的平衡奖励得到编队奖励rformation、路径规划奖励rpath,计算无人机编队路径规划的总奖励函数r,步骤具体如下:
