开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于MAB算法的掩护脉冲设计方法发明专利

更新时间:2026-09-01
一种基于MAB算法的掩护脉冲设计方法发明专利 专利申请类型:发明专利;
地区:贵州-贵阳;
源自:贵阳高价值专利检索信息库;

专利名称:一种基于MAB算法的掩护脉冲设计方法

专利类型:发明专利

专利申请号:CN202411368842.2

专利申请(专利权)人:江南机电设计研究所
权利人地址:贵州省贵阳市小河区红河路7号贵阳航天工业园区

专利发明(设计)人:杨洪飞,龙永松,刘玉祥,谢荣,朱鸿宇,孙玉雯,黄泽琛

专利摘要:本发明公开了一种基于MAB算法的掩护脉冲设计方法,包括以下步骤:确定探测信号和掩护信号的频率范围;确定输入参数;加载MAB决策模型和收益函数,MAB决策模型用于循环调用分布函数获取脉冲宽度#imgabs0#,作为掩护信号脉宽发射,获得信号检测结果,根据信号检测结果优化分布函数的分布参数;调用MAB决策模型,循环获取脉冲宽度#imgabs1#,优化分布函数的分布参数,构成优化MAB决策模型。根据上述技术方案,构建MAB决策模型,在每次生成掩护信号脉宽进行发射、与环境的交互过程中,不断进行模型自学习,优化模型参数,构建渐优掩护信号脉宽发射策略,使雷达能够在与IFM干扰机对抗过程中降低被截获的概率,同时最大化探测概率。

主权利要求:
1.一种基于MAB算法的掩护脉冲设计方法,其特征在于,包括以下步骤:确定探测信号和掩护信号的频率范围;
确定输入参数包括:能选择的脉宽数量、探测频率和掩护频率;
加载MAB决策模型和收益函数,所述MAB决策模型用于循环调用分布函数获取脉冲宽度tc,以所述脉冲宽度tc作为掩护信号脉宽发射,获得信号检测结果,根据所述信号检测结果优化所述分布函数的分布参数;所述收益函数用于计算所述脉冲宽度tc对应的收益;
调用所述MAB决策模型,循环获取所述脉冲宽度tc,优化分布函数的分布参数,构成优化MAB决策模型;
其中,加载MAB决策模型前,构建所述MAB决策模型,包括:定义雷达动作集,表示为, i=0,1,2,…,N?1,其中,Tc为脉冲的最大脉宽、为脉冲宽度、i为每次动作序号、N为动作数量最大值;
定义分布函数,所述分布函数用于生成随机数,表示为: 其中,为所述分布函数的分布参数,表示第t个脉冲重复周期中第i个动作脉冲的参数;
根据所述随机数中最大值随机数形成的掩护脉冲进行发射的结果,实现分布函数的优化;
其中,所述分布函数的优化根据所述随机数中最大值随机数实现,包括:步骤S123:通过所述分布函数获取每个动作对应的随机数;
步骤S124:从所述每个动作对应的随机数中,提取最大随机数;
步骤S125:提取所述最大随机数对的动作,作为脉冲宽度tc,作为掩护脉冲脉宽并发射,表示为: 其中,θi为步骤S124中第i个动作所对应的随机数;
步骤S126:接收回波信号,判断是否检测到目标;
步骤S127:根据目标检测结果构建收益计算体系,从所述收益计算体系获取收益值rt,实现分布函数优化;
判断是否中止优化,如果不中止优化,重新执行步骤S123。
2.根据权利要求1所述的掩护脉冲设计方法,其特征在于,所述探测信号和掩护信号的频率范围定义为:|F?F'|>B,其中,F为雷达探测信号的中心频率,F'为掩护脉冲的中心频率,B为干扰信号的带宽。
3.根据权利要求1所述的掩护脉冲设计方法,其特征在于,加载MAB决策模型时,初始化所述分布函数的分布参数,表示为:
4.根据权利要求3所述的掩护脉冲设计方法,其特征在于,所述构建收益计算体系通过收益函数实现,所述收益函数表示为:其中,rt为雷达目标探测结果获得收益。
5.根据权利要求4所述的掩护脉冲设计方法,其特征在于,所述分布函数优化的方法为:如果所述收益值为1,更新分布函数的分布参数的方法为:其中, 为第t个脉冲重复周期中
第i个动作脉冲的参数;
否则,更新分布函数的分布参数的方法为: 其中,γ为折扣因子,且:γ<1。
6.根据权利要求1所述的掩护脉冲设计方法,其特征在于,所述定义雷达动作集时,控制所述脉冲宽度tc与探测信号脉宽td之和为定值,表示为:tc+td=ttotal,其中,ttotal为掩护信号脉宽与探测信号脉宽所能达到的最大值。 说明书 : 一种基于MAB算法的掩护脉冲设计方法技术领域[0001] 本发明涉及雷达抗干扰技术领域,具体而言,涉及一种基于MAB算法的掩护脉冲设计方法。背景技术[0002] 在雷达抗干扰的技术中,频率捷变雷达通过在相邻脉冲间改变载波频率,使干扰机难以在频率上对准,相较于传统固定载频脉冲多普勒雷达,具有抗有源压制式干扰的性能优势。然而,随着瞬时测频技术(instantaneousfrequencymeasurement,IFM)技术的发展,干扰机能够完成对所接收到的雷达信号载波频率进行快速测量,实现脉内压制干扰,使雷达频率捷变失效。[0003] 针对此问题,使用射频掩护技术来是对抗IFM干扰机。射频掩护技术通过发射一个与探测信号频率相差较大的掩护信号,此时干扰机对脉冲前沿进行采样测频后,测出的信号频率为前沿的掩护信号频率,而未能测量真实信号频率,从而实现对雷达探测信号的掩护。该技术实现简单、抗干扰性能优异,射频掩护技术在雷达抗干扰领域得到广泛应用。实际应用中,典型的侦察机通过截获雷达信号,对信号进行分选测量,确定脉冲信号的脉宽、载频、到达角、到达时间、脉冲重复间隔等,围绕这几维参数的测量,生成射频掩护信号以实现对抗侦察接收机。[0004] 然而,现有的射频掩护技术大多采用固定的掩护信号脉宽,当干扰方的策略和环境发生改变时,如果不能及时调整掩护信号脉宽,将使射频掩护抗干扰的效果极具下降。因此,需要一种掩护脉冲设计方案,可以实现根据实际情况,及时调整掩护信号脉宽,生成有效射频掩护信号。发明内容[0005] 为实现上述目的,本申请提供了一种基于MAB算法的掩护脉冲设计方法,包括以下步骤:[0006] 确定探测信号和掩护信号的频率范围;[0007] 确定输入参数包括:能选择的脉宽数量、探测频率和掩护频率;[0008] 加载MAB决策模型和收益函数,MAB决策模型用于循环调用分布函数,获取脉冲宽度 ,以所述脉冲宽度 作为掩护信号脉宽发射,获得信号检测结果,根据所述信号检测结果优化所述分布函数的分布参数;所述收益函数用于计算所述脉冲宽度 对应的收益;[0009] 调用所述MAB决策模型,循环获取所述脉冲宽度 ,优化分布函数的分布参数,构成优化MAB决策模型。[0010] 其中,探测信号和掩护信号的频率范围定义为: ,其中,F为雷达探测信号的中心频率, 为掩护脉冲的中心频率,B为干扰信号的带宽。[0011] 其中,加载MAB决策模型前,构建所述MAB决策模型,包括:[0012] 定义雷达动作集,表示为, ,其中, 为脉冲的最大脉宽、 为脉冲宽度、为每次动作序号、 为动作数量最大值;[0013] 定义分布函数,所述分布函数用于生成随机数,表示为: ,其中, 、为分布函数的分布参数,表示第t个脉冲重复周期中第 个动作脉冲的参数;[0014] 根据随机数中最大值随机数形成的掩护脉冲进行发射的结果,实现分布函数的优化。[0015] 其中,加载MAB决策模型时,初始化分布函数的分布参数,表示为:[0016][0017] 进一步的,根据随机数中最大值随机数实现分布函数的优化包括:[0018] 步骤S123:通过分布函数获取每个动作对应的随机数;[0019] 步骤S124:从每个动作对应的随机数中,提取最大随机数;[0020] 步骤S125:提取最大随机数对的动作,作为脉冲宽度 ,作为掩护脉冲脉宽并发射,表示为: ,其中, 为步骤S124中第i个动作所对应的随机数;[0021] 步骤S126:接收回波信号,判断是否检测到目标;[0022] 步骤S127:根据目标检测结果构建收益计算体系,从收益计算体系获取收益值 ,实现分布函数优化;[0023] 判断是否中止优化,如果不中止优化,重新执行步骤S123。[0024] 其中,构建收益计算体系通过收益函数实现,收益函数表示为:[0025] ,其中, 为雷达目标探测结果获得收益。[0026] 进一步的,分布函数优化的方法为:[0027] 如果所述收益值为1,更新分布函数的分布参数的方法为:[0028] , ,其中, 、 为第 个脉冲重复周期中第 个动作脉冲的参数;[0029] 否则,更新分布函数的分布参数的方法为: , ,其中,为折扣因子,且: 。[0030] 进一步的,定义雷达动作集时,控制所述脉冲宽度 与探测信号脉宽 之和为定值,表示为:[0031] ,其中, 为掩护信号脉宽与探测信号脉宽所能达到的最大值。[0032] 根据本发明,在雷达系统中加入多臂赌博机模型作为MAB决策模型,MAB决策模型在每次生成掩护信号脉宽进行发射、与环境的交互过程中,不断进行模型自学习,优化模型参数,构建渐优掩护信号脉宽发射策略,使雷达能够在与IFM干扰对抗过程中降低被截获的概率,同时最大化探测概率。附图说明[0033] 图1是根据本发明实施例提供的掩护脉冲设计方法步骤图;[0034] 图2是根据本发明实施例提供的仿真逻辑示意图;[0035] 图3是根据本发明实施例提供的平衡环境固定策略下雷达的累计收益值;[0036] 图4为本发明实施例提供的非平稳环境下雷达的累计收益值;[0037] 图5为本发明实施例提供的非平稳环境下雷达的累计收益值。具体实施方式[0038] 本发明提供了一种基于MAB算法(多臂赌博机算法)的掩护脉冲设计方法,在雷达系统中加入多臂赌博机模型作为MAB决策模型,MAB决策模型在每次生成掩护信号脉宽进行发射、与环境的交互过程中,不断进行模型自学习,优化模型参数,构建渐优掩护信号脉宽发射策略,使雷达能够在与IFM干扰对抗过程中降低被截获的概率,同时最大化探测概率。[0039] 下面结合说明书附图对本发明的具体实现方式做详细描述。[0040] 本发明提出的基于MAB算法的掩护脉冲设计方法的实现过程如图1所示,包括以下步骤:[0041] 步骤S100:确定探测信号和掩护信号的频率范围;[0042] 由于射频掩护脉冲技术的原理,发射的掩护脉冲与探测信号频率相差较大时可以此实现抗干扰。在本步骤中,划定掩护信号与真实信号的频带分布,定义为: ,其中,F为雷达探测信号的中心频率, 为掩护脉冲的中心频率,B为干扰信号的带宽。[0043] 步骤S110:确定的输入参数包括:能选择的脉宽数量、探测频率和掩护频率;其中,探测频率和掩护频率用于MAB决策模型中向干涉机发送信号,能选择的脉宽数量可影响MAB决策模型的收敛速度。[0044] 步骤S120:加载MAB决策模型和收益函数,MAB决策模型中,循环调用分布函数,获取脉冲宽度 ,以所述脉冲宽度 作为掩护信号脉宽发射,获得信号检测结果,并根据所述信号检测结果优化所述分布函数的分布参数,实现MAB决策模型优化;[0045] 收益函数用于计算脉冲宽度 对应的收益值,确定分布函数的分布参数的优化策略。[0046] 具体应用中,加载MAB决策模型前,构建所述MAB决策模型。[0047] 步骤S121:构建所述MAB决策模型,包括:[0048] 1)定义雷达动作集,表示为, ,其中, 为脉冲的最大脉宽、 为脉冲宽度、为每次动作序号、 为动作数量最大值。[0049] 为保证雷达正常工作,需要约束掩护脉冲最大脉宽,以保证掩护信号脉宽和探测信号脉宽之和为一定值,因此定义雷达动作集时,需要控制脉冲宽度 与探测信号脉宽之和为雷达系统固有参数定值,表示为:[0050] ,其中, 为掩护信号脉宽与探测信号脉宽所能达到的最大值。[0051] 2)定义分布函数,表示为: ,其中, 、 为所述分布函数的分布参数,表示第t个脉冲重复周期中第个动作脉冲的参数;[0052] 根据每个动作的分布函数可生成随机数,并选取最大随机数对应的动作,作为掩护脉冲;并后续根据所述随机数中最大值随机数形成的掩护脉冲进行发射,识别发射结果,实现分布函数的优化。[0053] 对掩护脉冲 ,根据该动作的参数从分布 中随机采样出对应的随机数 ;从所有动作产生的随机数中选取最大随机数,提取对应的动作作为上述掩护脉冲的脉宽,可表示为: 。[0054] 从参数分布中采样出 时,采用汤普森采样(Thompsonsampling,TS)方法,基于贝叶斯思想,用动作的概率分布表达脉宽选择的不确定性,根据每个分布中采样获得随机数。[0055] 在后续应用中,确定最大随机数对应的动作 为掩护脉冲脉宽。[0056] 所述方法利用第i?1次交互的先验知识,逐步探索动作第i次交互的分布函数,在避免马太效应的同时,提高计算效率。[0057] 步骤S122:加载MAB决策模型时,初始化分布函数的分布参数 和 ,即第一次学习时的参数,表示为:[0058] 后续在MAB决策模型调用过程中,循环获取脉冲宽度 ,优化分布函数的分布参数。[0059] 实现分布函数的优化的过程包括:[0060] 步骤S123:通过分布函数获取每个动作对应的随机数;[0061] 根据每一个动作 的参数 、 ,从分布 中采样出一个随机数 ;[0062] 步骤S124:从每个动作对应的随机数中,提取最大随机数;[0063] 步骤S125:提取最大随机数对的动作为脉冲宽度 ,作为掩护脉冲脉宽,结合探测频率和掩护频率进行发射;[0064] 掩护脉冲脉宽表示为: ;[0065] 步骤S126:接收回波信号,判断是否检测到目标;[0066] 在本步骤中,针对接收回波信号进行下变频、脉冲压缩、恒虚警检测等处理操作,获得信号检测结果。[0067] 步骤S127:根据目标检测结果构建收益计算体系,进行分布函数的优化;[0068] 其中,构建收益计算体系通过收益函数实现,收益函数表示为:[0069] ,其中, 为雷达目标探测结果获得收益。[0070] 即,若检测到目标则该动作的收益值 为1,否则为0;[0071] 分布函数优化根据收益值 完成,具体包括:如果收益值为1,调整分布函数的分布参数,体现为 递增、 递减,提高在下轮调用时被选中概率,计算方法为:[0072] , ,其中, 、 为第 个脉冲重复周期中第 个动作脉冲的参数;[0073] 如果收益值为0,即 ,此时调整分布函数的分布参数,体现为 、 按折扣因子调整,降低在下轮调用时被选中概率,计算方法为:[0074] , ,其中,为折扣因子,且: 。[0075] 在模型中,雷达的每个动作 等效为多臂赌博机模型中的一个臂,每个动作的初始化Beta分布参数在雷达与干扰机的交互过程中,由于干扰机的侦察窗长度可能发生变化,导致最优策略发生变化,因此引入折扣因子 ,降低以往经验的权重,提高雷达适应能力。[0076] 根据MAB决策模型的自训练过程,步骤S127完成后,再次执行步骤S123,在此过程中,不断优化分布函数的分布参数,并在每一轮循环过程中,获取脉冲宽度 作为掩护脉冲脉宽发射;每轮的发射过程中可能产生收益值为0的掩护脉冲脉宽,为应用过程中可以接受的缺陷;在产生缺陷时,降低分布函数的分布参数,减少该掩护脉冲脉宽在下轮调用时该动作被选择中的机率,提高优势分布参数在下轮调用时被选中概率,即可通过在线学习,得到掩护信号脉宽发射策略,使雷达能够在与IFM干扰机对抗过程中降低被截获的概率,同时最大化探测概率。[0077] 每次迭代过程中,判断是否中止优化;可根据支持脉冲重复周期的数量t判断是否中止,也支持其他的状态,例如迭代时机等因素进行判断。如果不中止优化,则重新执行步骤S123。[0078] 步骤S130:在步骤S123至步骤S127的过程中,不断优化分布函数的分布参数,构成渐优的MAB决策模型;在本发明提供的掩护脉冲设计方法中,通过在应用环境中对MAB决策模型的不断使用和优化,提高掩护的成功概率,增强雷达在复杂电磁环境下的目标稳健探测能力。[0079] 在一段时间内,执行步骤S123至步骤S127的过程中产生的收益值 之和构成累计收益值,累计收益值的趋势可直观地体现出MAB决策模型的优化结果。[0080] 本发明提供了具体的仿真试验,具体逻辑如图2所示,仿真试验内容包括:[0081] (1)确定仿真条件:假设雷达系统固有参数定值 为10.5 ,即掩护信号脉宽与探测信号脉宽 之和为10.5 ,掩护脉冲的最大脉宽为10 ,可选择的掩护信号脉宽个数为20个;雷达与干扰机的虚警概率均为 。当雷达未被干扰机干扰时,雷达接收信号的信噪比 ,当雷达被干扰机干扰时,信噪比为0dB。当干扰机侦察窗长度 大于掩护信号脉宽 时,干扰机接收到雷达探测信号的信噪比,当干扰机侦察窗长度 小于掩护信号脉宽时,干扰机无法检测到雷达的探测信号。[0082] 在后续实验中,对比分析掩护信号脉宽固定策略(简称Fix)、掩护信号脉宽随机选择策略(简称Rand)、经典多臂赌博机算法UCB1算法(简称UCB)、EXP3算法(简称EXP3)以及本发明方法(简称DTS)的累计收益性。[0083] (2)仿真内容:[0084] 仿真实验一:仿真平稳环境下,分析掩护信号脉宽决策算法的性能:[0085] 假设干扰机的侦察窗长度 为5 ,在固定策略中 分别为2.5 和7.5 ,本发明方法的折扣因子 。[0086] 仿真实验二:假设干扰系统的侦察窗长度 随时间逐渐增加,表示为:[0087] ,侦察窗改变的周期为10000个脉冲,其他参数与仿真实验一相同。[0088] 仿真实验三:仿真非平稳环境下,分析掩护信号脉宽决策算法的性能:[0089] 假设干扰机的侦察窗长度 ,侦察窗改变的周期为10000个脉冲。其他参数与仿真实验一相同。[0090] (3)仿真结果分析:[0091] 图3提供了平衡环境固定策略下使用不同抗干扰方法的雷达累计收益值,其中201为使用本发明提供的抗干扰方法,即DTS的雷达的累计收益值;202为使用EXP3算法的雷达的累计收益值;203为使用UCB算法雷达的累计收益值;204为使用固定策略情况下的雷达累计收益值;205为使用Rand算法的雷达的累计收益值;206为使用固定策略的雷达累计收益值;[0092] 如图3所示,当策略固定为 时,由于 ,干扰机可以侦察到雷达的探测信号并进行干扰,导致射频掩护失效;当策略固定为 时,由于 ,干扰机无法侦察到雷达的探测信号,从而避免了被干扰,然而,由于掩护脉冲脉宽 过大,导致探测信号能量过低,从而影响雷达的检测概率。对比各方法可以看出,本发明方法具有最高的收益值,可有效降低雷达被干扰概率,同时保证雷达对目标的检测概率。[0093] 如图4提供了是非平稳环境下使用不同抗干扰措施的雷达累计收益值:[0094] 其中,301为本发明提供的抗干扰方法(DTS)的雷达的累计收益值;302为使用EXP3算法的雷达的累计收益值;303为使用UCB算法雷达的累计收益值;304为使用固定策略情况下的雷达累计收益值;305为使用固定策略的雷达累计收益值;306为使用Rand算法的雷达的累计收益值。[0095] 可见,固定策略难以适应环境的变化,导致对抗性能降低。[0096] 对比各方法可以看出,本发明方法对非平稳的干扰环境具有更好的适应能力,可以有效提高雷达对抗IFM干扰机的性能。[0097] 图5提供了的是非平稳环境下使用不同抗干扰措施的雷达累计收益值,其中,401为本发明提供的抗干扰方法即DTS的雷达的累计收益值;402为使用EXP3算法的雷达的累计收益值;403为使用UCB算法雷达的累计收益值;404为使用固定策略情况下的雷达累计收益值;405为使用Rand算法的雷达的累计收益值;406为使用固定策略的雷达累计收益值。[0098] 可以看出,在干扰机的侦察窗长度随机变化时,本发明方法仍能很好地适应敌方干扰环境,具有更高的收益值。因此,本发明方法对动态干扰环境具有更强的适应能力,可以实时调整掩护信号脉宽,使雷达系统尽可能地工作在最佳状态。[0099] 通过上述仿真实验可以证明,根据本发明提供的方法,通过不断与环境交互,能够学习到干扰机的变化策略,确定此刻掩护脉冲的发射策略,扩大应用场景。进一步地,基于MAB算法通过选择概率确定掩护信号脉宽,能够增加掩护信号的随机性,增强抗干扰的效果。[0100] 以上公开的仅为本发明的几个具体实施例,但是,本发明并非局限于此,任何本领域的技术人员能思之的变化都应落入本发明的保护范围。

专利地区:贵州

专利申请日期:2024-09-29

专利公开日期:2024-11-29

专利公告号:CN118886340B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载