产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:一种基于AGLT网络的高光谱与激光雷达数据融合分类方法
专利类型:发明专利
专利申请号:CN202311439960.3
专利申请(专利权)人:哈尔滨工程大学
权利人地址:黑龙江省哈尔滨市南岗区南通大街145号
专利发明(设计)人:王敏慧,孙亚秀,项建弘,王霖郁,黄丽莲,钟瑜,孙蕊,武雅若,蒋涵宇,王英,徐昊
专利摘要:一种基于AGLT网络的高光谱与激光雷达数据融合分类方法,它属于高光谱图像分类领域。本发明解决了现有方法的分类性能差的问题。本发明可以从高光谱图像数据中捕获和学习高光谱空?谱联合特征,从LiDAR?DSM数据中获取高程特征;并将非对称卷积核引入视觉Transformer结构,充分利用了卷积神经网络强大的空间上下文信息提取能力和基于自注意力机制的视觉Transformer强大的远程依赖建模能力;设计Bi前馈单元用于视觉Transformer,以充分提取数据的全局和局部信息,提高了模型的分类性能。本发明方法可以应用于高光谱图像分类。
主权利要求:
1.一种基于AGLT网络的高光谱与激光雷达数据融合分类方法,其特征在于,所述方法具体包括以下步骤:步骤1、获取LiDAR?DSM图像数据及高光谱图像数据;
步骤2、采用主成分分析法对获取的高光谱图像数据进行降维处理,得到降维处理后的高光谱图像数据;
步骤3、对获取的LiDAR?DSM图像数据和降维处理后的高光谱图像数据进行切片处理,再将切片处理后的LiDAR?DSM图像数据以及高光谱图像数据划分为训练集和测试集两部分;
步骤4、构建AGLT网络,利用训练集对构建的AGLT网络进行训练,直至AGLT网络在测试集上的分类准确率不再提升时停止训练,获得训练好的AGLT网络;
所述AGLT网络包括高光谱图像数据处理支路和LiDAR?DSM数据处理支路,其中:在高光谱图像数据处理支路内,输入的图像依次经过三维归一化层、第一激活函数层、卷积核大小为1×1×3的第一个三维卷积层、卷积核大小为1×3×1的第二个三维卷积层、卷积核大小为3×1×1的第三个三维卷积层、第一个二维归一化层、第二激活函数层、卷积核大小为3×1的第一个二维卷积层、卷积核大小为1×3的第二个二维卷积层以及第一Bi?Former模块;
在LiDAR?DSM数据处理支路内,输入的LiDAR?DSM数据依次经过第二个二维归一化层、第三激活函数层、卷积核大小为3×1的第三个二维卷积层、卷积核大小为1×3的第四个二维卷积层以及第二Bi?Former模块;
将第一Bi?Former模块的输出和第二Bi?Former模块的输出共同送入交叉注意力层得到输出A和输出B,再将输出A经过第一MLP层,将输出B经过第二MLP层,最后将第一MLP层的输出和第二MLP层的输出进行叠加,叠加结果即为最终的分类结果;
所述Bi?Former模块的工作原理为:
将Bi?Former模块的输入图像映射为向量序列,并在向量序列的头部嵌入额外的学习编码得到整体序列,再对整体序列嵌入位置编码,嵌入位置编码后的向量序列经过编码器子模块,将编码器子模块的输出作为Bi?Former模块的输出;且所述编码器子模块中包括N个编码器;
第一个编码器的工作原理为:
步骤一、编码器子模块所输入的嵌入位置编码后的向量序列即为第一个编码器的输入,分别将嵌入位置编码后的向量序列映射为查询向量、键向量和值向量;
步骤二、对查询向量、键向量和值向量进行多头注意力计算,得到多头注意力计算结果;
步骤三、对步骤二的多头注意力计算结果和嵌入位置编码后的向量序列进行残差连接,并对残差连接结果进行归一化;
步骤四、将步骤三的归一化结果送入Bi前馈单元,再将Bi前馈单元的输出与步骤三的归一化结果进行残差连接,并对残差连接结果进行归一化,将归一化结果作为第一个编码器的输出;
再将第一个编码器的输出作为第二编码器的输入,以此类推,直至得到第N个编码器的输出,第N个编码器的输出即为编码器子模块的输出;
所述多头注意力的计算方法为:
步骤1)、将查询向量、键向量和值向量分别经过线性层,再将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第一缩放点积注意力单元,将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第二缩放点积注意力单元,将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第三缩放点积注意力单元;
对第一缩放点积注意力单元、第二缩放点积注意力单元和第三缩放点积注意力单元的输出进行拼接,得到拼接结果;
步骤2)、拼接结果再经过线性层处理,线性层处理后的输出即为多头注意力的输出;
所述第一缩放点积注意力单元的计算方法为:
将查询向量经过线性层后的输出和键向量经过线性层后的输出相乘,再对相乘结果进行缩放,并继续对缩放结果进行掩码处理,最后将掩码处理的结果经过Softmax激活函数;
将Softmax激活函数的输出与值向量经过线性层后的输出相乘,得到第一缩放点积注意力单元的计算结果;
所述Bi前馈单元的工作原理为:
将Bi前馈单元的输入送入到两个并行的支路,其中,第一个支路为通道注意力支路,通道注意力支路内包括全局子单元、线性层和Sigmoid激活函数层,第二个支路为空间注意力支路,空间注意力支路内包括局部子单元、线性层和Sigmoid激活函数层;
在通道注意力支路内,Bi前馈单元的输入依次经过全局子单元、线性层和Sigmoid激活函数层,得到输出X;
在空间注意力支路内,Bi前馈单元的输入首先经过局部子单元,再将局部子单元和全局子单元的输出进行拼接,拼接的结果再依次经过空间注意力支路的线性层和Sigmoid激活函数层,得到输出Y;
将X和Y相乘,再将相乘结果与Bi前馈单元的输入相乘得到最终的相乘结果,即得到Bi前馈单元的输出;
所述全局子单元内包括平均池化层、线性层和GELU激活函数层;所述局部子单元内包括线性层和GELU激活函数层;
以所述高光谱图像数据为例,交叉注意力的计算方法为:
将第一Bi?Former模块的输出中的高光谱数据额外学习编码部分作为线性投影函数HSI HSIF (·)的输入,再将线性投影函数F (·)的输出通过矩阵WQ映射到查询向量;
HSI
线性投影函数F (·)的输出与第二Bi?Former模块的输出中的LiDAR?DSM特征编码部分进行堆叠,将堆叠结果平均划分为两部分后,其中,第一部分通过矩阵WK映射到键向量,第二部分通过矩阵WV映射到值向量;
HSI
将线性投影函数F (·)的输出所对应的查询向量与堆叠结果中第一部分对应的键向量相乘,得到相乘结果a,将相乘结果输入Softmax函数;将Softmax函数的输出与堆叠结果HSI中第二部分对应的值向量相乘得到相乘结果b,并将相乘结果b与线性投影函数F (·)的HSI输出所对应的查询向量叠加,叠加结果再输入线性反投影函数G (·),再将线性反投影函HSI数G (·)的输出与第一Bi?Former模块的输出中的高光谱数据特征编码部分进行拼接,拼接结果即为输出A;
同理,利用LiDAR?DSM数据的额外学习编码替换高光谱数据额外学习编码的位置,利用高光谱数据的特征编码替换LiDAR数据的特征编码部分,对LiDAR?DSM数据的额外学习编码进行交叉注意力计算,得到输出B;
步骤5、利用训练好的AGLT网络对待分类的高光谱图像和LiDAR?DSM图像进行联合处理,得到分类结果。 说明书 : 一种基于AGLT网络的高光谱与激光雷达数据融合分类方法技术领域[0001] 本发明属于高光谱图像分类领域,具体涉及一种基于AGLT网络的高光谱与激光雷达数据融合分类方法。背景技术[0002] 遥感技术近年来有了显著的进步,增加了遥感图像的可用性。通常,来自同一地理区域的几种遥感设备的数据是可用的,因此可以使用多模态数据来分析土地覆盖信息。多种不同的传感器技术可以有效地捕获不同特征的土地覆盖物质。伴随着海量数据的获。煌L氖莶钜炷芄皇迪钟攀苹ゲ,有效地提升遥感地物分类的效果。在多模态数据融合和土地覆盖解译任务中,高光谱图像(HSI)和光探测与测距数字表面模型(LiDAR?DSM)数据的融合可解释性,一直是需要关注的重要问题。高光谱图像传感器可以获得光谱信息和地理空间信息,光探测与测距数字表面模型测量地球表面的高程和物高信息。通过整合不同模态的数据,可以获得更详细的信息,从而构建一个完整的特征表示。[0003] 多个数据源的融合可以提高土地覆盖识别的准确性,但存在许多技术障碍,如不同的数据结构以及不相关的物理特征。目前高光谱数据和LiDAR?DSM图像已经成功联合使用,其中,卷积神经网络是高光谱数据和LiDAR?DSM图像联合分类的常用方法,卷积神经网络是特征提取和上下文建模的强大工具。然而,由于其网络骨干网固有的局限性,它们不能建立全局图像的长距离连接,因此在捕获光谱特征的序列属性方面仍然存在缺陷,并且卷积神经网络中的卷积操作只能捕获局部信息,难以从全局角度获得判别光谱空间特征。视觉Transformer主干网络可以解决这些挑战,并在多模态图像分类中产生新的见解,视觉Transformer在浅层和深层获得的特征之间具有更多相似性,善于捕捉图像的全局特征信息,但无法利用图像本身具有的尺度、平移不变性和特征局部性等先验知识,必须使用大规模数据集学习高质量的中间表示。但是由于缺乏训练数据,因此,联合卷积神经网络和视觉Transformer主干网络仍然存在一定的困难,所以,现有方法的分类性能仍然较差,有待进一步提高其分类性能。发明内容[0004] 本发明的目的是为解决现有方法的分类性能差的问题,而提出的一种基于AGLT网络的高光谱与激光雷达数据融合分类方法。[0005] 本发明为解决上述技术问题所采取的技术方案是:[0006] 一种基于AGLT网络的高光谱与激光雷达数据融合分类方法,所述方法具体包括以下步骤:[0007] 步骤1、获取LiDAR?DSM图像数据及高光谱图像数据;[0008] 步骤2、采用主成分分析法对获取的高光谱图像数据进行降维处理,得到降维处理后的高光谱图像数据;[0009] 步骤3、对获取的LiDAR?DSM图像数据和降维处理后的高光谱图像数据进行切片处理,再将切片处理后的LiDAR?DSM图像数据以及高光谱图像数据划分为训练集和测试集两部分;[0010] 步骤4、构建AGLT网络,利用训练集对构建的AGLT网络进行训练,直至AGLT网络在测试集上的分类准确率不再提升时停止训练,获得训练好的AGLT网络;[0011] 步骤5、利用训练好的AGLT网络对待分类的高光谱图像和LiDAR?DSM图像进行联合处理,得到分类结果。[0012] 进一步地,所述AGLT网络包括高光谱图像数据处理支路和LiDAR?DSM数据处理支路,其中:[0013] 在高光谱图像数据处理支路内,输入的图像依次经过三维归一化层、第一激活函数层、卷积核大小为1×1×3的第一个三维卷积层、卷积核大小为1×3×1的第二个三维卷积层、卷积核大小为3×1×1的第三个三维卷积层、第一个二维归一化层、第二激活函数层、卷积核大小为3×1的第一个二维卷积层、卷积核大小为1×3的第二个二维卷积层以及第一Bi?Former模块;[0014] 在LiDAR?DSM数据处理支路内,输入的LiDAR?DSM数据依次经过第二个二维归一化层、第三激活函数层、卷积核大小为3×1的第三个二维卷积层、卷积核大小为1×3的第四个二维卷积层以及第二Bi?Former模块;[0015] 将第一Bi?Former模块的输出和第二Bi?Former模块的输出共同送入交叉注意力层得到输出A和输出B,再将输出A经过第一MLP层,将输出B经过第二MLP层,最后将第一MLP层的输出和第二MLP层的输出进行叠加,叠加结果即为最终的分类结果。[0016] 进一步地,所述Bi?Former模块的工作原理为:[0017] 将Bi?Former模块的输入图像映射为向量序列,并在向量序列的头部嵌入额外的学习编码得到整体序列,再对整体序列嵌入位置编码,嵌入位置编码后的向量序列经过编码器子模块,将编码器子模块的输出作为Bi?Former模块的输出;且所述编码器子模块中包括N个编码器;[0018] 第一个编码器的工作原理为:[0019] 步骤一、编码器子模块所输入的嵌入位置编码后的向量序列即为第一个编码器的输入,分别将嵌入位置编码后的向量序列映射为查询向量、键向量和值向量;[0020] 步骤二、对查询向量、键向量和值向量进行多头注意力计算,得到多头注意力计算结果;[0021] 步骤三、对步骤二的多头注意力计算结果和嵌入位置编码后的向量序列进行残差连接,并对残差连接结果进行归一化;[0022] 步骤四、将步骤三的归一化结果送入Bi前馈单元,再将Bi前馈单元的输出与步骤三的归一化结果进行残差连接,并对残差连接结果进行归一化,将归一化结果作为第一个编码器的输出;[0023] 再将第一个编码器的输出作为第二编码器的输入,以此类推,直至得到第N个编码器的输出,第N个编码器的输出即为编码器子模块的输出。[0024] 进一步地,所述多头注意力的计算方法为:[0025] 步骤1)、将查询向量、键向量和值向量分别经过线性层,再将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第一缩放点积注意力单元,将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第二缩放点积注意力单元,将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第三缩放点积注意力单元;[0026] 对第一缩放点积注意力单元、第二缩放点积注意力单元和第三缩放点积注意力单元的输出进行拼接,得到拼接结果;[0027] 步骤2)、拼接结果再经过线性层处理,线性层处理后的输出即为多头注意力的输出。[0028] 进一步地,所述第一缩放点积注意力单元的计算方法为:[0029] 将查询向量经过线性层后的输出和键向量经过线性层后的输出相乘,再对相乘结果进行缩放,并继续对缩放结果进行掩码处理,最后将掩码处理的结果经过Softmax激活函数;[0030] 将Softmax激活函数的输出与值向量经过线性层后的输出相乘,得到第一缩放点积注意力单元的计算结果。[0031] 进一步地,所述Bi前馈单元的工作原理为:[0032] 将Bi前馈单元的输入送入到两个并行的支路,其中,第一个支路为通道注意力支路,通道注意力支路内包括全局子单元、线性层和Sigmoid激活函数层,第二个支路为空间注意力支路,空间注意力支路内包括局部子单元、线性层和Sigmoid激活函数层;[0033] 在通道注意力支路内,Bi前馈单元的输入依次经过全局子单元、线性层和Sigmoid激活函数层,得到输出X;[0034] 在空间注意力支路内,Bi前馈单元的输入首先经过局部子单元,再将局部子单元和全局子单元的输出进行拼接,拼接的结果再依次经过空间注意力支路的线性层和Sigmoid激活函数层,得到输出Y;[0035] 将X和Y相乘,再将相乘结果与Bi前馈单元的输入相乘得到最终的相乘结果,即得到Bi前馈单元的输出。[0036] 进一步地,所述全局子单元内包括平均池化层、线性层和GELU激活函数层;所述局部子单元内包括线性层和GELU激活函数层。[0037] 更进一步地,以所述高光谱图像数据为例,交叉注意力的计算方法为:[0038] 将第一Bi?Former模块的输出中的高光谱数据额外学习编码部分作为线性投影函HSI HSI数F (·)的输入,再将线性投影函数F (·)的输出通过矩阵WQ映射到查询向量;[0039] 线性投影函数FHSI(·)的输出与第二Bi?Former模块的输出中的LiDAR?DSM特征编码部分进行堆叠,将堆叠结果平均划分为两部分后,其中,第一部分通过矩阵WK映射到键向量,第二部分通过矩阵WV映射到值向量;[0040] 将线性投影函数FHSI(·)的输出所对应的查询向量与堆叠结果中第一部分对应的键向量相乘,得到相乘结果a,将相乘结果输入Softmax函数;将Softmax函数的输出与堆叠HSI结果中第二部分对应的值向量相乘得到相乘结果b,并将相乘结果b与线性投影函数FHSI(·)的输出所对应的查询向量叠加,叠加结果再输入线性反投影函数G (·),再将线性反HSI投影函数G (·)的输出与第一Bi?Former模块的输出中的高光谱数据特征编码部分进行拼接,拼接结果即为输出A;[0041] 同理,对LiDAR?DSM数据的额外学习编码进行交叉注意力计算,得到输出B。[0042] 本发明的有益效果是:[0043] 本发明可以从高光谱图像数据中捕获和学习高光谱空?谱联合特征,从LiDAR?DSM数据中获取高程特征;并将非对称卷积核引入视觉Transformer结构,充分利用了卷积神经网络强大的空间上下文信息提取能力和基于自注意力机制的视觉Transformer强大的远程依赖建模能力;设计Bi前馈单元用于视觉Transformer,以充分提取数据的全局和局部信息,提高了模型的分类性能。附图说明[0044] 图1是AGLT网络的模型结构图;[0045] 图2是AGLT网络的训练流程图;[0046] 图3是Bi?Former模块的结构图;[0047] 图4是多头注意力结构图;[0048] 图5是Bi前馈单元结构图;[0049] 图中,(a)是通道注意力,(b)是空间注意力;[0050] 图6是交叉注意力结构图;[0051] 图7是TR数据展示图;[0052] 图中,(a)是高光谱假彩色图,(b)是DSM灰度图,(c)是真值图;[0053] 图8是MU数据展示图;[0054] 图中,(a)是高光谱假彩色图,(b)是DSM灰度图,(c)是真值图;[0055] 图9是AU数据展示图;[0056] 图中,(a)是高光谱假彩色图,(b)是DSM灰度图,(c)是真值图;[0057] 图10是AGLT网络模型对不同数据的分类结果图。具体实施方式[0058] 下面通过具体实施方式结合附图对本申请作进一步详细说明。显然,所描述的实施方式仅仅是本发明的一部分实施方式,而不是全部的实施方式。基于本发明中的实施方式,本领域普通技术人员在没有做出创造性劳动前提下所获得的其他实施方式,都属于本发明保护的范围。[0059] 具体实施方式一、结合图2说明本实施方式。本实施方式所述的一种基于AGLT网络的高光谱与激光雷达数据融合分类方法,所述方法具体包括以下步骤:[0060] 步骤1、获取LiDAR?DSM图像数据及高光谱图像数据(获取的是目前已经公开的数据);[0061] 步骤2、采用主成分分析法对获取的高光谱图像数据进行降维处理,得到降维处理后的高光谱图像数据;[0062] 通过降维可以减少三维原始数据第三维的波段数量,降低数据冗余,加快运行时间;[0063] 步骤3、对获取的LiDAR?DSM图像数据和降维处理后的高光谱图像数据进行切片处理,再将切片处理后的LiDAR?DSM图像数据以及高光谱图像数据划分为训练集和测试集两部分;[0064] 步骤4、构建AGLT网络,利用训练集对构建的AGLT网络进行训练,直至AGLT网络在测试集上的分类准确率不再提升时停止训练,获得训练好的AGLT网络;[0065] 步骤5、利用训练好的AGLT网络对待分类的高光谱图像和LiDAR?DSM图像进行联合处理,得到分类结果。[0066] 本发明首先将卷积神经网络与视觉Transformer相结合,可以从高光谱图像数据中捕获和学习高光谱空?谱联合特征,从LiDAR?DSM数据中获取高程特征;其次,将非对称卷积核引入视觉Transformer结构,充分利用了卷积神经网络强大的空间上下文信息提取能力和基于自注意力机制的视觉Transformer强大的远程依赖建模能力;最后,设计Bi前馈单元用于视觉Transformer,以充分提取数据的全局和局部信息。用于融合多源异构信息,提高联合分类性能。[0067] 具体实施方式二:结合图1说明本实施方式。本实施方式与具体实施方式一不同的是,所述AGLT网络包括高光谱图像数据处理支路和LiDAR?DSM数据处理支路,其中:[0068] 在高光谱图像数据处理支路内,输入的图像依次经过三维归一化层、第一激活函数层、卷积核大小为1×1×3的第一个三维卷积层、卷积核大小为1×3×1的第二个三维卷积层、卷积核大小为3×1×1的第三个三维卷积层、第一个二维归一化层、第二激活函数层、卷积核大小为3×1的第一个二维卷积层、卷积核大小为1×3的第二个二维卷积层以及第一Bi?Former模块;[0069] 在LiDAR?DSM数据处理支路内,输入的LiDAR?DSM数据依次经过第二个二维归一化层、第三激活函数层、卷积核大小为3×1的第三个二维卷积层、卷积核大小为1×3的第四个二维卷积层以及第二Bi?Former模块;[0070] 将第一Bi?Former模块的输出和第二Bi?Former模块的输出共同送入交叉注意力层得到输出A和输出B,再将输出A经过第一MLP层,将输出B经过第二MLP层,最后将第一MLP层的输出和第二MLP层的输出进行叠加,叠加结果即为最终的分类结果。[0071] 其它步骤及参数与具体实施方式一相同。[0072] 本发明的高光谱数据支路的卷积核采用三维非对称卷积核(1×1×3、1×3×1、3×1×1)转二维非对称卷积核(1×3,3×1)的形式,同时,DSM数据支路采用二维非对称卷积(1×3,3×1)的形式,这样可以充分学习多源图像特征。[0073] 具体实施方式三:结合图3说明本实施方式。本实施方式与具体实施方式一或二不同的是,所述Bi?Former模块的工作原理为:[0074] 将Bi?Former模块的输入图像映射为向量序列,并在向量序列的头部嵌入额外的学习编码(Extralearableembedding)得到整体序列,再对整体序列嵌入位置编码,嵌入位置编码后的向量序列经过编码器子模块,将编码器子模块的输出作为Bi?Former模块的输出;且所述编码器子模块中包括N个编码器;[0075] 第一个编码器的工作原理为:[0076] 步骤一、编码器子模块所输入的嵌入位置编码后的向量序列即为第一个编码器的输入,分别将嵌入位置编码后的向量序列映射为查询(Q)向量、键(K)向量和值(V)向量;[0077] 步骤二、对查询向量、键向量和值向量进行多头注意力计算,得到多头注意力计算结果;[0078] 步骤三、对步骤二的多头注意力计算结果和嵌入位置编码后的向量序列进行残差连接,并对残差连接结果进行归一化;[0079] 步骤四、将步骤三的归一化结果送入Bi前馈单元,再将Bi前馈单元的输出与步骤三的归一化结果进行残差连接,并对残差连接结果进行归一化,将归一化结果作为第一个编码器的输出;[0080] 再将第一个编码器的输出作为第二编码器的输入,以此类推,直至得到第N个编码器的输出,第N个编码器的输出即为编码器子模块的输出。[0081] 其它步骤及参数与具体实施方式一或二相同。[0082] 具体实施方式四:结合图4说明本实施方式。本实施方式与具体实施方式一至三之一不同的是,所述多头注意力的计算方法为:[0083] 步骤1)、将查询向量、键向量和值向量分别经过线性层,再将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第一缩放点积注意力单元,将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第二缩放点积注意力单元,将查询向量经过线性层后的输出、键向量经过线性层后的输出以及值向量经过线性层后的输出共同送入第三缩放点积注意力单元;[0084] 对第一缩放点积注意力单元、第二缩放点积注意力单元和第三缩放点积注意力单元的输出进行拼接,得到拼接结果;[0085] 步骤2)、拼接结果再经过线性层处理,线性层处理后的输出即为多头注意力的输出。[0086] 其它步骤及参数与具体实施方式一至三之一相同。[0087] 具体实施方式五:本实施方式与具体实施方式一至四之一不同的是,所述第一缩放点积注意力单元的计算方法为:[0088] 将查询向量经过线性层后的输出和键向量经过线性层后的输出相乘,再对相乘结果进行缩放,并继续对缩放结果进行掩码处理,最后将掩码处理的结果经过Softmax激活函数;[0089] 将Softmax激活函数的输出与值向量经过线性层后的输出相乘,得到第一缩放点积注意力单元的计算结果。[0090] 其它步骤及参数与具体实施方式一至四之一相同。[0091] 第二缩放点积注意力单元和第三缩放点积注意力单元的计算方法与第一缩放点积注意力单元相同。[0092] 具体实施方式六:结合图5说明本实施方式。本实施方式与具体实施方式一至五之一不同的是,所述Bi前馈单元的工作原理为:[0093] 将Bi前馈单元的输入送入到两个并行的支路,其中,第一个支路为通道注意力支路,通道注意力支路内包括全局子单元、线性层和Sigmoid激活函数层,第二个支路为空间注意力支路,空间注意力支路内包括局部子单元、线性层和Sigmoid激活函数层;[0094] 在通道注意力支路内,Bi前馈单元的输入依次经过全局子单元、线性层和Sigmoid激活函数层,得到输出X;[0095] 在空间注意力支路内,Bi前馈单元的输入首先经过局部子单元,再将局部子单元和全局子单元的输出进行拼接,拼接的结果再依次经过空间注意力支路的线性层和Sigmoid激活函数层,得到输出Y;[0096] 将X和Y相乘,再将相乘结果与Bi前馈单元的输入相乘得到最终的相乘结果,即得到Bi前馈单元的输出。[0097] 其它步骤及参数与具体实施方式一至五之一相同。[0098] 具体实施方式七:本实施方式与具体实施方式一至六之一不同的是,所述全局子单元内包括平均池化层、线性层和GELU激活函数层;所述局部子单元内包括线性层和GELU激活函数层。[0099] 其它步骤及参数与具体实施方式一至六之一相同。[0100] 具体实施方式八:结合图6说明本实施方式。本实施方式与具体实施方式一至七之一不同的是,以所述高光谱图像数据为例,交叉注意力的计算方法为:[0101] 将第一Bi?Former模块的输出中的高光谱数据额外学习编码部分作为线性投影函HSI HSI数F (·)的输入,再将线性投影函数F (·)的输出通过学习矩阵WQ映射到查询(Q)向量;HSI线性投影函数F (·)的输出与第二Bi?Former模块的输出中的LiDAR?DSM特征编码部分进行堆叠,将堆叠结果平均划分为两部分后,其中,第一部分通过学习矩阵WK映射到键(K)向量,第二部分通过学习矩阵WV映射到值(V)向量;[0102] 将线性投影函数FHSI(·)的输出所对应的查询向量与堆叠结果中第一部分对应的键向量相乘,得到相乘结果a,将相乘结果输入Softmax函数;将Softmax函数的输出与堆叠HSI结果中第二部分对应的值向量相乘得到相乘结果b,并将相乘结果b与线性投影函数FHSI(·)的输出所对应的查询向量叠加,叠加结果再输入线性反投影函数G (·),再将线性反HSI投影函数G (·)的输出与第一Bi?Former模块的输出中的高光谱数据特征编码部分进行拼接,拼接结果即为输出A;[0103] 线性投影函数FHSI(·)和线性反投影函数GHSI(·)的目的是用于维度对齐;[0104] 同理,对LiDAR?DSM数据的额外学习编码进行交叉注意力计算(此时参数运算的是LiDAR?DSM数据的额外学习编码和高光谱数据的特征编码,即利用LiDAR?DSM数据的额外学习编码替换高光谱数据额外学习编码的位置,利用高光谱数据的特征编码替换LiDAR数据的特征编码部分),得到输出B。[0105] 其它步骤及参数与具体实施方式一至七之一相同。[0106] 由于高光谱数据的额外的学习编码已经在高光谱数据所有特征编码中学习了抽象信息,因此与来自LiDAR?DSM数据的特征编码交互有助于学习补充信息。由于LiDAR?DSM数据的额外的学习编码已经在LiDAR?DSM数据所有特征编码中学习了抽象信息,因此与来自高光谱数据的特征编码交互有助于学习补充信息。[0107] 实施例[0108] 本发明提出了一种基于AGLT网络的高光谱与激光雷达数据融合分类方法,方法实现流程如表1所示:[0109] 表1AGLT网络结构算法流程[0110][0111] 具体实现步骤如下:[0112] 步骤1、获取高光谱图像数据及LiDAR?DSM数据(采用公开数据)。[0113] 步骤2、使用PCA主成分分析法对所获得的高光谱图像数据进行降维处理,可以减少三维原始数据第三维的波段数量,降低数据冗余,加快运行时间。[0114] 步骤3、对LiDAR?DSM数据及降维的高光谱数据进行预处理。根据高光谱图像及LiDAR?DSM图像中标记的像素样本的数量,指定训练集和测试集数量,并分别存储为与LiDAR?DSM数据及降维的高光谱数据格式相同的两份数据。然后,分别对两份数据进行切片处理。[0115] 步骤4、AGLT网络的训练与分类[0116] 步骤4.1、构建AGLT网络,本发明使用的训练集,测试集图像均采用11×11的分辨率。如图1所示,H×W代表空间维度,C代表第三维波段,经过PCA处理及数据预处理后,得到一系列11×11×L的高光谱图像(L代表降维后的第三维波段)以及11×11的LiDAR?DSM图像。[0117] 步骤4.2、AGLT网络结构主要分为三部分,首先是针对高光谱数据的非对称三维卷积,数据重构后的非对称二维卷积,以及针对LiDAR?DSM数据的非对称二维卷积。非对称三维卷积主要包括1×1×3,1×3×1和3×1×1;非对称二维卷积主要包括1×3和3×1。在提取空?谱联合特征信息的同时,降低参数量。[0118] 步骤4.3、高光谱数据支路及LiDAR?DSM数据支路的非对称卷积神经网络的输出,分别送入Bi?Former中。如图5所示,Bi?Former中的Bi前馈单元使AGLT网络可以在小通道维度获得较轻的计算负担,并增加跨通道的信息交互,将全局信息与局部信息融合,进一步提高了模型性能,提高精度。[0119] 步骤4.4、针对高光谱数据支路及LiDAR?DSM数据支路的Bi?Former的输出,送入交叉注意力中,进行特征信息交互,充分提取多模态数据融合特征。[0120] 步骤5、对图像进行分类。[0121] 实验部分[0122] 本发明训练网络模型,验证分类结果所使用计算机配置如下:CPU为英特尔酷睿i9?12900K,内存为32GBDDR55200,显卡为NVIDIAGeForceRTX3090Ti,硬盘为1TBSSD加4THDD,系统为Windows11专业版。使用了三个著名的多模态特征融合数据集,数据集分别为特伦托数据集(TR),密西西比大学与佛罗里达大学高尔夫球场数据集(MU)和奥格斯堡数据集(AU)。数据集展示图如图7、图8和图9所示,不同颜色代表不同的地物类别,图7对应的详细的数据信息如表2所示,图8对应的详细的数据信息如表3所示,图9对应的详细的数据信息如表4所示。[0123] 表2[0124][0125][0126] 表3[0127][0128] 表4[0129][0130] 1.TR数据集的捕获地点位于意大利的特伦托城市周边的乡村区域。数据集中包含高光谱图像和激光雷达图像。其中高光谱图像尺寸为600×166像素,包含63个波段,波段范围覆盖420.89?989.09nm的光谱波段,光谱分辨率为9.2nm,空间分辨率为1m。激光雷达图像为单通道图像,包含对应地面位置的海拔高度,图像尺寸与高光谱图像相同。数据集的标注信息中共有6个类别。[0131] 2.MU数据集是一个经过配准的航拍高光谱?激光雷达数据集。该数据集的两种模态图像通过一次航空飞行同时获。杉2010年11月,地点位于美国密西西比州。图像尺寸为325×220像素。高光谱图像包含64个光谱波段。激光雷达图像为单通道图像,包含对应地面位置的海拔高度,图像尺寸与高光谱图像相同。数据标注信息中包含11个类别。[0132] 3.AU数据集在德国奥格斯堡市上空捕获。HSI数据由DAS?EOCHySpex传感器获。贚iDAR?DSM数据由DLR?3K系统收集。两幅图像的空间分辨率降采样到统一的分辨率为30m,以充分管理多模态融合。在该数据集中,HSI数据由180个波段组成,范围为0.4?2.5μm,而LiDAR?DSM数据只有一个栅格。该数据集的大小是332×485像素。该数据集描绘了七种不同的土地覆盖类别。[0133] 对于模型的评价指标,选用业内最为广泛运用的三种客观评价指标:总体分类精度(Overallaccuracy,OA),平均分类精度(averageaccuracy,AA)和Kappa系数(Kappacoefficient,K)。[0134] 本发明使用的AGLT网络模型在三个数据集上的客观分类结果如表5所示。[0135] 表5[0136][0137] 由左往右,第一列是数据集;第二列是分类结果的OA数据;第三列是分类结果的AA数据;第四列是分类结果的K数据;第五列是分类的训练时长;第六列是分类的测试时长。主观分类结果如图10所示,图10中,(a)代表TR数据集分类效果,(b)代表MU数据集分类效果,(c)代表AU数据集分类效果。精度越高,图片椒盐噪声越少。[0138] 本发明的上述算例仅为详细地说明本发明的计算模型和计算流程,而并非是对本发明的实施方式的限定。对于所属领域的普通技术人员来说,在上述说明的基础上还可以做出其它不同形式的变化或变动,这里无法对所有的实施方式予以穷举,凡是属于本发明的技术方案所引伸出的显而易见的变化或变动仍处于本发明的保护范围之列。
专利地区:黑龙江
专利申请日期:2023-11-01
专利公开日期:2024-11-29
专利公告号:CN117475216B