开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于RGB图像的手部姿态评估方法发明专利

更新时间:2026-09-01
一种基于RGB图像的手部姿态评估方法发明专利 专利申请类型:发明专利;
地区:湖南-衡阳;
源自:衡阳高价值专利检索信息库;

专利名称:一种基于RGB图像的手部姿态评估方法

专利类型:发明专利

专利申请号:CN202410762874.4

专利申请(专利权)人:南华大学
权利人地址:湖南省衡阳市常胜西路28号

专利发明(设计)人:张明月,周鑫圆,万亚平,王超峰,蒋超,曾铁军

专利摘要:本发明公开了一种基于RGB图像的手部姿态评估方法,属于计算机视觉技术领域,包括以下步骤:S1、提出一种基于注意机制的多尺度信息感知模型来获取手势关键点信息;S2、通过分布感知的关键点坐标表示方法对手部姿势进行更精确的估计;S3、基于深度学习模型对给定应用和平台选择恰当的速度和精度平衡。本发明采用上述的一种基于RGB图像的手部姿态评估方法,提出了一种MSIPA?HandNet算法,通过利用多尺度信息感知结构和分布感知的坐标表示,以取得更好的速度和准确性平衡,用于手部姿态估计,基于速度/精度权衡问题,提出了一个综合的度量标准,用于评估手部姿态估计,并为优化手部姿态估计模型提供了有价值的意见,使用手势关键点位置信息,方便应用。

主权利要求:
1.一种基于RGB图像的手部姿态评估方法,其特征在于:包括以下步骤:S1、提出一种基于注意机制的多尺度信息感知模型来获取手势关键点信息;
所述基于注意机制的多尺度信息感知模型为编码器?解码器结构,编码器?解码器结构由下采样与上采样构成,下采样中以3×3深度可分离卷积作为基本单元,上采样以4×4反卷积块作为基本单元;
所述下采样中包括基于注意力机制的多尺度信息感知结构MSIPA,MSIPA由改进的空洞卷积金字塔和随机打乱注意力结构SA组成,在MSIPA结构添加了一条从输入到输出的1×1卷积的跳跃连接保证网络的梯度传递,F′=f3(F)(1)
F表示输入MSIPA结构的特征图,F′与F″都表示MSIPA结构过程中产生的特征图,f3(·)表示卷积核为3×3的卷积函数,fn,m(·)表示卷积函数,n表示n×n卷积核大。琺是卷积的膨胀系数,AvgP(·)表示平均池化,⊙表示通道拼接,
C×H×W
F″输入到SA结构中,假设输入特征为F″∈R ,该步骤会将输入F″沿着通道维度拆分C/g×H×W为g组:F″=[F″1,...,F″g],R ,对于每组特征,上面1?g组的任意一组的特征Fk″将被沿C/2g×H×W着通道维度拆分成两个分支:F″k1,F″k2∈R ,一个分支用于学习通道注意力特征,一个分支用于学习空间注意力特征;
S2、通过分布感知的关键点坐标表示方法对手部姿势进行更精确的估计;
所述分布感知的关键点坐标表示方法包括以下步骤:S2.1、热图分布调制;
为了平滑热图H中多峰值的影响,利用高斯核K与训练数据具有相同的变化,公式表示为:其中, 表示卷积操作,H′表示经过高斯核K卷积处理后的平滑化热图;
使用下面的变换,我们缩放 使其最大激活度等于H,保留了原始热图的大。浩渲,max(·)和min(·)返回输入矩阵的最大值和最小值, 表示经过热缩放后的热图;
S2.2、分布感知的最大重定位;
在子像素水平上获得准确的位置信息,假设预测的热图遵循二维高斯分布与真实热图相同,它表示预测的热图为:其中,x是预测热图中的一个像素位置,μ表示要估计的联合位置的高斯平均值,T表示矩阵的转置,协方差Σ是一个对角矩阵,与坐标编码相同,其中,σ是两个方向的标准差,
在保持最大激活的原始位置的同时,对h(x;μ,Σ)进行对数转换,μ表示要估计的联合位置的高斯平均值,作为分布的一个极端点,高斯平均值μ的一阶导数符合以下条件:使用泰勒定理进行探讨,泰勒级数直到二次项被用来近似预测热图中最大G(μ)的激活度,其中泰勒级数是在预测热图的最大激活度m下估算的,其中,G(μ)表示函数G在高斯平均值为μ处的值,G(m)表示函数G在μ?m处的值,D′(m)表示函数G在μ?m处的一阶导数,D″(m)是在m处评价G的二阶导数,定义为:?1
D″(m)=D″(x)x=m=?Σ (14)为了近似于μ,m应该代表一个良好的粗略的联合预测来接近μ;
根据公式(12)、公式(13)和公式(14)得到:?1
μ=m?(D″(m)) D′(m)(15)
其中,D″(m)和D′(m)从预测热图中估计出来;
S2.3、分辨率恢复;
根据S2.2中得到的μ,由下述公式来预测原始图像空间的坐标:其中,λ表示分辨率降低率, 表示经过分辨率降低后的图像空间中的对应坐标点,p表示原始图像空间中的坐标点;
S3、基于深度学习模型对给定应用和平台选择恰当的速度和精度平衡。
2.根据权利要求1所述的一种基于RGB图像的手部姿态评估方法,其特征在于:所述SA结构分块并行使用空间和通道两类注意力机制,使两类注意力机制高效结合,其中通道注意力机制中采用了最简单的GAP+Scale+Sigmoid的组合,该过程描述如下:Fgp(·)表示全局平均池化,W1与b1分别表示用于缩放和移动s的参数,σ表示Sigmoid激活函数,s表示全局平均池化, 表示对每个位置上的(i,j)像素值进行累加,i表示空间高度维度上的索引,j表示宽度维度上的索引, 表示通道注意力后的特征图,Fc表示全连接层在通道注意力机制中的映射函数;
其中空间注意力机制中首先采用GroupNorm(GN)对F″k2进行处理得到空域层面的统计信息,然后采用Fc(·)进行增强,该过程描述如下:C/2g×H×W
W2与b2表示形状为R 的参数, 表示空间注意力后的特征图,GN表示组归一化;
C
然后将两个分支拼接起来,使通道的数量与输入的数量相同,F″k=[F″k1,F″k2]∈R/g×H×W,
δ(·)表示Hardswish激活函数,BN(·)表示批量归一化,Fs(·)表示通道打乱重排操作,⊙表示通道拼接,f1(·)表示卷积核大小为1×1的卷积函数,F″g?1和F″g表示第g?1组和第g组特征被划分成等量的特征图子集,这些子集随后被分别用于通道与空间注意力机制的处理。
3.根据权利要求1所述的一种基于RGB图像的手部姿态评估方法,其特征在于:所述S3中平衡速度和准确率的评价指标SAT表示为:lcpu=pcpu×npcc×2(18)
lcpu表示逻辑CPU,pcpu表示物理CPU个数,npcc表示物理CPU核数个数,EPE表示像素上的平均节点误差,GFLOPs用来评估模型的计算能力,Params表示模型参数。 说明书 : 一种基于RGB图像的手部姿态评估方法技术领域[0001] 本发明涉及计算机视觉技术领域,尤其是涉及一种基于RGB图像的手部姿态评估方法。背景技术[0002] 近年来,通过卷积神经网络(CNN)的使用,使得手部姿态估计技术取得了显著的进步。伴随着深度传感器的发展,手部姿态估计方法从基于数据手套的硬件同步方法转向了基于计算机视觉的方法。[0003] 基于视觉的方法分为两类,一类是基于深度图像估计手部姿态,另一类是使用RGB图像估计手部姿态。不断增加的深度图像数据促进了手部姿态估计技术的研究。需要注意的是,深度传感器虽然具有有限的分辨率和范围,但也会受到环境光照条件的影响。与普通相机相比,深度传感器相对较少。当前的手部姿态估计研究主要是基于RGB图像,这也是该领域的热点之一。其中一些主要原因是,它更具代表实际应用场景。[0004] 现有技术中,基于RGB图像估计手部姿态时根据经验设计的标准的坐标解码方法不能准确对应管节的位置,仅对应粗略位置。且现有技术的模型有时会以牺牲准确性为代价去换取反应速度,有时则会以牺牲反应速度为代价去换取反应准确性。在大量的学术研究中往往会忽略模型的推理速度,重视模型的准确性。而对于深度学习模型的产业落地,往往会根据不同部署硬件平台对于速度?准确性会有不同考量。目前对于速度?准确性权衡并没有一个定量的评价标准,对于不同硬件平台也只能粗略权衡,这样会造成一定资源浪费。发明内容[0005] 本发明的目的是提供一种基于RGB图像的手部姿态评估方法,提出了一种MSIPA?HandNet算法,通过利用多尺度信息感知结构和分布感知的坐标表示,以取得更好的速度和准确性平衡,用于手部姿态估计,基于速度/精度权衡问题,提出了一个综合的度量标准,用于评估手部姿态估计,并为优化手部姿态估计模型提供了有价值的意见,使用手势关键点位置信息,方便应用。[0006] 为实现上述目的,本发明提供了一种基于RGB图像的手部姿态评估方法,包括以下步骤:[0007] S1、提出一种基于注意机制的多尺度信息感知模型来获取手势关键点信息;[0008] S2、通过分布感知的关键点坐标表示方法对手部姿势进行更精确的估计;[0009] S3、基于深度学习模型对给定应用和平台选择恰当的速度和精度平衡。[0010] 优选的,所述S1中基于注意机制的多尺度信息感知模型为编码器?解码器结构,编码器?解码器结构由下采样与上采样构成,下采样中以3×3深度可分离卷积作为基本单元,上采样以4×4反卷积块作为基本单元。[0011] 优选的,所述下采样中包括基于注意力机制的多尺度信息感知结构MSIPA,MSIPA由改进的空洞卷积金字塔和随机打乱注意力结构SA组成,在MSIPA结构添加了一条从输入到输出的1×1卷积的跳跃连接保证网络的梯度传递,[0012] F′=f3(F)(1)[0013][0014] F表示输入MSIPA结构的特征图,F′与F″都表示MSIPA结构过程中产生的特征图,f3(·)表示卷积核为3×3的卷积函数,fn,m(·)表示卷积函数,n表示n×n卷积核大。琺是卷积的膨胀系数,AvgP(·)表示平均池化,⊙表示通道拼接,[0015] F″输入到SA结构中,假设输入特征为F″∈RC×H×W,该步骤会将输入F″沿着通道维度C/g×H×W拆分为g组:F″=[F″1,…,F″g],R ,对于每组特征,上面1?g组的任意一组的特征F″k将C/2g×H×W被沿着通道维度拆分成两个分支:F″k1,F″k2∈R ,一个分支用于学习通道注意力特征,一个分支用于学习空域注意力特征。[0016] 优选的,所述SA结构分块并行使用空间和通道两类注意力机制,使两类注意力机制高效结合,其中通道注意力机制中采用了最简单的GAP+Scale+Sigmoid的组合,该过程描述如下:[0017][0018][0019] Fgp(·)表示全局平均池化,W1与b1分别表示用于缩放和移动s的参数,σ表示Sigmoid激活函数,s表示全局平均池化, 表示对每个位置上的(i,j)像素值进行累加,i表示空间高度维度上的索引,j表示宽度维度上的索引, 表示通道注意力后的特征图,Fc表示全连接层在通道注意力机制中的映射函数;[0020] 其中空间注意力机制中首先采用GroupNorm(GN)对F″k2进行处理得到空域层面的统计信息,然后采用Fc(·)进行增强,该过程描述如下:[0021]C/2g×H×W[0022] W2与b2表示形状为R 的参数, 表示空间注意力后的特征图,GN表示组归一化;[0023] 然后将两个分支拼接起来,使通道的数量与输入的数量相同,F″k=[F″k1,F″k2]∈C/g×H×WR ,[0024][0025] δ(·)表示Hardswish激活函数,BN(·)表示表示批量归一化,Fs(·)表示通道打乱重排操作,⊙表示通道拼接,f1(·)表示卷积核大小为1×1的卷积函数,F"g1和F"g2表示第g组特征被划分成等量的特征图子集,这些子集随后被分别用于通道与空间注意力机制的处理。[0026] 优选的,所述S2中分布感知的关键点坐标表示方法包括以下步骤:[0027] S2.1、热图分布调制;[0028] 为了平滑热图H中多峰值的影响,利用高斯核K与训练数据具有相同的变化,公式表示为:[0029][0030] 其中, 表示卷积操作,H'表示经过高斯核K卷积处理后的平滑化热图;[0031] 使用下面的变换,我们缩放 使其最大激活度等于H,保留了原始热图的大。篬0032][0033] 其中,max(·)和min(·)返回输入矩阵的最大值和最小值, 表示经过热缩放后的热图;[0034] S2.2、分布感知的最大重定位;[0035] 在子像素水平上获得准确的位置信息,假设预测的热图遵循二维高斯分布与真实热图相同,它表示预测的热图为:[0036][0037] 其中,x是预测热图中的一个像素位置,μ表示要估计的联合位置的高斯平均值,T表示矩阵的转置,协方差Σ是一个对角矩阵,与坐标编码相同,[0038][0039] 其中,σ是两个方向的标准差,[0040] 在保持最大激活的原始位置的同时,对h(x,μ,Σ)进行对数转换,[0041][0042] μ表示要估计的联合位置的高斯平均值,作为分布的一个极端点,高斯平均值μ的一阶导数符合以下条件:[0043][0044] 使用泰勒定理进行探讨,泰勒级数直到二次项被用来近似预测热图中最大G(μ)的激活度,其中泰勒级数是在预测热图的最大激活度m下估算的,[0045][0046] 其中,G(μ)表示函数G在高斯平均值为μ处的值,G(m)表示函数G在μ=m处的值,D'(m)表示函数G在μ=m处的一阶导数,D″(m)是在m处评价G的二阶导数,定义为:[0047] D″(m)=D″(x)|x=m=?Σ?1(14)[0048] 为了近似于μ,m应该代表一个良好的粗略的联合预测来接近μ;[0049] 根据公式(12)、公式(13)和公式(14)得到:[0050] μ=m?(D″(m))?1D′(m)(15)[0051] 其中,D″(m)和D′(m)从预测热图中估计出来;[0052] S2.3、分辨率恢复;[0053] 根据S2.2中得到的μ,由下述公式来预测原始图像空间的坐标:[0054][0055] 其中,λ表示分辨率降低率, 表示经过分辨率降低后的图像空间中的对应坐标点,p表示原始图像空间中的坐标点。[0056] 优选的,所述S3中平衡速度和准确率的评价指标SAT表示为:[0057][0058] lcpu=pcpu×npcc×2(18)[0059] lcpu表示逻辑CPU,pcpu表示物理CPU个数,npcc表示物理CPU核数个数,EPE表示像素上的平均节点误差,GFLOPs用来评估模型的计算能力,Params表示模型参数。[0060] 因此,本发明采用上述一种基于RGB图像的手部姿态评估方法,具有以下有益效果:[0061] 1)提出了一种MSIPA?HandNet算法,通过利用多尺度信息感知结构和分布感知的坐标表示,以取得更好的速度和准确性平衡,用于手部姿态估计;[0062] 2)基于速度/精度权衡问题,提出了一个综合的度量标准,用于评估手部姿态估计,并为优化手部姿态估计模型提供了有价值的意见;[0063] 3)使用手势关键点位置信息,方便应用。[0064] 下面通过附图和实施例,对本发明的技术方案做进一步的详细描述。附图说明[0065] 图1是本发明一种基于RGB图像的手部姿态评估方法实施例的流程图;[0066] 图2是本发明一种基于RGB图像的手部姿态评估方法实施例MSIPA?HandNet的流程图;[0067] 图3是本发明一种基于RGB图像的手部姿态评估方法实施例MSIPA的流程图。具体实施方式[0068] 以下通过附图和实施例对本发明的技术方案作进一步说明。[0069] 除非另外定义,本发明使用的技术术语或者科学术语应当为本发明所属领域内具有一般技能的人士所理解的通常意义。[0070] 实施例一[0071] 如图所示,本发明提供了一种基于RGB图像的手部姿态评估方法,包括以下步骤:[0072] S1、提出一种基于注意机制的多尺度信息感知模型来获取手势关键点信息;[0073] 基于注意机制的多尺度信息感知模型为编码器?解码器结构,编码器?解码器结构由下采样与上采样构成,下采样中以3×3深度可分离卷积作为基本单元,上采样以4×4反卷积块作为基本单元。[0074] 下采样中包括基于注意力机制的多尺度信息感知结构MSIPA,MSIPA由改进的空洞卷积金字塔和随机打乱注意力结构SA组成,在MSIPA结构添加了一条从输入到输出的1×1卷积的跳跃连接保证网络的梯度传递,[0075] F′=f3(F)(1)[0076][0077] F表示输入MSIPA结构的特征图,F′与F″都表示MSIPA结构过程中产生的特征图,f3(·)表示卷积核为3×3的卷积函数,fn,m(·)表示卷积函数,n表示n×n卷积核大。琺是卷积的膨胀系数,AvgP(·)表示平均池化,⊙表示通道拼接,[0078] F″输入到SA结构中,假设输入特征为F″∈RC×H×W,该步骤会将输入F″沿着通道维度C/g×H×W拆分为g组:F″=[F″1,...,F″g],R ,对于每组特征,上面1?g组的任意一组的特征F″k将C/2g×H×W被沿着通道维度拆分成两个分支:F″k1,F″k2∈R ,一个分支用于学习通道注意力特征,一个分支用于学习空域注意力特征。[0079] SA结构在通道注意力和空间注意力分别捕捉通道间的依赖关系和空间上的像素级关系,同时有效控制计算量。SA注意力机制传承了SGE注意力机制的设计理念,引入了通道随机混合操作,分块并行使用空间和通道两类注意力机制,使两类注意力机制高效结合,其中通道注意力机制中采用了最简单的GAP+Scale+Sigmoid的组合,该过程描述如下:[0080][0081][0082] Fgp(·)表示全局平均池化,W1与b1分别表示用于缩放和移动s的参数,σ表示Sigmoid激活函数,s表示全局平均池化, 表示对每个位置上的(i,j)像素值进行累加,i表示空间高度维度上的索引,j表示宽度维度上的索引, 表示通道注意力后的特征图,Fc表示全连接层在通道注意力机制中的映射函数;[0083] 其中空间注意力机制中首先采用GroupNorm(GN)对F″k2进行处理得到空域层面的统计信息,然后采用Fc(·)进行增强,该过程描述如下:[0084]C/2g×H×W[0085] W2与b2表示形状为R 的参数, 表示空间注意力后的特征图,GN表示组归一化,[0086] 然后将两个分支拼接起来,使通道的数量与输入的数量相同,F″k=[F″k1,F″k2]∈C/g×H×WR ,[0087][0088] δ(·)表示Hardswish激活函数,BN(·)表示表示批量归一化,Fs(·)表示通道打乱重排操作,⊙表示通道拼接,f1(·)表示卷积核大小为1×1的卷积函数,F"g1和F"g2表示第g组特征被划分成等量的特征图子集,这些子集随后被分别用于通道与空间注意力机制的处理。[0089] S2、通过分布感知的关键点坐标表示方法对手部姿势进行更精确的估计;[0090] S2中分布感知的关键点坐标表示方法包括以下步骤:[0091] S2.1、热图分布调制;[0092] 由于所提出的坐标解码方法是基于高斯分布假设的,与训练热图数据相比,预测的热图通常不表现出良好的高斯结构,在最大激活度附近呈现出多个峰值现象,这可能会对我们的解码方法的性能造成负面影响。为了解决这一问题,它通过事先调控热图分布来解决这个问题。为了平滑热图H中多峰值的影响,利用高斯核K与训练数据具有相同的变化,公式表示为:[0093][0094] 其中, 表示卷积操作,H'表示经过高斯核K卷积处理后的平滑化热图;[0095] 使用下面的变换,我们缩放 使其最大激活度等于H,保留了原始热图的大。篬0096][0097] 其中,max(·)和min(·)返回输入矩阵的最大值和最小值, 表示经过热缩放后的热图;[0098] S2.2、分布感知的最大重定位;[0099] 在子像素水平上获得准确的位置信息,假设预测的热图遵循二维高斯分布与真实热图相同,它表示预测的热图为:[0100][0101] 其中,x是预测热图中的一个像素位置,μ表示要估计的联合位置的高斯平均值,T表示矩阵的转置,协方差Σ是一个对角矩阵,与坐标编码相同,[0102][0103] 其中,σ是两个方向的标准差,[0104] 在保持最大激活的原始位置的同时,对h(x,μ,∑)进行对数转换,[0105][0106] μ表示要估计的联合位置的高斯平均值,作为分布的一个极端点,高斯平均值μ的一阶导数符合以下条件:[0107][0108] 使用泰勒定理进行探讨,泰勒级数直到二次项被用来近似预测热图中最大G(μ)的激活度,其中泰勒级数是在预测热图的最大激活度m下估算的,[0109][0110] 其中,G(μ)表示函数G在高斯平均值为μ处的值,G(m)表示函数G在μ=m处的值,D'(m)表示函数G在μ=m处的一阶导数,D″(m)是在m处评价G的二阶导数,定义为:[0111] D″(m)=D″(x)|x=m=?Σ?1(14)[0112] 为了近似于μ,m应该代表一个良好的粗略的联合预测来接近μ;[0113] 根据公式(12)、公式(13)和公式(14)得到:[0114] μ=m?(D″(m))?1D′(m)(15)[0115] 其中,D″(m)和D′(m)从预测热图中估计出来;[0116] S2.3、分辨率恢复;[0117] 根据S2.2中得到的μ,由下述公式来预测原始图像空间的坐标:[0118][0119] 其中,λ表示分辨率降低率, 表示经过分辨率降低后的图像空间中的对应坐标点,p表示原始图像空间中的坐标点。[0120] S3、基于深度学习模型对给定应用和平台选择恰当的速度和精度平衡;[0121] 推理过程中直接使用时间对模型进行速度衡量,则必须到设备进行实测,这里还涉及到设备端的如ARM/NOEN、定点算浮点、量化等优化,是非常复杂的,所以一般情况下,会使用GFLOPs对计算能力进行估算。由于模型推理速度与硬件平台的算力最相关,往往用算力来判断模型推理速度的能力,其中硬件平台的逻辑CPU数对于选型起到重要的作用。[0122] 平衡速度和准确率的评价指标SAT表示为:[0123][0124] lcpu=pcpu×npcc×2(18)[0125] lcpu表示逻辑CPU,pcpu表示物理CPU个数,npcc表示物理CPU核数个数,EPE表示像素上的平均节点误差,GFLOPs用来评估模型的计算能力,Params表示模型参数。[0126] 基于SAT评价指标各硬件平台参数如表3?1所示:[0127] 表3?1各硬件平台参数[0128][0129] 手势姿态估计已在动作识别、动画、游戏、运动捕捉系统中有着广泛的应用。但遗憾的是,手势姿态估计常常见诸于学术研究中,普通读者很难在现实生活中亲身体验它的效果。主要原因有两点:1.手势姿态估计在边缘计算设备上开发的应用不足;2.学术研究的手势姿态估计模型较大,难以部署在边缘计算设备上。基于以上问题利用本提供的一种基于RGB图像的手部姿态评估方法实现了PPT换页应用、PPT板书应用等。[0130] 因此,本发明采用上述一种基于RGB图像的手部姿态评估方法,提出了一种MSIPA?HandNet算法,通过利用多尺度信息感知结构和分布感知的坐标表示,以取得更好的速度和准确性平衡,用于手部姿态估计,基于速度/精度权衡问题,提出了一个综合的度量标准,用于评估手部姿态估计,并为优化手部姿态估计模型提供了有价值的意见,使用手势关键点位置信息,方便应用。[0131] 最后应说明的是:以上实施例仅用以说明本发明的技术方案而非对其进行限制,尽管参照较佳实施例对本发明进行了详细的说明,本领域的普通技术人员应当理解:其依然可以对本发明的技术方案进行修改或者等同替换,而这些修改或者等同替换亦不能使修改后的技术方案脱离本发明技术方案的精神和范围。

专利地区:湖南

专利申请日期:2024-06-13

专利公开日期:2024-11-29

专利公告号:CN118658180B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载