开云优惠体育网页版入口

开云优惠体育网页版入口:一种多模态缺陷质量检测方法及系统发明专利

更新时间:2026-09-01
一种多模态缺陷质量检测方法及系统发明专利 专利申请类型:发明专利;
源自:天津高价值专利检索信息库;

专利名称:一种多模态缺陷质量检测方法及系统

专利类型:发明专利

专利申请号:CN202410391496.3

专利申请(专利权)人:天津大学,菲特(天津)检测技术有限公司
权利人地址:天津市南开区卫津路92号

专利发明(设计)人:田楷,张效栋,孙长库,胡江洪,曹彬

专利摘要:本发明公开了一种多模态缺陷质量检测方法及系统,属于缺陷检测技术领域,方法包括:获取待测图像以及文本信息;将待测图像输入到缺陷检测模型中,获取缺陷检测模型输出的缺陷特征;将文本信息输入到文本检测模型中,获取文本检测模型输出的文本特征;将缺陷特征和文本特征输入到特征融合模型中,获取特征融合模型输出的融合缺陷特征和融合文本特征;针对每一融合文本特征,在各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。当检测条件发生变化后,应用本发明可以保证只需将原先检测的文本描述替换为新的检测标准的文本描述,无需重新对图片进行标注和训练,最终达到缩短转换周期、转换时间、项目实施周期的目的。

主权利要求:
1.一种多模态缺陷质量检测方法,其特征在于,所述方法包括:获取待测图像以及用于描述各种生产缺陷类别的文本信息;
将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征;具体包括:基于异常检测算法获取所述待测图像中的异常区域;将所述异常区域和预先配置的先验区域共同作为缺陷区域,获取位于所述缺陷区域中的缺陷特征;
将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征;
将所述缺陷特征和所述文本特征输入到特征融合模型中,将图像特征和文本特征进行匹配和对齐,获取所述特征融合模型输出的融合缺陷特征和融合文本特征;
针对每一融合文本特征,在各个融合缺陷特征中筛选出目标缺陷特征,其中,所述目标缺陷特征为:与该融合文本特征对应的融合缺陷特征;具体包括:针对每一融合文本特征,通过隶属度函数计算各个融合缺陷特征与该融合文本特征之间的隶属度,将隶属度高于预设隶属度阈值的缺陷特征作为目标缺陷特征;
所述隶属度函数为:

其中,所述 表示:缺陷特征对应的类别被归类为目标缺陷类别的隶属度,所述x表示:所述缺陷特征的特征向量,所述 表示:目标缺陷类别中心对应的图像特征向量,所述 表示:目标缺陷类别中心对应的文本特征向量,所述 和 为超参数;
基于预先构建的缺陷检测位置筛选模块,确定筛选区域;
针对每一融合文本特征,在位于所述筛选区域中的各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。
2.根据权利要求1所述的多模态缺陷质量检测方法,其特征在于,所述基于异常检测算法获取所述待测图像中的异常区域,包括:获取所述待测图像中表示各个区域的特征向量;
针对每一特征向量,计算该特征向量与特征向量库中的样本向量之间的距离,将距离大于预设阈值的特征向量对应的区域作为缺陷区域。
3.根据权利要求1所述的多模态缺陷质量检测方法,其特征在于,在所述将所述缺陷特征和所述文本特征输出到特征融合模型中,获取所述特征融合模型输出的匹配关系之前,还包括:将所述缺陷特征和所述文本特征输入至预先训练好的自注意力模块中,获取语义增强的缺陷特征和图像增强的文本特征。
4.根据权利要求3所述的多模态缺陷质量检测方法,其特征在于,所述自注意力模块包括输入层、第一交叉融合层、第二交叉融合层、SE层和上采样层。
5.根据权利要求1所述的多模态缺陷质量检测方法,其特征在于,所述将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征,包括:将所述文本信息输入到文本检测模型中,所述文本检测模型对所述文本信息中的操作手册规范要求维度、技术协议缺陷定义维度、缺陷特征描述维度进行特征提。袢∷鑫谋炯觳饽P褪涑龅奈谋咎卣。
6.一种多模态缺陷质量检测系统,其特征在于,用于实现权利要求1?5任一项所述的多模态缺陷质量检测方法,所述系统包括:采集模块,用于通过相机采集待测图像;
图像特征提取模块,用于将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征,缺陷区域表示:所述待测图像中的生产缺陷;
文本特征提取模块,用于将文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征;
特征增强模块,用于将所述缺陷特征和所述文本特征输入至预先训练好的自注意力模块中,获取语义增强的缺陷特征和图像增强的文本特征;
特征融合模块,用于将所述缺陷特征和所述文本特征输入到特征融合模型中,获取所述特征融合模型输出的融合缺陷特征和融合文本特征;
结果筛选模块,用于针对每一融合文本特征,在各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。 说明书 : 一种多模态缺陷质量检测方法及系统技术领域[0001] 本发明属于缺陷检测技术领域,具体涉及一种多模态缺陷质量检测方法及系统。背景技术[0002] 在目前的生产缺陷检测技术中,为保证高精度要求,大多数场景仍然以常规的目标检测以及实例分割技术。经过生产现场的实际勘测之后,根据生产现场、生产产品特点以及产品缺陷类型和缺陷特征,制定合理的光学方案。随后对现场进行光学设备以及图像采集设备的布置,根据现场采集的图像,依据实际的检测技术协议和作业标准,制定详细的图像标注规则和标注标准。标注图像之后,即可根据标注图像完成AI目标检测或者实例分割算法的训练工作,最终根据模型的实际检测情况,完成最终的缺陷筛选以及统计工作,输出最终检测结果。[0003] 但是检测标准发生变更之后,需要根据检测标准重新标注数据,再次完成整套AI模型的训练、评估以及部署工作,项目实施周期长,项目交付成本高。发明内容[0004] 本发明的目的在于满足实际需求,提供一种多模态缺陷质量检测方法及系统,当检测条件发生变化后,只需将原先检测的文本描述替换为新的检测标准的文本描述,无需重新对图片进行标注和训练,最终达到缩短转换周期、转换时间、项目实施周期的目的。[0005] 第一方面,本发明提供了一种多模态缺陷质量检测方法,所述方法包括:[0006] 获取待测图像以及用于描述各种生产缺陷类别的文本信息;[0007] 将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征;[0008] 将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征;[0009] 将所述缺陷特征和所述文本特征输入到特征融合模型中,获取所述特征融合模型输出的融合缺陷特征和融合文本特征;[0010] 针对每一融合文本特征,在各个融合缺陷特征中筛选出目标缺陷特征,其中,所述目标缺陷特征为:与该融合文本特征对应的融合缺陷特征。[0011] 优选地,所述将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征,包括:[0012] 将所述待测图像输入到缺陷检测模型中,基于异常检测算法获取所述待测图像中的异常区域;[0013] 将所述异常区域和预先配置的先验区域共同作为缺陷区域,获取位于所述缺陷区域中的缺陷特征。[0014] 优选地,所述基于异常检测算法获取所述待测图像中的异常区域,包括:[0015] 获取所述待测图像中表示各个区域的特征向量;[0016] 针对每一特征向量,计算该特征向量与特征向量库中的样本向量之间的距离,将距离大于预设阈值的特征向量对应的区域作为缺陷区域。[0017] 优选地,在所述将所述缺陷特征和所述文本特征输出到特征融合模型中,获取所述特征融合模型输出的匹配关系之前,还包括:[0018] 将所述缺陷特征和所述文本特征输入至预先训练好的自注意力模块中,获取语义增强的缺陷特征和图像增强的文本特征。[0019] 优选地,所述自注意力模块包括输入层、第一交叉融合层、第二交叉融合层、SE层和上采样层。[0020] 优选地,所述针对每一融合文本特征,在各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征,包括:[0021] 针对每一融合文本特征,通过隶属度函数计算各个融合缺陷特征与该融合文本特征之间的隶属度,将隶属度高于预设隶属度阈值的缺陷特征作为目标缺陷特征。[0022] 优选地,所述隶属度函数为:[0023][0024] 其中,所述Fci表示:缺陷特征对应的类别被归类为目标缺陷类别的隶属度,所述x表示:所述缺陷特征的特征向量,所述pi表示:目标缺陷类别中心对应的图像特征向量,所述ti表示:目标缺陷类别中心对应的文本特征向量,所述α和βi为超参数。[0025] 优选地,所述方法还包括:[0026] 基于预先构建的缺陷检测位置筛选模块,确定筛选区域;[0027] 针对每一融合文本特征,在位于所述筛选区域中的各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。[0028] 优选地,所述将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征,包括:[0029] 将所述文本信息输入到文本检测模型中,所述文本检测模型对所述文本信息中的操作手册规范要求维度、技术协议缺陷定义维度、缺陷特征描述维度进行特征提。袢∷鑫谋炯觳饽P褪涑龅奈谋咎卣。[0030] 第二方面,本发明提供了一种多模态缺陷质量检测系统,所述系统包括:[0031] 采集模块,用于通过相机采集待测图像;[0032] 图像特征提取模块,用于将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征,所述缺陷区域表示:所述待测图像中的生产缺陷:[0033] 文本特征提取模块,用于将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征;[0034] 特征增强模块,用于将所述缺陷特征和所述文本特征输入至预先训练好的自注意力模块中,获取语义增强的缺陷特征和图像增强的文本特征;[0035] 特征融合模块,用于将所述缺陷特征和所述文本特征输入到特征融合模型中,获取所述特征融合模型输出的融合缺陷特征和融合文本特征;[0036] 结果筛选模块,用于针对每一融合文本特征,在各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。[0037] 与现有技术相比,本申请具有的优点和积极效果是:[0038] 本发明与现有技术相比,预先训练多模态的深度学习模型,即缺陷检测模型和文本检测模型,缺陷检测模型得到表示待测图像中的生产缺陷的缺陷特征,文本检测模型用于得到描述缺陷种类的文本特征。又因为缺陷特征主要用于表征图像方向,而文本特征主要表征语义方向,图像方向和语义方向是两个完全不同的方向,即所述缺陷特征和所述文本特征之间的关联性较低。将图像特征和文本特征进行融合,提高所述缺陷特征和所述文本特征之间的关联性,进而保证图像特征和文本特征能够进行匹配和对齐,可以根据文本特征中的缺陷描述在各个缺陷特征中筛选出对应的缺陷特征。[0039] 本发明将文本特征和图像特征分开处理,当现场检测条件发生变化以后,只需要将变动部分进行语言和文本转换,也就是将原先检测标准的文本描述,替换为新的检测标准的文本描述,即使图像特征向量未发生变化,同样可以实现根据文本描述的变动对缺陷特征进行筛选的目的,进而不用重新对图像进行标注和训练,缩短了转换周期和转换时间,进而缩短项目实施周期。附图说明[0040] 为了更清楚地说明本发明实施例或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些实施例,对于本领域普通技术人员来讲,还可以根据这些附图获得其他的实施例。[0041] 图1为本发明实施例提供的一种多模态缺陷质量检测方法的流程示意图;[0042] 图2为本发明实施例提供的一种自注意力模块的结构示意图;[0043] 图3为本发明实施例提供的一种多模态缺陷质量检测系统的结构示意图。具体实施方式[0044] 下面将结合本发明实施例中附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。通常在此处附图中描述和示出的本发明实施例的组件可以以各种不同的配置来布置和设计。因此,以下对在附图中提供的本发明的实施例的详细描述并非旨在限制要求保护的本发明的范围,而是仅仅表示本发明的选定实施例。基于本发明的实施例,本领域技术人员在没有做出创造性劳动的前提下所获得的所有其他实施例,都属于本发明保护的范围。[0045] 在本发明创造的描述中,需要说明的是,除非另有明确的规定和限定,术语“相连”、“连接”应做广义理解,例如,可以是固定连接,也可以是可拆卸连接,或一体地连接;可以是机械连接,也可以是电连接;可以是直接相连,也可以通过中间媒介间接相连,可以是两个元件内部的连通。对于本领域的普通技术人员而言,可以通过具体情况理解上述术语在本发明创造中的具体含义。[0046] 第一实施例,请参阅图1,图1为本发明实施例提供的一种多模态缺陷质量检测方法的流程示意图,应用于电子设备,该电子设备可以为终端、服务器等能够运行深度学习模型的设备,具体包括步骤101?步骤105。[0047] 步骤101:获取待测图像以及用于描述各种生产缺陷的文本信息。[0048] 其中,上述生产缺陷可以包括各种场景下的缺陷,比如汽车或轮船生产过程中的漆面缺陷或轮胎缺陷等,又比如建筑行业生产中的建筑材料缺陷或建筑设计缺陷等。以对轮船生产缺陷进行检测为例,上述待测图像可以包括待检测的轮船中的各个部分,如轮船甲板图像和轮船船体结构图像等等。[0049] 文本信息用于描述各种生产缺陷,以对汽车生产缺陷进行检测为例,缺陷描述的文本信息可以通过下面的方式建立。例如磕碰类型缺陷,可以描述为:圆形磕碰、长条状磕碰、边缘磕碰、黑色有深度磕碰等等。[0050] 步骤102:将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征。[0051] 其中,所述缺陷特征表示:所述待测图像中产品的缺陷特征。一种实现方式中,每一缺陷特征可以用一维向量表示,缺陷检测模型输出的多个缺陷特征可以构成一个矩阵。[0052] 步骤103:将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征。[0053] 具体的,文件检测模型可以是传统的基于Transformer结构的NLP网络模型,将上述文本信息输入到NLP网络模型中,获取文本特征。同样的,文本特征也可以用一维向量表示。[0054] 在本实施例中,NLP网络模型可以对操作手册规范要求、技术协议缺陷定义、缺陷特征描述三个维度的文本数据进行特征提。袢∥谋咎卣。[0055] 步骤104:将所述缺陷特征和所述文本特征输出到特征融合模型中,获取所述特征融合模型输出的融合缺陷特征和融合文本特征。[0056] 具体的,缺陷特征主要用于表征图像方向,而文本特征主要表征语义方向,图像方向和语义方向是两个完全不同的方向,即所述缺陷特征和所述文本特征之间的关联性较低。[0057] 特征融合模块用于实现图像特征和文本特征的融合,即提高所述缺陷特征和所述文本特征之间的关联性,进而保证图像特征和文本特征能够进行匹配和对齐,也就是说后续步骤便可以根据文本特征中的缺陷描述在各个缺陷特征中筛选出对应的缺陷特征。[0058] 步骤105:针对每一融合文本特征,在各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。[0059] 例如,针对每一融合文本特征,可以计算该融合文本特征与融合缺陷特征之间的欧式距离,如果某一融合缺陷特征与该融合文本特征之间的欧式距离小于预设阈值,则说明该文本缺陷特征与融合缺陷特征之间存在对应关系,即该融合文本特征表示的文本信息可以描述该融合缺陷特征表示的生产缺陷类别。[0060] 例如,在步骤102输出的缺陷特征分别包括:表示长条形状的划伤的第一缺陷特征、表示圆点形状的凹陷的第二缺陷特征以及表示磕碰的第三缺陷特征。[0061] 例如针对表示长条形状的划伤的文本特征,通过计算容易得出该文本特征与第一缺陷特征之间的距离较近,与第二缺陷特征和第三缺陷特征之间的距离较远,因此在各个融合缺陷特征中检测出长条形状的划伤缺陷。[0062] 由此可知,本发明与现有技术相比,预先训练多模态的深度学习模型,即缺陷检测模型和文本检测模型,缺陷检测模型得到表示待测图像中的生产缺陷的缺陷特征,文本检测模型用于得到描述缺陷种类的文本特征。又因为缺陷特征主要用于表征图像方向,而文本特征主要表征语义方向,图像方向和语义方向是两个完全不同的方向,即所述缺陷特征和所述文本特征之间的关联性较低。将图像特征和文本特征进行融合,提高所述缺陷特征和所述文本特征之间的关联性,进而保证图像特征和文本特征能够进行匹配和对齐,可以根据文本特征中的缺陷描述在各个缺陷特征中筛选出对应的缺陷特征。[0063] 本发明将文本特征和图像特征分开处理,当现场检测条件发生变化以后,只需要将变动部分进行语言和文本转换,也就是将原先检测标准的文本描述,替换为新的检测标准的文本描述,即使图像特征向量未发生变化,同样可以实现根据文本描述的变动对缺陷特征进行筛选的目的,进而不用重新对图像进行标注和训练,缩短了转换周期和转换时间,进而缩短项目实施周期。[0064] 另外,上述特征融合模型为预先训练好的模型,对模型的训练过程如下:[0065] 设融合缺陷特征的特征向量为P,融合文本特征的特征向量为T,其中,融合缺陷特征P和融合文本特征T的维度均为N*M:其中M为特征向量的向量空间维度,N为样本数。[0066] 对融合缺陷特征P和融合文本特征T均采用L2正则化,即按行进行标准化,得到:[0067][0068][0069] 按行进行标准化之后,进行特征融合,采用内积形式完成。特征融合之后,采用非线性激活,激活函数采用多项式核函数或者高斯核的非线性核函数即可,也可直接采用Relu函数激活。例如一种激活函数如下:[0070] E=P*TT*etem。[0071] 其中,TT表示融合文本特征T的转置,tem表示可学习参数,用于控制随迭代步长变化向量。[0072] 然后构建Loss计算的向量,可以通过以下公式计算:[0073][0074][0075] 最终构建用于训练的Loss函数:[0076] 第二实施例,在上述步骤102中,在检测阶段,需要检测系统能够提取根据不同场景检测出图像当中的不同缺陷,同时为保证尽可能全的缺陷检测召回率,本实施例采用基于Prompt特征提示的方式进行提示学习训练以及采用异常检测的算法模型共同构成,以提高缺陷特征的检测准确度。[0077] 具体的,首先将所述待测图像输入到缺陷检测模型中,基于异常检测算法获取所述待测图像中的异常区域,然后将所述异常区域和预先配置的先验区域共同作为所述缺陷区域,获取位于所述缺陷区域中的缺陷特征。[0078] 其中,上述异常区域中的缺陷为生产当中极少出现的、面积相对较大的非常见缺陷。此类非常见缺陷由于难以出现,数据量极少,常规目标检测算法容易漏检,而先验区域是生产过程中容易产生缺陷的区域。本实施例同时对异常区域和先验区域进行检测,以保证检测出的缺陷特征有较高的召回率。[0079] 作为一种实现方式,工作人员可以根据生产过程中缺陷分布的个人经验,在容易产生缺陷的位置生成相应的AnchorBox(锚框)作为BBox(边界框)的Prompt提示信息,缺陷检测模型根据Prompt提示信息检测先验区域中的缺陷特征。此外,需要检测的生产缺陷越。珺Box(边界框)就越。员Vつ芄蛔既返募觳獬錾毕。[0080] 另一种实现方式中,可以通过以下步骤A?步骤B获取待测图像中的异常区域。[0081] 步骤A:获取所述待测图像中表示各个区域的特征向量。[0082] 步骤B:针对每一特征向量,计算该特征向量与特征向量库中的样本向量之间的距离,将距离大于预设阈值的特征向量对应的区域作为缺陷区域。[0083] 首先,采用预训练的SAM模型作为特征提取器,以生成正常样本的特征向量库。其中,SAM模型依次包括卷积层、DotPredictMask层(掩膜层)和特征层,利用DotPredictMask层之前的卷积层输出特征图作为局部异常感知的特征层,利用正常样本构建局部异常感知特征,并以此作为核心采样空间,对正常样本该区域进行采样,形成正常样本的特征向量库。同时训练模型时还可以利用共享卷积以及SelfAttention操作,以提升SAM模型的训练速度。[0084] 生成特征数据库之后,获取待检测的待测图像中表示各个区域的特征向量。然后针对每一特征向量,该特征向量与特征数据库中的正常样本进行对比,即计算该特征向量与特征向量库中的样本向量之间的距离,该距离可以是欧式距离、曼哈顿距离等,如果距离大于预设阈值,则说明该特征向量对应的区域与正常样本对应的区域有较大的不同,因此将该特征向量对应的区域作为缺陷区域。[0085] 第四实施例,在缺陷检测领域,缺陷特征往往相对比较。啾扔谕ㄓ肅OCO数据集中的物体特征,缺陷数据的特征往往由边缘信息、纹理信息、明暗信息等组成,缺乏更深层次的语义信息,因此若直接将所述缺陷特征和所述文本特征输入到特征融合模型,所述缺陷特征和所述文本特征的对齐较差,进而导致生产缺陷的检测准确率较低。因此为提高生产缺陷的检测准确率,在将图像特征和文本特征输送至特征融合模型之前,需要对缺陷特征和文本特征进行相关的特征增强。[0086] 具体的,请参阅图2,将所述缺陷区域和所述文本特征输入至预先训练好的自注意力模块中,获取语义增强的缺陷特征和图像增强的文本特征,实现交叉融合。其中,自注意力模块包括输入层、第一交叉融合层、第二交叉融合层、SE层和上采样层。[0087] 如图2所示,首先分别将文本特征与Q矩阵的乘积以及缺陷特征与KV矩阵的乘积输入至第一交叉融合层中进行交叉融合,常见的交叉融合方式包括矩阵堆叠、矩阵相加等,第一交叉融合层输出第一交叉矩阵。然后分别将第一交叉矩阵与KV矩阵的乘积以及第一交叉矩阵与Q矩阵的乘积输入至第二交叉融合层中进行交叉融合,第二交叉融合层向SE层输出第二交叉矩阵。SE层包括注意力模型,即SE层利用注意力机制对缺陷特征和文本特征进行特征增加,最后通过上采样层,与浅层特征进行跨层连接并相加,完成浅层特征的融合与增强。[0088] 第六实施例,可以通过隶属度函数筛选出目标缺陷特征,由于缺陷描述特征向量相对:图蚨,利用隶属度函数可以对缺陷特征进行:ヅ浜湍:秆。蕴岣呒觳獬晒β。[0089] 具体的,针对每一融合文本特征,通过隶属度函数计算各个融合缺陷特征与该融合文本特征之间的隶属度,将隶属度高于预设隶属度阈值的缺陷特征作为目标缺陷特征。[0090] 其中,所述隶属度函数为:[0091][0092] 其中,所述Fci表示:缺陷特征对应的类别被归类为目标缺陷类别的隶属度,所述x表示:所述缺陷特征的特征向量,所述pi表示:目标缺陷类别中心对应的图像特征向量,所述ti表示:目标缺陷类别中心对应的文本特征向量,所述α和βi为超参数。[0093] 上述隶属度函数的取值范围为0?1,隶属度函数的取值越接近1,说明缺陷特征对应的类别被归类为目标缺陷类别的可能性越高。因此可以预先设置预设隶属度阈值,如0.8,如果计算得到的隶属度高于0.8,则将该缺陷特征归类为目标缺陷特征。[0094] 另外,βi表示隶属度函数调节变量,用于对:冉卸攘,对于:冉细叩奶卣飨蛄,采用较大的βi值。[0095] 第七实施例,上述实施例主要根据文本信息去筛选目标缺陷特征,除此之外,本实施例还可以基于位置信息筛选目标缺陷特征。[0096] 具体的,首先,结合缺陷检测的位置信息以及缺陷的大小信息,构建离线的缺陷检测位置筛选模块,然后基于预先构建的缺陷检测位置筛选模块,确定筛选区域。针对每一融合文本特征,在位于所述筛选区域中的各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。[0097] 以对汽车生产缺陷检测为例,在一张待测图像中,该待测图像中可以包括划伤、磕碰等各种缺陷,上述各种缺陷可能位于图像中的不同区域,比如有些缺陷位于图像的正中央,有些缺陷位于图像的左上角等等。比如,当存在只检测位于图像左上角的划伤缺陷的需求时,便可以利用缺陷检测位置筛选模块。即缺陷检测位置筛选模块会生成包括x坐标和y坐标的检测框,该检测框限制检测区域为图像左上角,进而只会筛选出位于图像左上角的划伤缺陷。[0098] 第八实施例,请参阅图3,本发明还提供一种多模态缺陷质量检测系统,所述系统包括:[0099] 采集模块,用于通过相机采集待测图像。[0100] 图像特征提取模块,用于将所述待测图像输入到缺陷检测模型中,获取所述缺陷检测模型输出的缺陷特征,所述缺陷区域表示:所述待测图像中的生产缺陷。[0101] 文本特征提取模块,用于将所述文本信息输入到文本检测模型中,获取所述文本检测模型输出的文本特征。[0102] 特征增强模块,用于将所述缺陷特征和所述文本特征输入至预先训练好的自注意力模块中,获取语义增强的缺陷特征和图像增强的文本特征。[0103] 特征融合模块,用于将所述缺陷特征和所述文本特征输入到特征融合模型中,获取所述特征融合模型输出的融合缺陷特征和融合文本特征。[0104] 结果筛选模块包括语言信息指导子模块和缺陷检测位置筛选子模块。针对特征融合模块输出每一融合文本特征,基于语言信息指导子模块在各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。或者,基于缺陷检测位置筛选子模块确定筛选区域,针对每一融合文本特征,基于语言信息指导子模块在位于所述筛选区域中的各个融合缺陷特征中筛选出与该融合文本特征对应的目标缺陷特征。[0105] 辅助训练模块,用于构建用于模型训练的特征数据库,以及对所述缺陷检测模型、文本检测模型和特征融合模型进行训练。[0106] 其中,在模型训练前期阶段,收集不同场景采集到的图像缺陷图像,先采用与目标检测类似的模式,对图像当中的原始缺陷数据进行人工标注,获取当前场景下图像中的BBox缺陷位置信息以及缺陷的局部特征图。根据场景信息,对图像当中的缺陷标注信息进行人工二次文本标注以及形态特征描述,将文本特征和缺陷特征组成特征数据库。同时,补充其他场景下的同一缺陷的缺陷特征数据以及文本描述数据,提升特征数据库的多样性以及文本描述的丰富性,提升模型在不同场景中的适应性以及泛化能力。[0107] 以上仅为本发明的较佳实施例,并非用于限定本发明的保护范围。凡在本发明的精神和原则之内所作的任何修改、等同替换、改进等,均包含在本发明的保护范围内。

专利地区:天津

专利申请日期:2024-04-01

专利公开日期:2024-11-29

专利公告号:CN118297898B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载