开云优惠体育网页版入口

开云优惠体育网页版入口:意图识别与槽值填充联合预测方法及系统发明专利

更新时间:2026-09-12
意图识别与槽值填充联合预测方法及系统发明专利 专利申请类型:发明专利;
地区:内蒙古-呼和浩特;
源自:呼和浩特高价值专利检索信息库;

专利名称:意图识别与槽值填充联合预测方法及系统

专利类型:发明专利

专利申请号:CN202311173502.X

专利申请(专利权)人:内蒙古工业大学
权利人地址:内蒙古自治区呼和浩特市新城区爱民路(北)49号

专利发明(设计)人:李大鹏,张燕俊,马志强,李雷孝

专利摘要:本发明公开了意图识别与槽值填充联合预测方法,包括:完成词嵌入和位置嵌入,进行第一预设操作得到第一输出结果,且将第一输出结果输入Transformer编码器;将第一输出结果映射为预设向量,通过多头注意力机制进行预设处理,得到第二输出结果;将第二输出结果进行第二预设操作,将Transformer编码器的输入及输出输入到双向长短期记忆网络编码器得到编码结果;提取编码结果最后时刻的隐单元输出,并输入第一解码器进行意图识别任务训练,同时提取编码结果所有时刻的隐单元输出,并输入第二解码器进行槽值填充任务训练。本发明能够将意图识别和槽值填充两个任务联合在一起,提高意图识别与槽值填充准确率,加快意图识别与槽值填充预测速度。

主权利要求:
1.意图识别与槽值填充联合预测方法,其特征在于,包括以下步骤:步骤S1:完成词嵌入和位置嵌入,进而对词嵌入和位置嵌入进行第一预设操作,得到第一输出结果,且将第一输出结果输入Transformer编码器;
具体为:
步骤S10:在完成词嵌入和位置嵌入后,对所述词嵌入和位置嵌入进行叠加和Dropout操作,其过程表示为:,
其中,代表位置嵌入的结果,代表词嵌入的结果;
步骤S11:将得到的输出结果 输入Transformer编码器;
步骤S2:将第一输出结果映射为预设向量,进而通过多头注意力机制进行预设处理,得到第二输出结果;
具体为:
步骤S20:将输出结果 映射为Query、Key和Value向量;
步骤S21:通过多头注意力机制进行处理,其过程表示为:,
,
,
其中, 代表Query, 代表Key, 代表Value, 为放缩因子, ,, 和 都是线性映射的参数矩
阵;
步骤S22:将 进行残差连接和LayerNorm操作得到 ,并输入前馈网络,其过程表示为:,
,
其中, 是前馈神经网络的参数,W代表Weights,b代表Bias;
步骤S23:在完成Transformer编码之前,进行残差连接和LayerNorm操作得到 ,其过程表示为:;
步骤S3:将第二输出结果进行第二预设操作,进而将Transformer编码器的输入及输出结果,输入到双向长短期记忆网络编码器进行编码,得到编码结果;
将Transformer编码器的 与 进行残差连接和Dropout操作,其过程表示为:;
步骤S4:提取所述编码结果中最后时刻的隐单元输出,并将其输入第一解码器进行意图识别任务训练,同时提取所述编码结果中所有时刻的隐单元输出,并将其输入第二解码器进行槽值填充任务训练;其中,第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数。
2.根据权利要求1所述的意图识别与槽值填充联合预测方法,其特征在于,其特征在于,所述得到编码结果的方法为:步骤S31:将得到的 表示为 ,输入到双向长短期记忆网络编码器进行编码,其过程表示为:



其中, 表示长短期记忆网络在 时刻的隐状态, 表示长短期记忆网络从后到前计算在 时刻的隐状态, 表示长短期记忆网络函数从后到前计算, 表示长短期记忆网络从前到后计算在 时刻的隐状态, 表示长短期记忆网络函数从前到后计算,表示 中第 个标记。
3.根据权利要求1所述的意图识别与槽值填充联合预测方法,其特征在于,进行意图识别任务训练和槽值填充任务训练的方法为:步骤S40:从编码结果 中提取最后时刻的隐单元的输出记作 ,并将 输入第一解码器进行意图识别任务,其过程表示为:,
其中,为LogSoftmax激活函数, 和 为神经网络参数;
步骤S41:从编码结果 中提取所有时刻的隐单元输出,并将所有时刻的隐单元输出输入第二解码器进行槽值填充任务,且采用条件随机场进行序列分析,其过程表示为:,
,
其中, 和 为训练参数, 为槽位标签, 负责计算 的标签得分和从 到 到目标转换得分;
步骤S42:第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数,其过程表示为:,
其中, 是整个模型的损失函数, 是意图识别的损失函数, 是槽值填充的损失函数,是用于在训练中控制意图识别任务与槽值填充任务平衡的超参数。
4.根据权利要求1所述的意图识别与槽值填充联合预测方法,其特征在于,TLC模型的训练方法包括以下步骤:步骤S100:使用PyTorch深度学习框架来构建TLC模型,完成模型的初始化;
步骤S101:经过词嵌入部分和位置嵌入,进入Transformer编码器、双向长短期记忆网络编码器向前传播到模型解码器得到意图识别与槽值填充值;
步骤S102:使用负对数似然损失函数作为这联合训练的损失函数,对Transformer编码器、双向长短期记忆网络编码器输出进行损失值计算;
步骤S103:使用Adam方法作为训练优化器,进行模型调参优化,且采用梯度裁剪法防止训练过拟合;
步骤S104:保存训练好的模型参数。
5.意图识别与槽值填充联合预测系统,其特征在于,用于实现根据权利要求1?4中任一项所述的意图识别与槽值填充联合预测方法,包括模块:模型部署模块,用于完成词嵌入和位置嵌入,进而对词嵌入和位置嵌入进行第一预设操作,得到第一输出结果,且将第一输出结果输入Transformer编码器;
第一编码模块,用于将第一输出结果映射为预设向量,进而通过多头注意力机制进行预设处理,得到第二输出结果;
第二编码模块,用于将第二输出结果进行第二预设操作,进而将Transformer编码器的输入及输出结果,输入到双向长短期记忆网络编码器进行编码,得到编码结果;
联合训练模块,用于提取所述编码结果中最后时刻的隐单元输出,并将其输入第一解码器进行意图识别任务训练,同时提取所述编码结果中所有时刻的隐单元输出,并将其输入第二解码器进行槽值填充任务训练;其中,第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数。
6.一种计算机介质,其特征在于,所述计算机介质上存储有计算机程序,所述计算机程序被处理器执行实现根据权利要求1?4中任一项所述的意图识别与槽值填充联合预测方法。
7.一种计算机设备,其特征在于,包括根据权利要求6所述的一种计算机介质。 说明书 : 意图识别与槽值填充联合预测方法及系统技术领域[0001] 本发明涉及智能问答技术领域,具体涉及意图识别与槽值填充联合预测方法、系统、计算机介质及计算机。背景技术[0002] 意图识别与槽值填充研究有相对较长的历史。在统计学习方法在自然语言处理中为主流时期,很多统计学习方法被成功的应用于意图识别与槽值填充任务。当时的研究通常将该任务分为意图识别与槽值填充两部分,支持向量机(SupportVectorMachine,SVM)和Adaboost算法在意图识别领域有较好效果;而条件随机场(ConditionalRandomField,CRF)方法则在槽值填充领域占据了统治地位。随着深度学习时代的到来,基于深度学习技术的意图识别与槽值填充方法成为了该领域的主流方法,如Hakkani?Tür等提出的基于双向LSTM的JointSeq模型。此后,Liu和Lane在双向LSTM中加入了注意力机制,提出了AttentionBiRNN模型。Zhu和Yu提出将focus机制并将其应用于编码器?解码器结构,获得了很好的意图识别与槽值填充效果。Goo等在Liu和Lane方法的基础上加入了槽位门控机制,提出了Slot?GatedAtten模型。Li等也在模型中加入了门控机制提出了Self?AttentiveModel方法。Wang等考虑到意图识别任务与槽值填充任务的交互影响,提出了Bi?Model模型。Zhang等将胶囊网络应用于意图识别与槽值填充任务,提出了CAPSULE?NLU模型。E等提出的SF?IDNetwork和Liu等提出的CM?Net,在提高意图识别与槽值填充两个任务交互促进上做出了新贡献。Qin等提出了Stack?Propagation模型,通过结合单词级别意图识别,有效的提高意图检测性能并进一步缓解错误传播,从而更好地结合意图信息以进行槽值填充。随着预训练技术的发展,预训练语言模型开始被用于意图识别与槽值填充研究,Siddhant等提出的方法很具有代表性。Siddhant等使用ELMo模型作为表示学习方法,并将双向LSTM与CRF相结合,在意图识别与槽值填充任务上取得很好效果。此外,Siddhant等还提出一种轻量型的ELMo模型——ELMoL(ELMo?Light)模型,可提高模型调用的性能。[0003] 2018年,BERT模型的推出使自然语言处理研究进入了“后BERT”时代。在意图识别与槽值填充研究中,BERT模型也逐渐开始被使用。将BERT模型应用于意图识别与槽值填充任务,提出了JointBERT模型,成为了在该领域中应用BERT模型的典型方法。随着图神经网络的发展,基于图神经网络的意图识别与槽值填充方法也被提出,如GraphLSTM模型。而随着Transformer研究的兴起,以基于Transformer的意图识别与槽值填充方法成为了研究热点。Co?InteractiveTransformer和SyntacticTF都是基于Transformer的意图识别与槽值填充的最新研究开云优惠体育网页版入口。[0004] 然而,在任务型对话机器人提供服务的过程中,需要执行意图识别和槽值填充两个任务来完成对用户输入的信息进行理解,其中意图识别属于单分类任务,槽值填充属于序列标注任务;因此,如何将两个任务联合在一起,提高意图识别与槽值填充准确率,加快意图识别与槽值填充预测速度是目前亟需解决的问题。发明内容[0005] 发明目的:为了克服以上不足,本发明的目的是提供意图识别与槽值填充联合预测方法、系统、计算机介质及计算机,其采用Transformer与双向长短期记忆网络和条件随机场相结合的方法构建意图识别与槽值填充模型,并在Transformer与双向长短期记忆网络之间加入残差学习(ResidualLearning)构建意图识别与槽值填充模型(本文简称TLC模型),能够捕获更长距离的依赖关系,进而利用时序信息和标签依赖关系,提升序列标注任务的性能,增强序列标注结果的一致性。[0006] 为解决上述技术问题,本发明提供了意图识别与槽值填充联合预测方法,包括:[0007] 步骤S1:完成词嵌入和位置嵌入,进而对词嵌入和位置嵌入进行第一预设操作,得到第一输出结果,且将第一输出结果输入Transformer编码器;[0008] 步骤S2:将第一输出结果映射为预设向量,进而通过多头注意力机制进行预设处理,得到第二输出结果;[0009] 步骤S3:将第二输出结果进行第二预设操作,进而将Transformer编码器的输入及输出结果,输入到双向长短期记忆网络编码器进行编码,得到编码结果;[0010] 步骤S4:提取所述编码结果中最后时刻的隐单元输出,并将其输入第一解码器进行意图识别任务训练,同时提取所述编码结果中所有时刻的隐单元输出,并将其输入第二解码器进行槽值填充任务训练;其中,第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数。[0011] 优选地,对词嵌入和位置嵌入进行第一预设操作,得到第一输出结果的方法为:[0012] 步骤S10:在完成词嵌入和位置嵌入后,对所述词嵌入和位置嵌入进行叠加和Dropout操作,其过程表示为:[0013] S=Dropout(P+E)[0014] 其中,P代表位置嵌入的结果,E代表词嵌入的结果;[0015] 步骤S11:将得到的输出结果S输入Transformer编码器。[0016] 优选地,通过多头注意力机制进行预设处理,得到第二输出结果的方法为:[0017] 步骤S20:将输出结果S映射为Query、Key和Value向量;[0018] 步骤S21:通过多头注意力机制进行处理,其过程表示为:[0019][0020][0021] HO=Concat(head1,...,headh)Wo[0022] 其中,Q代表Query,K代表Key,V代表Value, 为放缩因子,和 都是线性映射的参数矩阵;[0023] 步骤S22:将HO进行残差连接和LayerNorm操作得到HL1,并输入前馈网络,其过程表示为:[0024] HL1=LN(S+HO)[0025] FFN(HL1)=max(0,HL1W1+b1)W2+b2[0026] 其中,W1,b1,W2,b2是前馈神经网络的参数,W代表Weights,b代表Bias;[0027] 步骤S23:在完成Transformer编码之前,进行残差连接和LayerNorm操作得到HL2,其过程表示为:[0028] HL2=LN(HL1+FFN(HL1))。[0029] 优选地,将第二输出结果进行第二预设操作的方法为:[0030] 步骤S30:将Transformer编码器的S与HL2进行残差连接和Dropout操作,其过程表示为:[0031] X=Dropout(S+HL2)。[0032] 优选地,所述得到编码结果的方法为:[0033] 步骤S31:将得到的X表示为X=(x1,x2,...,xt),输入到双向长短期记忆网络编码器进行编码,其过程表示为:[0034][0035][0036][0037] 其中,ht表示长短期记忆网络在t时刻的隐状态, 表示长短期记忆网络从后到前计算在t时刻的隐状态,LSTMbw表示长短期记忆网络函数从后到前计算, 表示长短期记忆网络从前到后计算在t时刻的隐状态,LSTMfw表示长短期记忆网络函数从前到后计算,xt表示X中第t个标记(token)。[0038] 优选地,进行意图识别任务训练和槽值填充任务训练的方法为:[0039] 步骤S40:从编码结果H中提取最后时刻的隐单元的输出记作Hintent,并将Hintent输入第一解码器进行意图识别任务,其过程表示为:[0040] yintent=σ(WintentHintent+bintent)[0041] 其中,σ为LogSoftmax激活函数,Wintent和bintent为神经网络参数;[0042] 步骤S41:从编码结果H中提取所有时刻的隐单元输出,并将所有时刻的隐单元输出输入第二解码器进行槽值填充任务,且采用条件随机场进行序列分析,其过程表示为:[0043] Cslot=WslotH+bslot[0044][0045] 其中,Wslot和bslot为训练参数,y′i为槽位标签,f(yi?1,yi,Cslot)负责计算yi的标签得分和从yi?1到yi到目标转换得分;[0046] 步骤S42:第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数,其过程表示为:[0047] Ljoint=αLintent+(1?α)Lslot[0048] 其中,Ljoint是整个模型的损失函数,Lintent是意图识别的损失函数,Lslot是槽值填充的损失函数,α是用于在训练中控制意图识别任务与槽值填充任务平衡的超参数。[0049] 优选地,TLC模型的训练方法包括以下步骤:[0050] 步骤S100:使用PyTorch深度学习框架来构建TLC模型,完成模型的初始化;[0051] 步骤S101:经过词嵌入部分和位置嵌入,进入Transformer编码器、双向长短期记忆网络编码器向前传播到模型解码器得到意图识别与槽值填充值;[0052] 步骤S102:使用负对数似然损失函数作为这联合训练的损失函数,对Transformer编码器、双向长短期记忆网络编码器输出进行损失值计算;[0053] 步骤S103:使用Adam方法作为训练优化器,进行模型调参优化,且采用梯度裁剪法防止训练过拟合;[0054] 步骤S104:保存训练好的模型参数。[0055] 本发明还提供一种意图识别与槽值填充联合预测系统,包括:[0056] 模型部署模块,用于完成词嵌入和位置嵌入,进而对词嵌入和位置嵌入进行第一预设操作,得到第一输出结果,且将第一输出结果输入Transformer编码器;[0057] 第一编码模块,用于将第一输出结果映射为预设向量,进而通过多头注意力机制进行预设处理,得到第二输出结果;[0058] 第二编码模块,用于将第二输出结果进行第二预设操作,进而将Transformer编码器的输入及输出结果,输入到双向长短期记忆网络编码器进行编码,得到编码结果;[0059] 联合训练模块,用于提取所述编码结果中最后时刻的隐单元输出,并将其输入第一解码器进行意图识别任务训练,同时提取所述编码结果中所有时刻的隐单元输出,并将其输入第二解码器进行槽值填充任务训练;其中,第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数。[0060] 本发明还提供一种计算机介质,所述计算机介质上存储有计算机程序,所述计算机程序被处理器执行实现所述的意图识别与槽值填充联合预测方法。[0061] 本发明还提供一种计算机,包括所述的一种计算机介质。[0062] 本发明的上述技术方案相比现有技术具有以下优点:[0063] 1、本发明探索了意图识别与槽值填充两个任务之间的潜在关系,将Transformer与双向长短期记忆网络编码器组合,进而将意图识别和槽值填充两个任务联合在一起,提高意图识别与槽值填充准确率,加快意图识别与槽值填充预测速度;[0064] 2、本申请的Transformer编码器,双向长短期记忆网络编码器与条件随机场相结合的方法不仅能够捕获更长距离的依赖关系,同时还能利用时序信息和标签依赖关系,提升序列标注任务的性能,增强序列标注结果的一致性;[0065] 3、本申请在Transformer编码器与双向长短期记忆网络编码器加入了残差连接减轻了梯度消失问题,使得模型的训练速度更快,收敛更稳定,使模型能在较短的时间内达到更好的性能。附图说明[0066] 为了更清楚地说明本发明实施例或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作简单的介绍,显而易见地,下面描述中的附图仅仅是本发明的实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据提供的附图获得其他的附图。[0067] 图1是本发明的TLC意图识别与槽值填充模型的示意图。[0068] 图2是本发明的意图识别与槽值填充联合预测方法的流程图。[0069] 图3是本发明的第一输出结果获得方法的流程图。[0070] 图4是本发明的第二输出结果获得方法的流程图。[0071] 图5是本发明的进行意图识别和槽值填充的任务训练方法的流程图[0072] 图6是本发明的训练过程的流程图。[0073] 图7是本发明的意图识别与槽值填充联合预测系统的连接示意图。[0074] 说明书附图标记说明:[0075] 1、模型部署模块,2、第一编码模块,3、第二编码模块,4、联合训练模块。具体实施方式[0076] 下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描述的实施例是示例性的,旨在用于解释本发明,而不能理解为对本发明的限制。[0077] 本申请探索了意图识别与槽值填充两个任务之间的潜在关系,将Transformer与双向长短期记忆网络(BiLSTM)组合,采用条件随机场(CRF)作为槽值填充解析方法,同时在Transformer编码器与BiLSTM编码器新加入了残差学习(ResidualLearning),提出了TLC(TLC分别代表Transformer、LSTM和CRF的首字母)方法。Transformer与BiLSTM的组合提高了意图识别的准确率,BiLSTM与CRF的加入增加了槽值填充F1值,新加入的ResidualLearning提升了模型预测的速率。[0078] 意图识别与槽值填充联合预测方法,沿用了经典的编码器?解码器结构。模型中的编码器分为两部分,第一部分是普通(vanilla)Transformer编码器,第二部分是双向长短期记忆网络编码器。模型中的解码器也分为两部分,一部分是线性分类解码器,负责意图识别任务,一部分是条件随机场解码器,负责槽值填充任务。[0079] 参照图1?图6所示,本发明其中一方面提出的意图识别与槽值填充联合预测方法,通过如下方法构建:[0080] (1)TLC模型的词嵌入主要使用的是GloVe方法,TLC模型的位置嵌入使用是经典论文《AttentionIsAllYouNeed》提出的方法;[0081] 在完成词嵌入和位置嵌入后,本文方法对词嵌入和位置嵌入进行叠加和Dropout操作,其过程表示为式:[0082] S=Dropout(P+E)[0083] 其中,P代表位置嵌入的结果,E代表词嵌入的结果;[0084] 之后,将得到的S输入模型的第一部分普通(vanilla)Transformer编码器。[0085] (2)使用第一部分普通(vanilla)Transformer编码器的第一步是将上述的S映射为Query、Key和Value,之后再通过多头注意力机制进行处理;[0086] 其中,多头注意力机制的处理过程表示为式:[0087][0088][0089] HO=Concat(head1,...,headh)WO[0090] 其中,Q代表Query,K代表Key,V代表Value, 为放缩因子,和 都是线性映O L1射的参数矩阵,之后,将H 进行残差连接和LayerNorm(LN)操作得到H ,并输入前馈网络(Feed?ForwardNetworks,FFN),其过程表示为式:[0091] HL1=LN(S+HO)[0092] FFN(HL1)=max(0,HL1W1+b1)W2+b2[0093] 其中,W1,b1,W2,b2是前馈神经网络的参数,W代表Weights,b代表Bias;[0094] 在完成Transformer编码之前,又进行了一次残差连接和LayerNorm操作得到HL2,其过程表示为:[0095] HL2=LN(HL1+FFN(HL1))。[0096] (3)在将第一部分Transformer编码器的输出的结果输入到第二部分双向长短期L2记忆网络(BiLSTM)编码器之前,需要再将Transformer编码器的S与H 进行残差连接和Dropout操作,其过程表示为式:[0097] X=Dropout(S+HL2)[0098] 其中,通过进行残差连接和Dropout操作的X,提升模型槽值填充的效果。[0099] (4)将得到的X表示为X=(x1,x2,...,xt),输入到第二部分BiLSTM编码器进行二次编码,其过程表示为式:[0100][0101][0102][0103] 其中,ht表示长短期记忆网络在t时刻的隐状态, 表示长短期记忆网络从后到前计算在t时刻的隐状态,LSTMbw表示长短期记忆网络函数从后到前计算, 表示长短期记忆网络从前到后计算在t时刻的隐状态,LSTMfw表示长短期记忆网络函数从前到后计算,xt表示X中第t个标记(token)。[0104] (5)从H中提取最后时刻的隐单元的输出记作Hintent用于意图识别任务,并将其输入第一部分解码器神经网络进行线性分类,其过程表示为式:[0105] yintent=σ(WintentHintent+bintent)[0106] 其中,σ为LogSoftmax激活函数,Wintent和bintent为神经网络参数。[0107] (6)H本身就是BiLSTM编码器所有时刻的隐单元输出,可直接用于第二部分解码器进行槽值填充任务,本文使用条件随机场(CRF)进行序列分析,其过程表示为式:[0108] Cslot=WslotH+bslot[0109][0110] 其中,Wslot和bslot为训练参数,y′i为槽位标签,f(yi?1,yi,Cslot)负责计算yi的标签得分和从yi?1到yi到目标转换得分。[0111] (7)最后,两部分解码器都使用负对数似然损失(NegativeLogLikelihoodLoss,NLLLOSS)函数作为这两个任务训练的损失函数,联合训练的损失函数过程表示为式:[0112] Ljoint=αLintent+(1?α)Lslot[0113] 其中,Ljoint是整个模型的损失函数,Lintent是意图识别的损失函数,Lslot是槽值填充的损失函数,α是用于在训练中控制意图识别任务与槽值填充任务平衡的超参数。[0114] 本发明的Transformer编码器,双向长短期记忆网络编码器与条件随机场相结合的方法不仅能够捕获更长距离的依赖关系同时还能利用时序信息和标签依赖关系,提升序列标注任务的性能,增强序列标注结果的一致性;本发明与现有模型在SNIPS语料库上进行对比实验,实验结果表明,本发明TLC模型在槽值填充F1值(%)、意图识别准确率(%)分别为97.25%、99.29%,都高于其他现有模型。[0115] 表1模型在SNIPS语料库上的实验结果[0116][0117][0118] 本发明在Transformer编码器与双向长短期记忆网络编码器加入了残差连接(ResidualLearning)减轻了梯度消失问题,使得模型的训练速度更快,收敛更稳定,使模型能在较短的时间内达到更好的性能;本发明在SNIPS语料库上与预训练语言模型进行对比分析,得到本发明的预测速率比其他三种预训练语言模型都要快,值为0.3682。[0119] 表2:SNIPS语料库意图识别与槽值填充任务的模型对比分析[0120][0121] 本发明提出的基于Transformer的意图识别与槽值填充模型无论去掉模型中新加入的ResidualLearning部分,还是去掉BiLSTM或CRF,都会造成模型的槽值填充效果下降,这说明ResidualLearning部分,BiLSTM,CRF都对槽值填充效果有影响,三者缺一不可。当同时去掉ResidualLearning、BiLSTM和CRF时,模型的意图识别与槽值填充下降比较大,这说明模型只使用普通(vanilla)Transformer很难有效的完成意图识别与槽值填充任务。[0122] 表3:TLC模型在SNIPS语料库上的模型消融实验结果[0123] 模型 槽值填充F1值(%) 意图识别准确率(%)withoutResidualLearning 97.00 99.43withoutBiLSTM 89.71 99.29withoutCRF 96.02 99.57onlyvanillaTransformer 87.60 98.86TLC 97.25 99.29[0124] 参考图6所示,在一些实施例中,本发明提供的意图识别与槽值填充联合预测方法的方法训练过程包括以下步骤:[0125] 1)使用PyTorch深度学习框架来构建TLC模型,完成模型的初始化。[0126] 2)经过模型的词嵌入部分和位置嵌入进入编码器向前传播到模型解码器得到意图识别与槽值填充值,其中在第一部分Transformer编码器中,层数为2,维数为400,多头注意力机制的头数为10,前馈网络的维数为2048,激活函数为GeLu,在第二部分BiLSTM编码器中,层数为2,每个LSTM的隐藏大小为200。[0127] 3)训练的batch为32,maxepoch为200,learningrate为0.0001,dropoutrate为0.1,使用负对数似然损失(NegativeLogLikelihoodLoss,NLLLOSS)函数作为这两个任务训练的损失函数,对两个任务的编码器输出进行损失值计算。[0128] 4)模型调参优化,使用Adam方法作为训练优化器,将β1和β2分别设置为0.9和0.999,∈={10}^{?8},权重衰减为0,采用梯度裁剪法防止训练过拟合,梯度最大范数设为1,范数类型为L2,超参数为0.5。[0129] 5)保存训练好的模型参数。[0130] 参考图1?图7所示,在一些实施例中,本发明还提供意图识别与槽值填充联合预测系统,包括:[0131] 模型部署模块1,用于完成词嵌入和位置嵌入,进而对词嵌入和位置嵌入进行第一预设操作,得到第一输出结果,且将第一输出结果输入Transformer编码器;[0132] 第一编码模块2,用于将第一输出结果映射为预设向量,进而通过多头注意力机制进行预设处理,得到第二输出结果;[0133] 第二编码模块3,用于将第二输出结果进行第二预设操作,进而将Transformer编码器的输入及输出结果,输入到双向长短期记忆网络编码器进行编码,得到编码结果;[0134] 联合训练模块4,用于提取所述编码结果中最后时刻的隐单元输出,并将其输入第一解码器进行意图识别任务训练,同时提取所述编码结果中所有时刻的隐单元输出,并将其输入第二解码器进行槽值填充任务训练;其中,第一解码器、第二解码器均使用负对数似然损失函数作为联合训练的损失函数。[0135] 在一些实施例中,本发明还提供一种计算机介质,其特征在于,所述计算机介质上存储有计算机程序,所述计算机程序被处理器执行实现所述的意图识别与槽值填充联合预测方法。[0136] 在一些实施例中,本发明还提供一种计算机,包括所述的一种计算机介质。[0137] 在本说明书的描述中,参考术语“一个实施例”、“一些实施例”、“示例”、“具体示例”、或“一些示例”等的描述意指结合该实施例或示例描述的具体特征、结构、材料或者特点包含于本发明的至少一个实施例或示例中。在本说明书中,对上述术语的示意性表述不必须针对的是相同的实施例或示例。而且,描述的具体特征、结构、材料或者特点可以在任一个或多个实施例或示例中以合适的方式结合。此外,在不相互矛盾的情况下,本领域的技术人员可以将本说明书中描述的不同实施例或示例以及不同实施例或示例的特征进行结合和组合。[0138] 尽管上面已经示出和描述了本发明的实施例,可以理解的是,上述实施例是示例性的,不能理解为对本发明的限制,本领域的普通技术人员在本发明的范围内可以对上述实施例进行变化、修改、替换和变型。

专利地区:内蒙古

专利申请日期:2023-09-12

专利公开日期:2024-07-23

专利公告号:CN117217237B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载