产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:基于语言特征表示学习的中老泰多语言神经机器翻译方法及装置
专利类型:发明专利
专利申请号:CN202411398061.8
专利申请(专利权)人:小语智能信息开云优惠体育网页版入口(云南)有限公司
权利人地址:云南省昆明市呈贡区开云优惠体育网页版入口信息产业创新孵化中心A座研发办公楼7楼704号
专利发明(设计)人:毛存礼,王振晗,张思琦,张勇丙,高盛祥
专利摘要:本发明涉及基于语言特征表示学习的中老泰多语言神经机器翻译方法及装置,属于自然语言处理技术领域。针对现有的多语言神经机器翻译方法应用在中老泰低资源翻译任务时由于训练语料稀缺导致语义编码欠佳的问题,本发明首先进行模型及数据预处理、基于语言特征表示学习的中老泰多语言神经机器翻译模型训练、基于语言特征表示学习的中老泰多语言神经机器翻译三个部分。根据这三个功能模块化制成基于语言特征表示学习的中老泰多语言神经机器翻译装置。本发明能有效提升中老泰多语言神经机器翻译性能。
主权利要求:
1.基于语言特征表示学习的中老泰多语言神经机器翻译方法,其特征在于:所述方法的具体步骤如下:Step1、数据及模型预处理:获取训练语料并使用获取的语料训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型;同时,获取该基础模型的子词编码表征,利用获取的子词编码表征并结合泰?老发音相似语言特征,构造同义子词聚类;
Step2、基于语言特征表示学习的中老泰多语言神经机器翻译模型训练:提出基于同义子词聚类的对比学习约束优化方法和基于语言特征子词的适配器优化方法,首先利用Step1准备的同义子词聚类构造对比学习正样例以进行对比学习约束优化,然后利用Step1准备的同义子词聚类筛选出语言特征子词以进行适配器优化;
Step3、进行中老泰多语言神经机器翻译:将训练的基于语言特征表示学习的中老泰多语言神经机器翻译模型部署为多语言机器翻译系统,实现泰语→中文和老挝语→中文的机器翻译;
所述Step1的具体步骤为:
Step1.1、基础数据构建:首先使用爬虫技术从OPUS和亚洲语言树库上获取了中泰和中老平行语料,并使用预训练大语言模型LaBSE的相似度计算方法进行语料初步筛。岷暇渥映ざ缺榷、发音比对方法,构建了中泰、中老双语句对数据集;并划分训练集、验证集和测试集;
Step1.2、基础模型构建及同义子词聚类:使用Step1.1构建的基础数据训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型,并提取该模型的子词表征,并结合泰?老发音相似语言特征,构造泰?老同义子词聚类;
所述Step1.2的具体步骤为:
Step1.2.1、冻结泰语、老挝语到中文的多语言神经机器翻译模型,通过模型编码层对源语言子词的编码表征进行采样,作为泰语和老挝语子词词元的表征分布,并计算泰语和老挝语子词间语义相似度,并依据临界相似度分数,初次筛选相关子词对;
此外,还设计了两种不同的筛选策略进行探索:
策略1:对每个泰语子词,筛选所有和它具有语义表征相关性的老挝语子词,老挝语子词的筛选做法同例:对每个老挝语子词,筛选所有和它具有语义表征相关性的泰语子词,即只找该子词和相似语言间的相似子词;
策略2:对任意泰语子词或老挝语子词,和共享词表中的所有子词表征进行匹配,即和整个共享语义空间中的子词表征进行匹配;
对于泰语/老挝语子词,通过以上策略1或策略2的方式,找寻每个子词的相关子词;
Step1.2.2、在初筛后的相关子词对基础上,引入发音相似性进行约束,即对于子词 和它的语义表征相关子词 ,采用音标转写工具进行国际音标转写,得到这些子词的发音 和 ,然后采用 相似度计算发音相似度:;
结合发音相似度后的泰?老子词相似度分数计算如下:
;
采用 )作为临界相似度分数,当
时,则去除 的语义表征相关子词 进行进一步筛。绻 的数量仍超过9个,保留和 相似度分数最高的9个 作为和子词 相关的同义子词,和 共同构成同义子词聚类 ,通过以上方式,共构建出同义子词聚类;
所述Step2的具体步骤为:
Step2.1、基于同义子词聚类的对比学习约束优化:在Step1训练的多语言翻译模型的基础上引入对比学习方法,使用同义子词聚类构造正例并使用同句子采样的方式构造负例,通过对比学习拉近泰语和老挝语编码表示的一致性;
Step2.2、基于语言特征子词的适配器优化:冻结Step1训练的多语言翻译模型的主干网络,为模型添加语言特化适配器,即在不影响原有知识共享网络的条件下使用语言特征子词训练语言特化适配器,其中,语言特征子词是通过同义子词聚类筛选出的;
所述Step2.1的具体步骤为:
Step2.1.1、引入对比学习模块,使同义子词具备接近的表征,定义输入源语言句子,目标语言句子 ,则机器翻译训练损失为:,
为多语言神经机器翻译损失函数,是训练数据集,是模型参数;
Step2.1.2、对源语言句子 中的待翻译词 ,计算和 相关的同义子词聚类的平均表征,作为同义子词聚类 的聚类中心 :;
表 的向量表征, 代表按位平均,通过对比学习实现泰语和老挝语表征的拉近,构造的对比学习正例对为:;
定义 为 的语义相似度,通过 衡量对比学习的正例表征距离,则对比学习的正例损失 为:;
Step2.1.3、引入对比学习负样例,采用同句子负采样的方式构造负例对,即对于源语言句子中的词 ,定义对比学习负例对为:;
定义 作为词 和 的语义相似度,通过 衡量对比学习的负例表征距离,则对比学习的负例损失 为:;
Step2.1.4、引入词随机负采样策略,即对输入 ,并不对全部的 个子词计算对比学习正负例损失,而是通过词随机负采样的方式按一定比例随机选取子词进行对比学习正负样例计算和反向传播更新,采用的比例为ratio=0.2,定义词随机负采样为:;
表示根据从输入的词集合x中按照设定比例ratio随机抽取部分词作为负样本; 公式含义是按照给定的比例ratio随机选择输入词集合x中的部分词作为负样本集合 ;
Step2.1.5、利用Step2.1.4得到的负采样样本迭代执行步骤Step2.1.2?Step2.1.3分别得到对比学习约束优化损失 、 ;
Step2.1.6、对模型编码端进行表示学习的对比学习约束优化损失 、 ,总体损失函数 如下:;
其中, 为中老泰多语言神经机器翻译模型机器翻译训练损失;
所述Step2.2包括:
Step2.2.1、利用语言特征子词训练语言特化适配器时,添加适配器门控模块,用于有效的利用同义子词聚类筛选出语言特征子词;
适配器门控模块的输入是通过主干网络embedding层将源语言句子进行编码的句子词嵌入向量 ,输出为掩蔽掉聚类字典中的词的句子词嵌入向量,即具有语言特有信息的编码词嵌入向量;
聚类字典CLUS_DICT为同义子词聚类,存有同义子词聚类的根词和根词对应词嵌入向量的索引;将句子词嵌入向量输入适配器门控模块,通过CLUS_DICT对词嵌入向量进行匹配,生成对语种强关联词进行掩蔽操作的矩阵,并利用矩阵掩蔽掉句子词嵌入向量中的语种关联词,筛选出具有语言特有信息的编码词嵌入向量;
上述将源语言句子的词嵌入向量输入适配器门控模块,就得到具有语言特有信息的编码词嵌入向量 :;
此外,适配器门控模块中还包含着一个语种判断器模块LangGate,多个结构一样的语言特化适配器彼此相连,用于控制训练中激活的适配器,根据不同的输入语种选择不同的语言特化适配器。
2.根据权利要求1所述的基于语言特征表示学习的中老泰多语言神经机器翻译方法,其特征在于:所述Step2.2包括:Step2.2.2、设计语言特化适配器,用于在冻结中老泰多语言神经机器翻译模型主干网络后学习语言特征子词语义信息;
语言特化适配器结构分为特征降维层、特征学习网络和特征维度还原层;
语言特化适配器的输入1来自于主干网络编码端 层的输出向量 ,其保留了 源语 言 通用 语 义信 息,将 输入 1输 入 一个 前馈 神经 网 络降 维 层网络进行降维,得到特征学习网络部分的输入 ;语言特化适配器的输入2来自于经过适配器门控模块掩蔽的编码词嵌入向量t,将其输入前馈网络层FFN进行降维,得到特征学习网络部分的输入 和 ,该阶段的输出为:;
;
特征学习网络采用交互注意力框架,对输入的 ,通过交互注意力机制和残差连接,经过非线性激活函数,得到往通用语义向量中融入语言特征向量的特征隐向量 ,该阶段的输出为:;
其中 是非线性激活函数, 是交互注意力, 是残差连接;
然后将特征隐向量 送入前馈神经网络升维层 网络进行特征维度还原,得到语言特化适配器的输出 :
;
最后将语言特化适配器的输出 和主干网络编码器 层的输出 相加,得到新的编码端输出向量 :
;
将得到的 送入主干网络解码器,进行目标语言生成解码,主干网络解码器即指多语言神经机器翻译模型。
3.根据权利要求1所述的基于语言特征表示学习的中老泰多语言神经机器翻译方法,其特征在于:所述Step2.2包括:Step2.2.3、基于语言特化适配器的模型微调:语言特化适配器微调过程采用激活语言特化适配器并冻结主干网络结构,依次输入泰语?中文和老挝语?中文平行语料进行二次训练的方式进行;语言特化适配器训练过程抽象为利用一对一语言对训练单语适配器的过程;
二次训练语料的输入虽然和原始语料一致,但输入到语言特化适配器中的向量除了原始语料经过主干网络的向量,还有后的句子词嵌入向量。
4.根据权利要求1所述的基于语言特征表示学习的中老泰多语言神经机器翻译方法,其特征在于:所述Step3的具体步骤为:Step3.1、输入数据处理:将输入的源语言句子进行分词操作,然后将分好词的句子转为子词索引,并进行二值化处理转为多语言神经机器翻译模型能够识别的数据类型,得到待进入多语言神经机器翻译模型的数据;
Step3.2、搭建中老泰多语言神经机器翻译服务:搭建中老泰多语言神经机器翻译服务端,将训练出的“.bin”格式模型部署到服务器端上;搭建Web端中老泰多语言神经机器翻译系统,通过web为多个用户提供服务;
Step3.3、进行中老泰多语言神经机器翻译:将泰语或老挝语源语言文本输入Web端,选择翻译方向,包括泰语翻译成中文或者老挝语翻译成中文,然后传输到服务端,并通过API接口形式去调用中老泰多语言神经机器翻译模型;具体地,将源语言句子进行分词、转索引和二值化操作,然后将处理好的数据送入中老泰多语言神经机器翻译模型中,得到翻译后的结果,并对翻译后的逐词结果拼接为目标句,将其送传输回Web端,得到目标语言的翻译结果。
5.基于语言特征表示学习的中老泰多语言神经机器翻译装置,其特征在于:包括用于执行如权利要求1?4任一项权利要求所述方法的模块。 说明书 : 基于语言特征表示学习的中老泰多语言神经机器翻译方法及
装置技术领域[0001] 本发明涉及基于语言特征表示学习的中老泰多语言神经机器翻译方法及装置,属于自然语言处理技术领域。背景技术[0002] 多语言神经机器翻译通过一个模型实现多个翻译方向的翻译,将不同语言的知识通过共享语义空间的方式进行共享,能够有效弥补语料稀缺导致的低资源翻译效果不佳问题,且这种知识共享能在相似语言间达到更好的效果。但多语言神经机器翻译方法直接应用在中老泰神经机器翻译上的性能并不理想,泰语、老挝语虽同属汉藏语系壮侗语族的壮傣语支,具有一定的相似性,但泰语、老挝语在字符编码、词语结构上均存在较大差异,这为普遍基于子词Token向量化进行训练的神经机器翻译模型在词汇信息和文法知识上的共享带来了阻碍。因此,为了有效利用多语言神经机器翻译的知识共享能力,需要进一步探索语言间的相似知识,研究新的利用语言相似性实现知识共享的方法,以提升中老泰低资源神经翻译性能。[0003] 此外,引入多语言神经机器翻译联合训练虽然可以提升泰?中和老?中翻译性能,但其并不是简单的有益无害的方法。相比于双语机器翻译,多语言机器翻译联合训练在共享语言知识的同时会引入语种间干扰,这种存在于网络层面和参数层面的干扰同样对翻译性能造成影响。因此,需要研究缓解语言间参数干扰的机器翻译方法,以提升中老泰低资源神经翻译性能。发明内容[0004] 本发明提供了基于语言特征表示学习的中老泰多语言神经机器翻译方法及装置,以解决现有的多语言神经机器翻译方法在低资源多语言神经机器翻译任务上表征能力不佳的问题,本发明提升了中老泰低资源神经翻译性能。[0005] 本发明的技术方案是:第一方面,本发明提供基于语言特征表示学习的中老泰多语言神经机器翻译方法,所述方法的具体步骤如下:[0006] Step1、数据及模型预处理:获取训练语料并使用获取的语料训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型;同时,获取该基础模型的子词编码表征,利用获取的子词编码表征并结合泰?老发音相似语言特征,构造同义子词聚类;[0007] Step2、基于语言特征表示学习的中老泰多语言神经机器翻译模型训练:提出基于同义子词聚类的对比学习约束优化方法和基于语言特征子词的适配器优化方法,首先利用Step1准备的同义子词聚类构造对比学习正样例以进行对比学习约束优化,然后利用Step1准备的同义子词聚类筛选出语言特征子词以进行适配器优化;[0008] Step3、进行中老泰多语言神经机器翻译:将训练的基于语言特征表示学习的中老泰多语言神经机器翻译模型部署为多语言机器翻译系统,实现泰语→中文和老挝语→中文的机器翻译。[0009] 作为本发明进一步方案,所述Step1的具体步骤为:[0010] Step1.1、基础数据构建:首先使用爬虫技术从OPUS和亚洲语言树库上获取了中泰和中老平行语料,并使用预训练大语言模型LaBSE的相似度计算方法进行语料初步筛。岷暇渥映ざ缺榷、发音比对方法,构建了中泰、中老双语句对数据集;并划分训练集、验证集和测试集;[0011] Step1.2、基础模型构建及同义子词聚类:使用Step1.1构建的基础数据训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型,并提取该模型的子词表征,并结合泰?老发音相似语言特征,构造泰?老同义子词聚类。[0012] 作为本发明进一步方案,所述Step1.2的具体步骤为:[0013] Step1.2.1、冻结泰语、老挝语到中文的多语言神经机器翻译模型,通过模型编码层对源语言子词的编码表征进行采样,作为泰语和老挝语子词词元的表征分布,并计算泰语和老挝语子词间语义相似度,并依据临界相似度分数,初次筛选相关子词对;[0014] 此外,还设计了两种不同的筛选策略进行探索:[0015] 策略1:对每个泰语子词,筛选所有和它具有语义表征相关性的老挝语子词,老挝语子词的筛选做法同例:对每个老挝语子词,筛选所有和它具有语义表征相关性的泰语子词,即只找该子词和相似语言间的相似子词;[0016] 策略2:对任意泰语子词或老挝语子词,和共享词表中的所有子词表征进行匹配,即和整个共享语义空间中的子词表征进行匹配;[0017] 对于泰语/老挝语子词,通过以上策略1或策略2的方式,找寻每个子词的相关子词;[0018] Step1.2.2、在初筛后的相关子词对基础上,引入发音相似性进行约束,即对于子词 和它的语义表征相关子词 ,采用音标转写工具进行国际音标转写,得到这些子词的发音 和 ,然后采用 相似度计算发音相似度:[0019] ;[0020] 结合发音相似度后的泰?老子词相似度分数计算如下:[0021] ;[0022] 采用 )作为临界相似度分数,当时,则去除 的语义表征相关子词 进行进一步筛。绻 的数量仍超过9个,保留和 相似度分数最高的9个 作为和子词 相关的同义子词,和 共同构成同义子词聚类 ,通过以上方式,共构建出同义子词聚类。[0023] 作为本发明进一步方案,所述Step2的具体步骤为:[0024] Step2.1、基于同义子词聚类的对比学习约束优化:在Step1训练的多语言翻译模型的基础上引入对比学习方法,使用同义子词聚类构造正例并使用同句子采样的方式构造负例,通过对比学习拉近泰语和老挝语编码表示的一致性;[0025] Step2.2、基于语言特征子词的适配器优化:冻结Step1训练的多语言翻译模型的主干网络,为模型添加语言特化适配器,即在不影响原有知识共享网络的条件下使用语言特征子词训练语言特化适配器,其中,语言特征子词是通过同义子词聚类筛选出的。[0026] 作为本发明进一步方案,所述Step2.1的具体步骤为:[0027] Step2.1.1、引入对比学习模块,使同义子词具备接近的表征,如图2所示。定义输入源语言句子 ,目标语言句子 ,则机器翻译训练损失为:[0028] ,[0029] 为多语言神经机器翻译损失函数,是训练数据集,是模型参数;[0030] Step2.1.2、对源语言句子 中的待翻译词 ,计算和 相关的同义子词聚类的平均表征,作为同义子词聚类 的聚类中心 :[0031] ;[0032] 表 的向量表征, 代表按位平均,通过对比学习实现泰语和老挝语表征的拉近,构造的对比学习正例对为:[0033] ;[0034] 定义 为 的语义相似度,通过 衡量对比学习的正例表征距离,则对比学习的正例损失 为:[0035] ;[0036] Step2.1.3、引入对比学习负样例,采用同句子负采样的方式构造负例对,即对于源语言句子中的词 ,定义对比学习负例对为:[0037] ;[0038] 定义 作为词 和 的语义相似度,通过 衡量对比学习的负例表征距离,则对比学习的负例损失 为:[0039] ;[0040] Step2.1.4、引入词随机负采样策略,即对输入 ,并不对全部的个子词计算对比学习正负例损失,而是通过词随机负采样的方式按一定比例随机选取子词进行对比学习正负样例计算和反向传播更新,采用的比例为ratio=0.2,定义词随机负采样为:[0041] ;[0042] 表示根据从输入的词集合x中按照设定比例ratio随机抽取部分词作为负样本; 公式含义是按照给定的比例ratio随机选择输入词集合x中的部分词作为负样本集合 ;[0043] Step2.1.5、利用Step2.1.4得到的负采样样本迭代执行步骤Step2.1.2?Step2.1.3分别得到对比学习约束优化损失 、 ;[0044] Step2.1.6、对模型编码端进行表示学习的对比学习约束优化损失 、,总体损失函数 如下:[0045] ;[0046] 其中, 为中老泰多语言神经机器翻译模型机器翻译训练损失,[0047] 作为本发明进一步方案,所述Step2.2包括:[0048] Step2.2.1、利用语言特征子词训练语言特化适配器时,添加适配器门控模块,用于有效的利用同义子词聚类筛选出语言特征子词;[0049] 适配器门控模块的输入是通过主干网络embedding层将源语言句子进行编码的句子词嵌入向量 ,输出为掩蔽掉聚类字典中的词的句子词嵌入向量,即具有语言特有信息的编码词嵌入向量;[0050] 聚类字典CLUS_DICT为同义子词聚类,存有同义子词聚类的根词和根词对应词嵌入向量的索引;将句子词嵌入向量输入适配器门控模块,通过CLUS_DICT对词嵌入向量进行匹配,生成对语种强关联词进行掩蔽操作的矩阵,并利用矩阵掩蔽掉句子词嵌入向量中的语种关联词,筛选出具有语言特有信息的编码词嵌入向量;[0051] 上述将源语言句子的词嵌入向量输入适配器门控模块,就得到具有语言特有信息的编码词嵌入向量 :[0052] .[0053] 此外,适配器门控模块中还包含着一个语种判断器模块LangGate,多个结构一样的语言特化适配器彼此相连,用于控制训练中激活的适配器,根据不同的输入语种选择不同的语言特化适配器。[0054] 作为本发明进一步方案,所述Step2.2包括:[0055] Step2.2.2、设计语言特化适配器,用于在冻结中老泰多语言神经机器翻译模型主干网络后学习语言特征子词语义信息;[0056] 语言特化适配器结构分为特征降维层、特征学习网络和特征维度还原层;[0057] 语言特化适配器的输入1来自于主干网络编码端 层的输出向量 ,其保留了源语言通用语义信息,将输入1输入一个前馈神经网络降维层网络进行降维,得到特征学习网络部分的输入 ;语言特化适配器的输入2来自于经过适配器门控模块掩蔽的编码词嵌入向量t,将其输入前馈网络层FFN进行降维,得到特征学习网络部分的输入 和 ,该阶段的输出为:[0058] ;[0059] ;[0060] 特征学习网络采用交互注意力框架,对输入的 ,通过交互注意力机制和残差连接,经过非线性激活函数,得到往通用语义向量中融入语言特征向量的特征隐向量 ,该阶段的输出为:[0061] ;[0062] 其中 是非线性激活函数, 是交互注意力, 是残差连接;[0063] 然后将特征隐向量 送入前馈神经网络升维层 网络进行特征维度还原,得到语言特化适配器的输出 :[0064] ;[0065] 最后将语言特化适配器的输出 和主干网络编码器 层的输出相加,得到新的编码端输出向量 :[0066] .[0067] 将得到的 送入主干网络解码器,进行目标语言生成解码,主干网络解码器即指多语言神经机器翻译模型。[0068] 作为本发明进一步方案,所述Step2.2包括:[0069] Step2.2.3、基于语言特化适配器的模型微调:[0070] 语言特化适配器微调过程采用激活语言特化适配器并冻结主干网络结构,依次输入泰语?中文和老挝语?中文平行语料进行二次训练的方式进行;语言特化适配器训练过程抽象为利用一对一语言对训练单语适配器的过程;[0071] 二次训练语料的输入虽然和原始语料一致,但输入到语言特化适配器中的向量除了原始语料经过主干网络的向量,还有后的句子词嵌入向量。[0072] 作为本发明进一步方案,所述Step3的具体步骤为:[0073] Step3.1、输入数据处理:将输入的源语言句子进行分词操作,然后将分好词的句子转为子词索引,并进行二值化处理转为多语言神经机器翻译模型能够识别的数据类型,得到待进入多语言神经机器翻译模型的数据;[0074] Step3.2、搭建中老泰多语言神经机器翻译服务:搭建中老泰多语言神经机器翻译服务端,将训练出的“.bin”格式模型部署到服务器端上;搭建Web端中老泰多语言神经机器翻译系统,通过web为多个用户提供服务;[0075] Step3.3、进行中老泰多语言神经机器翻译:将泰语或老挝语源语言文本输入Web端,选择翻译方向,包括泰语翻译成中文或者老挝语翻译成中文,然后传输到服务端,并通过API接口形式去调用中老泰多语言神经机器翻译模型;具体地,将源语言句子进行分词、转索引和二值化操作,然后将处理好的数据送入中老泰多语言神经机器翻译模型中,得到翻译后的结果,并对翻译后的逐词结果拼接为目标句,将其送传输回Web端,得到目标语言的翻译结果。[0076] 第二方面,本发明提供基于语言特征表示学习的中老泰多语言神经机器翻译装置,包括用于执行上述第一方面所述方法的模块。[0077] 本发明的有益效果是:[0078] 1、本发明提出了一种构建语言特征的同义子词聚类方法,通过该方法将源语言子词划分为相似子词簇和非相似语言特征子词,使得能够显式的在多语言神经机器翻译模型中应用语言特征知识。[0079] 2、本发明有效利用了泰语和老挝语的语言相似特征,实现对中老泰多语言神经机器翻译模型的优化。通过对比学习方法有效增强泰语和老挝语的编码表征一致性,增强编码端源语言的知识共享。[0080] 3、本发明有效利用了泰语和老挝语语言特征子词,实现对中老泰多语言神经机器翻译模型的优化,通过设计并引入适配器门控模块和语言特化适配器模块,使模型能够独立学习语言特征知识,有效缓解了不同语言间的参数干扰问题。[0081] 4、本发明解决了现有的多语言神经机器翻译方法在低资源多语言神经机器翻译任务上表征能力不佳的问题,提升了中老泰低资源神经翻译性能。附图说明[0082] 图1为本发明中的同义子词聚类算法;[0083] 图2为本发明中基于对比学习的子词聚类约束优化模型;[0084] 图3为本发明中基于语言特征子词的适配器优化的适配器门控模块;[0085] 图4为本发明中基于语言特征子词的适配器优化的语言特化适配器模块;[0086] 图5为本发明中基于语言特征表示学习的中老泰多语言神经机器翻译整体流程图。具体实施方式[0087] 实施例1:如图1?图5所示,基于语言特征表示学习的中老泰多语言神经机器翻译方法,所述方法的具体步骤如下:[0088] Step1、数据及模型预处理:获取训练语料并使用获取的语料训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型,作为后续改进的基础模型;同时,获取该基础模型的子词编码表征,利用获取的子词编码表征并结合泰?老发音相似语言特征,构造同义子词聚类;[0089] Step1.1、基础数据构建:泰语和老挝语都属于低资源语言,首先使用爬虫技术从OPUS和亚洲语言树库上获取了中泰和中老平行语料,并使用预训练大语言模型LaBSE的相似度计算方法进行语料初步筛。岷暇渥映ざ缺榷、发音比对等方法,构建了中泰、中老双语句对数据集;由于该数据集没有划分训练集、验证集和测试集,本发明选取中泰和中老数据各2000条作为验证集,各取2000条作为测试集,剩余数据作为训练集;[0090] Step1.2、基础模型构建及同义子词聚类:使用Step1.1构建的基础数据训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型,并提取该模型的子词表征,并结合泰?老发音相似语言特征,构造泰?老同义子词聚类。[0091] 作为本发明进一步方案,所述Step1.2的具体步骤为:[0092] Step1.2.1、冻结泰语、老挝语到中文的多语言神经机器翻译模型,通过模型编码层对源语言子词的编码表征进行采样,共采样出4079个泰语子词编码表征和3100个老挝语子词编码表征,作为泰语和老挝语子词词元的表征分布,并计算泰语和老挝语子词间语义相似度,并依据临界相似度分数,初次筛选相关子词对;[0093] 以泰语为例,定义泰语子词表征 ,老挝语子词表征 ,计算得到的相似分数如下:[0094] ,[0095] 为余弦相似度, 的取值范围为[?1,1]。[0096] 采用 =0.8作为临界相似度分数,即当 时,认为 具有语义表征相关性,通过该方式初次筛选相关子词对;[0097] 此外,还设计了两种不同的筛选策略进行探索:[0098] 策略1:对每个泰语子词,筛选所有和它具有语义表征相关性的老挝语子词,老挝语子词的筛选做法同例:对每个老挝语子词,筛选所有和它具有语义表征相关性的泰语子词,即只找该子词和相似语言间的相似子词;[0099] 策略2:对任意泰语子词或老挝语子词,和共享词表中的所有子词表征进行匹配,即和整个共享语义空间中的子词表征进行匹配;[0100] 对于以上总计7179个泰语/老挝语子词,通过以上策略1或策略2的方式,找寻每个子词的相关子词;[0101] Step1.2.2、由于泰语和老挝语具有很高的发音相似性,考虑利用其读音相似的语言特征进行进一步筛选。在初筛后的相关子词对基础上,引入发音相似性进行约束,即对于子词 和它的语义表征相关子词 ,采用音标转写工具进行国际音标转写,得到这些子词的发音 和 ,然后采用 相似度计算发音相似度:[0102] ;[0103] Jaccard相似度常被用于衡量两个字符串的相似程度,其中 ,为两个输入的不同字符序列(或称字符串)。此处采用Jaccard相似度来衡量子词 和 的发音 和 的相似程度。[0104] 为了有效利用发音相似性,结合发音相似度后的泰?老子词相似度分数计算如下:[0105] ;[0106] 采用 )作为临界相似度分数,当时,则去除 的语义表征相关子词 进行进一步筛。绻 的数量仍超过9个,保留和 相似度分数最高的9个 作为和子词 相关的同义子词,和 共同构成同义子词聚类 ,通过以上方式,共构建出同义子词聚类。图1为本发明中的同义子词聚类算法;[0107] Step2、基于语言特征表示学习的中老泰多语言神经机器翻译模型训练:针对现有的中老泰多语言神经机器翻译模型方法面临的知识共享不佳和参数干扰问题,训练基于语言特征表示学习的中老泰多语言神经机器翻译模型;本发明提出提出基于同义子词聚类的对比学习约束优化方法和基于语言特征子词的适配器优化方法,首先利用Step1准备的同义子词聚类构造对比学习正样例以进行对比学习约束优化,然后利用Step1准备的同义子词聚类筛选出语言特征子词以进行适配器优化;[0108] 作为本发明进一步方案,所述Step2的具体步骤为:[0109] Step2.1、基于同义子词聚类的对比学习约束优化:在Step1训练的多语言翻译模型的基础上引入对比学习方法,使用同义子词聚类构造正例并使用同句子采样的方式构造负例,通过对比学习拉近泰语和老挝语编码表示的一致性;[0110] Step2.2、基于语言特征子词的适配器优化:冻结Step1训练的多语言翻译模型的主干网络,为模型添加语言特化适配器,即在不影响原有知识共享网络的条件下使用语言特征子词训练语言特化适配器,其中,语言特征子词是通过同义子词聚类筛选出的。[0111] 作为本发明进一步方案,所述Step2.1的具体步骤为:[0112] Step2.1.1、为了使泰语、老挝语?中文多语言神经机器翻译模型中的泰语和老挝语表征更具有一致性,本发明提出基于同义子词聚类的对比学习约束优化方法,引入对比学习模块,使同义子词具备接近的表征,定义输入源语言句子 ,目标语言句子 ,则机器翻译训练损失为:[0113] ,[0114] 为多语言神经机器翻译损失函数,是训练数据集,是模型参数;[0115] Step2.1.2、对源语言句子 中的待翻译词 ,计算和 相关的同义子词聚类的平均表征,作为同义子词聚类 的聚类中心 :[0116] ;[0117] 表 的向量表征, 代表按位平均,通过对比学习实现泰语和老挝语表征的拉近,构造的对比学习正例对为:[0118] ;[0119] 定义 为 的语义相似度,通过 衡量对比学习的正例表征距离,则对比学习的正例损失 为:[0120] ;[0121] Step2.1.3、为了保证对比学习在进行正例表征拉近的同时不破坏表征分布,引入对比学习负样例,采用同句子负采样的方式构造负例对,即对于源语言句子中的词 ,定义对比学习负例对为:[0122] ;[0123] 定义 作为词 和 的语义相似度,通过 衡量对比学习的负例表征距离,则对比学习的负例损失 为:[0124] ;[0125] Step2.1.4、考虑到对比学习损失计算都在子词级别,计算开销较大,为了减小计算开销,受CBOW启发,引入词随机负采样策略,即对输入 ,并不对全部的个子词计算对比学习正负例损失,而是通过词随机负采样的方式按一定比例随机选取子词进行对比学习正负样例计算和反向传播更新,采用的比例为ratio=0.2,定义词随机负采样为:[0126] ;[0127] 表示根据从输入的词集合x中按照设定比例ratio随机抽取部分词作为负样本; 公式含义是按照给定的比例ratio随机选择输入词集合x中的部分词作为负样本集合 ;[0128] Step2.1.5、利用Step2.1.4得到的负采样样本迭代执行步骤Step2.1.2?Step2.1.3分别得到对比学习约束优化损失 、 ;[0129] Step2.1.6、对模型编码端进行表示学习的对比学习约束优化损失 、,总体损失函数 如下:[0130] ;[0131] 其中, 为中老泰多语言神经机器翻译模型机器翻译训练损失,[0132] 作为本发明进一步方案,所述Step2.2包括:[0133] Step2.2.1、利用语言特征子词训练语言特化适配器时,添加适配器门控模块,用于有效的利用同义子词聚类筛选出语言特征子词;[0134] 适配器门控模块的输入是通过主干网络embedding层将源语言句子进行编码的句子词嵌入向量 ,输出为掩蔽掉聚类字典中的词的句子词嵌入向量,即具有语言特有信息的编码词嵌入向量;[0135] 聚类字典CLUS_DICT为同义子词聚类,存有同义子词聚类的根词和根词对应词嵌入向量的索引;将句子词嵌入向量输入适配器门控模块,通过CLUS_DICT对词嵌入向量进行匹配,生成对语种强关联词进行掩蔽操作的矩阵,并利用矩阵掩蔽掉句子词嵌入向量中的语种关联词,筛选出具有语言特有信息的编码词嵌入向量;[0136] 上述将源语言句子的词嵌入向量输入适配器门控模块,就得到具有语言特有信息的编码词嵌入向量 :[0137] .[0138] 此外,适配器门控模块中还包含着一个语种判断器模块LangGate,多个结构一样的语言特化适配器彼此相连,用于控制训练中激活的适配器,根据不同的输入语种选择不同的语言特化适配器。[0139] 作为本发明进一步方案,所述Step2.2包括:[0140] Step2.2.2、设计语言特化适配器,用于在冻结中老泰多语言神经机器翻译模型主干网络后学习语言特征子词语义信息;[0141] 语言特化适配器结构分为特征降维层、特征学习网络和特征维度还原层;[0142] 语言特化适配器的输入1来自于主干网络编码端 层的输出向量 ,其保留了源语言通用语义信息,将输入1输入一个前馈神经网络降维层网络进行降维,得到特征学习网络部分的输入 ;语言特化适配器的输入2来自于经过适配器门控模块掩蔽的编码词嵌入向量t,将其输入前馈网络层FFN进行降维,得到特征学习网络部分的输入 和 ,该阶段的输出为:[0143] ;[0144] ;[0145] 特征学习网络采用交互注意力框架,对输入的 ,通过交互注意力机制和残差连接,经过非线性激活函数,得到往通用语义向量中融入语言特征向量的特征隐向量 ,该阶段的输出为:[0146] ;[0147] 其中 是非线性激活函数, 是交互注意力, 是残差连接;[0148] 然后将特征隐向量 送入前馈神经网络升维层 网络进行特征维度还原,得到语言特化适配器的输出 :[0149] ;[0150] 最后将语言特化适配器的输出 和主干网络编码器 层的输出相加,得到新的编码端输出向量 :[0151] .[0152] 将得到的 送入主干网络解码器,进行目标语言生成解码,主干网络解码器即指多语言神经机器翻译模型。[0153] 作为本发明进一步方案,所述Step2.2包括:[0154] Step2.2.3、基于语言特化适配器的模型微调:[0155] 语言特化适配器微调过程采用激活语言特化适配器并冻结主干网络结构,依次输入泰语?中文和老挝语?中文平行语料进行二次训练的方式进行;由于门控机制的存在,语言特化适配器训练过程抽象为利用一对一语言对训练单语适配器的过程,通过该过程学习单语语言特征,增强多语言机器翻译模型的语言独立性。[0156] 二次训练语料的输入虽然和原始语料一致,但输入到语言特化适配器中的向量除了原始语料经过主干网络的向量,还有后的句子词嵌入向量,相当于实质上是利用机制筛选出的语言特有信息对模型中添加的adapter进行二次训练。[0157] Step3、进行中老泰多语言神经机器翻译:将训练的基于语言特征表示学习的中老泰多语言神经机器翻译模型部署为多语言机器翻译系统,实现泰语→中文和老挝语→中文的机器翻译。[0158] 作为本发明进一步方案,所述Step3的具体步骤为:[0159] Step3.1、输入数据处理:将输入的源语言句子进行分词操作,然后将分好词的句子转为子词索引,并进行二值化处理转为多语言神经机器翻译模型能够识别的数据类型,得到待进入多语言神经机器翻译模型的数据;[0160] Step3.2、搭建中老泰多语言神经机器翻译服务:搭建中老泰多语言神经机器翻译服务端,将训练出的“.bin”格式模型部署到服务器端上;搭建Web端中老泰多语言神经机器翻译系统,通过web为多个用户提供服务;[0161] Step3.3、进行中老泰多语言神经机器翻译:将泰语或老挝语源语言文本输入Web端,选择翻译方向,包括泰语翻译成中文或者老挝语翻译成中文,然后传输到服务端,并通过API接口形式去调用中老泰多语言神经机器翻译模型;具体地,将源语言句子进行分词、转索引和二值化操作,然后将处理好的数据送入中老泰多语言神经机器翻译模型中,得到翻译后的结果,并对翻译后的逐词结果拼接为目标句,将其送传输回Web端,得到目标语言的翻译结果。[0162] 根据本发明的构思,本发明还提供了基于语言特征表示学习的中老泰多语言神经机器翻译装置,该装置包括如下集成模块:[0163] 数据及模型预处理模块:用于获取训练语料并使用获取的语料训练一个翻译方向为泰语→中文和老挝语→中文的多语言神经机器翻译模型;同时,获取该基础模型的子词编码表征,利用获取的子词编码表征并结合泰?老发音相似语言特征,构造同义子词聚类;[0164] 基于语言特征表示学习的中老泰多语言神经机器翻译模型训练模块:用于提出基于同义子词聚类的对比学习约束优化方法和基于语言特征子词的适配器优化方法,首先利用Step1准备的同义子词聚类构造对比学习正样例以进行对比学习约束优化,然后利用Step1准备的同义子词聚类筛选出语言特征子词以进行适配器优化;[0165] 中老泰多语言神经机器翻译模块:用于将训练的基于语言特征表示学习的中老泰多语言神经机器翻译模型部署为多语言机器翻译系统,实现泰语→中文和老挝语→中文的机器翻译。[0166] 为了验证本发明提出的基于语言相似性增强的中老泰多语言平行句对抽取方法的效果,设计了基于同义子词聚类的对比学习约束优化对比实验和基于语言特征子词的适配器优化对比实验。[0167] 基于同义子词聚类的对比学习约束优化对比实验如表1所示;[0168] (1)Transformer:一对一场景下的老?中和泰中双语神经机器翻译,采用标准Transformer结构的双语神经机器翻译模型。[0169] (2)Multi?source:编码端不进行共享的泰语、老挝语到中文的多对一神经机器翻译。[0170] (3)Multilingual:本文的多语言神经机器翻译基线模型,采用共享词表、共享词嵌入、共享编码器、共享解码器的Transformer框架多语言神经机器翻译。[0171] (4)+TS:Blackwood等人提出的为每个语言对加入语言相关的注意力机制的方法,在Multilingual方法的基础上为每个语言对加入语言相关注意力,将其在中老泰自构语料上进行复现。[0172] (5)+Adapter:谷歌提出的适配器方法,在Multilingual方法的基础上为每个语言添加特点的适配器层从头开始训练,将其在中老泰自构语料上进行复现。[0173] (6)mRASP2w/oAA:字节跳动用于训练大规模预训练语言模型mRASP2的句子级对比学习方法,以源语言?目标语言句子为正例对,以同批次的其他句子为负例对,将其在中老泰自构语料上进行复现。[0174] (7)Shen:Shen等人提出的融入音素特征的多语言神经机器翻译方法,通过融入外部发音信息的方式增强小语种多语言机器翻译。[0175] (8)NLLB?200:FacebookAI提出的支持200种语言翻译的大语言模型,选用nllb?200?distilled?600M进行验证。[0176] 表1对比学习约束优化方法对比实验[0177][0178] 如表所示,本发明提出方法在老挝语?中文和泰语?中文翻译方向上分别达到了20.14和20.09的F1值。[0179] 和双语机器翻译的Transformer方法进行比较,本发明方法在老→中和泰→中翻译方向上获得7.27和3.92显著BLEU值提升。而将共享词表、共享解码器的Multi?source方法、全参数共享的基线Multilingual方法和双语Transformer进行对照,可以发现多语言神经机器翻译能够通过知识共享有效提升低资源神经机器翻译性能。[0180] 和多语言神经机器翻译方法进行比较,相比于Multi?Source方法,方法在老→中和泰→中翻译方向上获得4.31和2.37的BLEU值提升,而相比于基线Multilingual方法,方法使老→中和泰→中翻译也获得了3.86和1.17的F1值提升,说明提出的方法能够有效增强泰语和老挝语的知识共享,提升泰语和老挝语在多语言统一编码空间中的表征一致性;相比于增加语言相关额外参数(注意力和适配器)的+TS和+Adapter方法,本文方法在老?中和泰?中翻译上也有明显提升,说明单纯增加模型参数对低资源翻译性能影响有限,增加模型参数并不能为中老泰多语言神经机器翻译模型带来足够的改进效果。[0181] 和同样是多语言神经机器翻译+对比学习的mRASP2w/oAA对比,发现简单地在低资源多语言场景下加入对比学习并不能取得有效效果,反而会引发模型的模型坍塌现象,导致模型失去翻译能力。对原文章实验条件和复现实验进行对比分析发现,原文章在包含1.97亿个句对的32个翻译方向的数据集上进行训练,并设置每个batch包含3000000个token,但复现代码受限于低资源语料规:图扑闵璞,每个batch只能设置16384个子词token,因此负例损失强度远低于原文章负例损失强度;此外,原文章在多个翻译方向上进行训练和对比学习优化,这使得模型能得到均匀的监督信号,具有更健壮的表征,而将其直接应用到表征较弱的低资源翻译任务上则由于对比学习的正例拉近能力过强而出现模型坍缩现象,由此也说明简单的将对比学习方法应用在小语种翻译上并不能取得好的效果。[0182] 和大语言模型NLLB相比,方法取得了较优的结果。说明针对特定任务利用语言特征进行表示学习的方法能够在低资源翻译任务上取得有价值的提升效果,也说明当前大语言模型性能在低资源翻译上仍不如有监督翻译模型。[0183] 和同样利用了外部信息的Shen提出的方法进行对比,方法在老?中和泰?中任务上分别获得了2.79和0.39的F1值提升,认为Shen提出的方法是通过引入发音外部知识实现隐式知识共享,而方法通过构造同义子词聚类和对比学习直接对模型的编码表征进行优化,能够更好的提升泰语和老挝语的表征一致性,达到更好的翻译性能。[0184] 基于语言特征子词的适配器优化方法对比实验如表2所示。[0185] (1)Transformer:一对一场景下的老?中和泰中双语神经机器翻译,采用标准Transformer结构的双语神经机器翻译模型。[0186] (2)对比学习优化模型:泰语、老挝语到中文的标准Transformer多对一多语言神经机器翻译模型,经过基于同义子词聚类的对比学习约束优化进行优化。[0187] (3)Fine?tune:微调方法,使用不同的语言对,进行双语全参微调,其中Fine?tunelo表示对老挝语?中文翻译任务进行微调,Fine?tuneth表示对泰语?中文翻译任务进行微调。[0188] (4)AdapterBase:谷歌提出的用于NMT任务的adapter方法,其adapter结构由特征缩放网络、非线性激活函数、特征还原网络组成。[0189] (5)Meta?adapter:Finn等人提出Meta?adapter,adapter结构和AdapterBase一致,其区别在于将元学习引入adpater,使用元学习算法进行adapter的初始化。[0190] (6)CIAT:字节跳动提出的缓解多语言干扰的adapter模块,其adapter结构和AdapterBase一致,将适配器通过并联方式加在Embeding层、Self?Attn层和Feedforward层。[0191] 表2基于语言特征子词的适配器优化方法对比实验[0192][0193] 从实验结果可以看出,提出的方法可以提升翻译语言的独立性,有效提升多语言机器翻译性能。相比于表1的实验结果,本发明方法在泰?中翻译方向上和老?中翻译方向上分别取得了0.70和0.61的BLEU值提升;相比于AdapterBase和CIAT直接加入串联或并联适配器模块进行训练的方法,方法通过语言特化适配器提取语言特征信息,并通过交叉注意力机制进行融合,利用融合后的语言特征信息进行adapter微调训练,能够更好的提升翻译语言独立性;相比于仅通过元学习进行初始化的Meta?adapter,本发明语言特化适配器方法对适配器模块的输入和结构进行改进,能够提取到更具有指导意义的语言特有信息,因此能够取得更好的效果;相比于双语全参微调,也取得了可比较的结果,值得注意的是,经过双语微调后的模型破坏了其多语言能力,只在其微调方向上取得好的效果,即经过全参微调后得到的模型只具有双语翻译性能。另外,将全参微调结果和一对一翻译结果进行对比可以发现,相比于直接使用单语数据进行训练,将经过基于同义子词聚类的对比学习约束优化方法训练后的多语言模型迁移到双语翻译任务上具有更好的效果,又在佐证了基于同义子词聚类的对比学习约束优化方法的有效性。[0194] 上面结合附图对本发明的具体实施方式作了详细说明,但是本发明并不限于上述实施方式,在本领域普通技术人员所具备的知识范围内,还可以在不脱离本发明宗旨的前提下作出各种变化。
专利地区:云南
专利申请日期:2024-10-09
专利公开日期:2024-11-29
专利公告号:CN118898260B