开云优惠体育网页版入口

开云优惠体育网页版入口:音频摘要数据增强方法、系统和电子设备及存储介质

更新时间:2026-09-01
音频摘要数据增强方法、系统和电子设备及存储介质 专利申请类型:发明专利;
地区:江苏-苏州;
源自:苏州高价值专利检索信息库;

专利名称:音频摘要数据增强方法、系统和电子设备及存储介质

专利类型:发明专利

专利申请号:CN202210475922.2

专利申请(专利权)人:思必驰开云优惠体育网页版入口股份有限公司
权利人地址:江苏省苏州市苏州工业园区新平街388号腾飞创新园14栋

专利发明(设计)人:俞凯,吴梦玥,徐薛楠

专利摘要:本发明实施例提供一种音频摘要数据增强方法、系统和电子设备及存储介质。该方法包括:利用已有的音频摘要数据,预训练音频文本检索系统,其中,音频文本检索系统的输入为音频和文本,输出音频和文本为音频摘要的相似度;将文本训练集和真实未标注音频输入至音频文本检索系统,通过相似度确定真实未标注音频对应的文本摘要,基于真实未标注音频以及对应的文本摘要,生成数据增强的音频摘要数据。本发明实施例将音频?文本检索和音频摘要这两个任务结合起来,进行数据增强,数据增强的音频摘要数据相比于已有的音频摘要数据都是全新的,能够在数据有限的条件下得到较好的音频?文本检索和音频摘要模型。

主权利要求:
1.一种音频摘要数据增强方法,包括:
利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;
将文本训练集和真实未标注音频输入至所述音频文本检索系统,确定真实未标注音频与文本训练集中各文本摘要的相似度,将最大相似度对应的文本摘要与所述真实未标注音频对应,仅在所述相似度达到预设阈值时,将所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。
2.根据权利要求1所述的方法,其中,在生成数据增强的音频摘要数据之后,所述方法还包括:将数据增强的音频摘要数据与已有的音频摘要数据融合,利用融合后的音频摘要数据重新训练音频文本检索系统,以用于提升数据增强的音频摘要数据的质量。
3.根据权利要求1所述的方法,其中,所述利用已有的音频摘要数据,预训练音频文本检索系统包括:利用预训练音频神经网络对所述已有的音频摘要数据进行训练,得到预训练音频文本检索系统。
4.一种音频摘要数据增强系统,包括:
预训练程序模块,用于利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;
数据增强程序模块,用于将文本训练集和真实未标注音频输入至所述音频文本检索系统,确定真实未标注音频与文本训练集中各文本摘要的相似度,将最大相似度对应的文本摘要与所述真实未标注音频对应,仅在所述相似度达到预设阈值时,将所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。
5.根据权利要求4所述的系统,其中,所述预训练程序模块还用于:
将数据增强的音频摘要数据与已有的音频摘要数据融合,利用融合后的音频摘要数据重新训练音频文本检索系统,以用于提升数据增强的音频摘要数据的质量。
6.根据权利要求4所述的系统,其中,所述预训练程序模块用于:
利用预训练音频神经网络对所述已有的音频摘要数据进行训练,得到预训练音频文本检索系统。
7.一种电子设备,其包括:至少一个处理器,以及与所述至少一个处理器通信连接的存储器,其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行权利要求1?3中任一项所述方法的步骤。
8.一种存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现权利要求1?3中任一项所述方法的步骤。 说明书 : 音频摘要数据增强方法、系统和电子设备及存储介质技术领域[0001] 本发明涉及智能语音领域,尤其涉及一种音频摘要数据增强方法、系统和电子设备及存储介质。背景技术[0002] 自动音频摘要是一个新兴的领域,旨在为给定的音频片段生成自然语言描述。相比通过声音事件分类、检测和定位等任务,摘要可以对声音进行无限制的描述。在智能家居助手和网站多媒体内容自动描述生成等应用中,这对帮助机器更好地与人类交互很有意义。然而音频摘要的数据量有限,难以获得。[0003] 对于数据增强,现有技术的音频摘要数据增强技术有频谱增强、数据混合、摘要词语替换。具体的,频谱增强在已有数据的频谱上随机掩盖掉一部分,在线生成新的数据;数据混合将现有数据按比例叠加得到新的数据;词语替换按照摘要中词语的TF?IDF(termfrequency–inversedocumentfrequency,关于频率的匹配方法)将不重要的词语随机替换成别的词。这些方法都通过在线生成新的数据训练更加鲁棒的模型。[0004] 在实现本发明过程中,发明人发现相关技术中至少存在如下问题:[0005] 上述举例的数据增强方法,得到的增强数据与原数据的区别很。捎谏鲜鍪菰銮考际醵际窃谙呤菰銮,无论是音频还是摘要文本都是在原数据基础上进行的小改动,而没有引入新的音频或者文本,给模型带来的提升有限。发明内容[0006] 为了至少解决现有技术中数据增强没有引入新的音频或者文本,给模型带来的提升有限的问题。第一方面,本发明实施例提供一种音频摘要数据增强方法,包括:[0007] 利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;[0008] 将文本训练集和真实未标注音频输入至所述音频文本检索系统,通过相似度确定所述真实未标注音频对应的文本摘要,基于所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0009] 第二方面,本发明实施例提供一种音频摘要数据增强系统,包括:[0010] 预训练程序模块,用于利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;[0011] 数据增强程序模块,用于将文本训练集和真实未标注音频输入至所述音频文本检索系统,通过相似度确定所述真实未标注音频对应的文本摘要,基于所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0012] 第三方面,提供一种电子设备,其包括:至少一个处理器,以及与所述至少一个处理器通信连接的存储器,其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行本发明任一实施例的音频摘要数据增强方法的步骤。[0013] 第四方面,本发明实施例提供一种存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现本发明任一实施例的音频摘要数据增强方法的步骤。[0014] 本发明实施例的有益效果在于:将音频?文本检索和音频摘要这两个任务结合起来,利用音频?文本检索模型和大量无标注的音频生成新的音频摘要数据,进行数据增强,数据增强的音频摘要数据相比于已有的音频摘要数据都是全新的,这种音频摘要数据训练模型效果更优。优化后的音频摘要模型也能对无标注的音频生成合理的标注,且不需要训练数据,两个任务相互促进,能够在数据有限的条件下得到较好的音频?文本检索和音频摘要模型。附图说明[0015] 为了更清楚地说明本发明实施例或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作一简单地介绍,显而易见地,下面描述中的附图是本发明的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。[0016] 图1是本发明一实施例提供的一种音频摘要数据增强方法的流程图;[0017] 图2是本发明一实施例提供的一种音频摘要数据增强方法的音频摘要系统架构图;[0018] 图3是本发明一实施例提供的一种音频摘要数据增强方法的音频文本检索系统架构图;[0019] 图4是本发明一实施例提供的一种音频摘要数据增强方法的概览图;[0020] 图5是本发明一实施例提供的一种音频摘要数据增强方法的检索模型的性能示意图;[0021] 图6是本发明一实施例提供的一种音频摘要数据增强方法的数据训练的系统性能示意图;[0022] 图7是本发明一实施例提供的一种音频摘要数据增强方法的不同增强设置下训练的系统的性能示意图;[0023] 图8是本发明一实施例提供的一种音频摘要数据增强系统的结构示意图;[0024] 图9为本发明一实施例提供的一种音频摘要数据增强的电子设备的实施例的结构示意图。具体实施方式[0025] 为使本发明实施例的目的、技术方案和优点更加清楚,下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0026] 如图1所示为本发明一实施例提供的一种音频摘要数据增强方法的流程图,包括如下步骤:[0027] S11:利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;[0028] S12:将文本训练集和真实未标注音频输入至所述音频文本检索系统,通过相似度确定所述真实未标注音频对应的文本摘要,基于所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0029] 在本实施方式中,主要构思为:预先训练一个文本?音频检索模型,用该模型计算一个给定音频和一句话之间的相似度。对于新的音频,计算它和已有数据集中所有标注摘要之间的相似度,选取相似度最大的摘要作为标签,得到增强数据。[0030] 对于步骤S11,由于音频摘要数据数量有限,利用这些已有的音频摘要数据来训练文本检测系统,其中,音频摘要数据由(音频?文本)构成,可以表示:为音频提供对应的自然语言描述。[0031] 音频文本检索系统参考了音频摘要系统的结构,为了详细说明音频文本检索系统,需要对音频摘要系统的结构进行说明。[0032] 使用序列到序列模型作为音频摘要系统,由音频编码器和文本解码器组成。其模型架构如图2所示。从图中可以看到,音频特征序列x被馈送到编码器,并被转换成抽象表示序列e=Encoder(x)。[0033] 解码器根据部分解码的词语 和音频表示e,预测在时间步长t上每个单词的概率。[0034][0035] 从特殊的“”单词开始,解码器自回归预测下一个单词,直到到达“”。[0036] 将PANNs的深度特征,具体是Wavegram?Logmel?CNN14变种,作为输入音频特征序列x,因为它在下游任务中具有优异的性能。编码器被建模为一个三层双向门控递归单元(GRU),而解码器是一个两层Transformer,以及一个全连接(FC)层。GRU?Transformer摘要系统通过交叉熵(CE)损失进行端到端训练:[0037][0038] 其中y是groundtruth标签序列。[0039] 在说明音频摘要系统之后,对基于音频摘要系统改进的音频文本检索系统进行说明。作为一种实施方式,所述利用已有的音频摘要数据,预训练音频文本检索系统包括:[0040] 利用预训练音频神经网络对所述已有的音频摘要数据进行训练,得到预训练音频文本检索系统。[0041] 在本实施方式中,由于结合使用PANNs特征和NetRVLAD聚合的方法显示出优越的性能,采用了该体系结构进行音频文本检索。如图3所示,输入音频A和文本T分别被编码为嵌入序列A和T。与音频摘要系统类似,使用PANNsWavegram?Logmel?CNN14作为音频编码器。在语料库上预先训练的Word2vec被用作文本编码器。其中,:[0042][0043][0044] 单词嵌入在训练期间被固定住。然而,与之不同的是,PANNs的参数并没有被冻结。在检索训练中加入PANNs使模型更深入,认为这在大规模数据集上可以表现得更好。然后对音频和文本嵌入序列进行类似的处理。对于序列 (可以是音频或文本),应用NetRVLad将其聚合为单个向量xagg。NetRVLAD中有c个可训练簇 其中c是一个超参数。每个集群通过加权平均x计算描述符。聚合输出是所有集群描述符的串联。[0045][0046] xagg=[r1;r2,...,rC][0047] 聚合后,使用FC层将音频和文本的xagg投影到同一维度。最后,通过上下文门控模块得到投影嵌入xproj。[0048] xproj=Gathg(FC(xagg))[0049] A和T之间的相似性计算为aproj和tproj之间的余弦相似性。[0050] 检索模型通过最大边际损失进行训练:[0051] la→t(i,j)=max(0,m+s(i,j)?s(i,j))[0052] lt→a(i,j)=max(0,m+s(j,i)?s(i,j))[0053][0054] 其中B和m表示批量大小和余量。s(i,j)表示批次中第i个音频和第j个文本之间的相似性。从而确定出所述音频和所述文本为音频摘要的相似度。[0055] 对于步骤S12,通过音频文本检索系统,可以生成增强的音频摘要对。对于给定的音频片段,计算其与摘要数据集中所有训练摘要的相似度,并选择相似度最大的摘要形成增强音频摘要对。[0056] 作为一种实施方式,生成数据增强的音频摘要数据包括:[0057] 确定真实未标注音频与文本训练集中各文本摘要的相似度,将最大相似度对应的文本摘要与所述真实未标注音频对应;[0058] 仅在所述相似度达到预设阈值时,将所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0059] 在本实施方式中,为了提高增强数据的质量,可以过滤出相似度低于阈值τ的音频摘要对。文本摘要越自然,τ越高,摘要质量越好,而增加的数据量也相应减少。如图4所示,摘要模型首先根据真实数据和增强数据的组合进行预训练。然后以较小的学习率对原始数据集进行微调。进而生成了质量更高的数据增强的音频摘要数据。[0060] 考虑到为了让音频摘要数据增强越用越好,作为一种实施方式,在生成数据增强的音频摘要数据之后,所述方法还包括:[0061] 将数据增强的音频摘要数据与已有的音频摘要数据融合,利用融合后的音频摘要数据重新训练音频文本检索系统,以用于提升数据增强的音频摘要数据的质量。[0062] 在本实施方式中,数据增强的音频摘要数据是基于音频?文本对的相似度确定,为了进一步优化音频文本检索系统,将数据增强的音频?文本对中相似度较高的那些筛选出来,将这些增强的音频摘要数据对与已有的音频摘要数据的合并数据上训练摘要模型。这样使得下游的增强数据质量会更高。[0063] 通过该实施方式可以看出,将音频?文本检索和音频摘要这两个任务结合起来,利用音频?文本检索模型和大量无标注的音频生成新的音频摘要数据,进行数据增强,数据增强的音频摘要数据相比于已有的音频摘要数据都是全新的,这种音频摘要数据训练模型效果更优。优化后的音频摘要模型也能对无标注的音频生成合理的标注,且不需要训练数据,两个任务相互促进,能够在数据有限的条件下得到较好的音频?文本检索和音频摘要模型。[0064] 对本方法进行试验说明,由于Audiocaps是AudioSet的一个子集,AudioSet中的其他音频片段可以被视为与Audiocaps在同一个域中。因此,本方法使用Audiocaps数据集进行检索和摘要训练,使用AudioSet进行数据增强。从AudioSet中随机选择不在Audiocaps中出现的100k音频片段,并检索摘要以形成增强的音频摘要数据。使用Audiocaps的官方分类,包括培训、验证和测试。[0065] 音频文本检索模型的训练配置与该模型以0.01的初始学习率训练20轮的情况相同。在验证集上的性能最好的模型用于扩充音频摘要数据。[0066] 对于摘要,在预训练期间,在原始摘要前后添加特殊单词“”和“”。使用?4的批量大小为64。基线模型训练20k次迭代,每800次迭代验证一次,最大学习率为5×10 。对于增强实验,预训练阶段遵循与基线模型相同的设置,而微调阶段的最大学习率为1×?4 ?710 。学习速率在前4K迭代中线性升温至最大值,然后指数衰减至5×10 。使用计划采样和标签平滑进行正则化。随机加权平均用于对最后五个检查点进行平均,以进行评估。[0067] 本方法首先用部分伪数据替换原始数据集来评估增强的数据质量;然后从两种训练策略的角度揭示了数据增强的效果;最后,检验了阈值τ的影响,以比较数据质量和数量的平衡。[0068] 对于增强数据质量,从音频文本检索系统性能的角度评估增强的数据质量。如图5所示,将PANNs纳入训练可以显著提高检索性能。对于给定的音频片段,其相应的标题很可能出现在前五名检索结果中。[0069] 然后,通过将真实的训练数据替换为增强数据来进一步评估质量。训练数据总量与原始训练集相同。结果如图6所示。当模型在训练分割的子集上训练时,所有指标都会下降,尤其是当只有25%的可用训练数据时。将增强数据添加到训练中可以显著改善METEOR、CIDEr和FENSE,这表明该模型可以使用增强的训练数据生成更多与内容相关的摘要。然而,BLEU4和ROUGEL的减少表明,使用增广数据训练的模型可能不会使用与注释完全相同的表达式。就最可靠的指标FENSE而言,用增强的数据替换真实数据几乎没有什么区别。在使用完整增强数据的情况下,该模型仍然可以生成合理的摘要,其SPICE和FENSE略优于使用12k真实数据的训练。尽管毫无疑问,真实数据和增强数据之间存在差距,但这些结果表明,增强数据的质量很高。[0070] 如图7展示了本方法的增强方法的音频摘要性能。除了在没有数据增强的情况下训练的模型外,还比较了另外两个基线:SpecAugment(一种常用的有效音频增强方法)和SelfAugment(其中增强音频片段的摘要由基线模型本身生成)。对于SpecAugment,随机将输入特征屏蔽为零。与没有增强相比,SpecAugment在摘要生成方面的性能改善甚微。自增强对摘要设置有负面影响,因为增强摘要在语法上是通用的和重复的。在使用检索模型中的所有100k音频摘要对增强数据进行预训练后,BLEU4、CIDEr和FENSE下降。由于一些音频片段在训练语料库中找不到合适的标题,因此包含所有增强数据也可能会导致训练数据中出现噪声。对真实数据进行进一步微调,可以减轻噪声增强数据带来的负面影响,提高摘要性能。除BLEU4外,所有指标均有改善。用于预训练的增强音频数据比原始训练音频丰富得多。声音事件可能有几种模式,原始数据集中罕见的模式可能会更频繁地出现在增强数据中。暴露于更丰富的音频模式有助于模型在推理过程中更好地概括。[0071] 由于音频文本检索系统给出了增广音频摘要对之间的相似性,可以过滤掉相似性低的摘要对,这些语音摘要对通常是有噪声的。可以采用不同的滤波阈值τ,结果如图7所示。τ越高,增广对的数量越小。正如预期的那样,在CIDEr和FENSE方面,对质量更高的增强数据进行预培训会产生更好的性能。当τ=0.7时,虽然只剩下11%的增广对,但除了METEOR之外,它的性能最好。然而,在对真实数据进行微调后,在最大规模的增强数据上预训练的模型在几乎所有指标上都能获得最佳结果。比较表明,高质量的增强数据有利于从头开始训练模型,而训练前更喜欢数量较大的增强数据。[0072] 总的来说,本方法提出了一种通过音频文本检索的音频摘要数据增强方法。首先在音频摘要数据集上训练基于PANNs音频编码器和NetRVLAD聚合的检索模型。然后,从摘要训练语料库中为没有文本描述的音频片段分配最相似的摘要。原始数据集由成对的这些音频片段及其检索到的摘要进行扩充。在Audiocaps上的实验结果表明,就大多数评估指标而言,增强数据会带来更好的性能。此外,高质量的增强数据更适合从头开始训练模型,而预训练从大量数据中获益更多。[0073] 如图8所示为本发明一实施例提供的一种音频摘要数据增强系统的结构示意图,该系统可执行上述任意实施例所述的音频摘要数据增强方法,并配置在终端中。[0074] 本实施例提供的一种音频摘要数据增强系统10包括:预训练程序模块11和数据增强程序模块12。[0075] 其中,预训练程序模块11用于利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;数据增强程序模块12用于将文本训练集和真实未标注音频输入至所述音频文本检索系统,通过相似度确定所述真实未标注音频对应的文本摘要,基于所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0076] 进一步地,所述数据增强程序模块用于:[0077] 确定真实未标注音频与文本训练集中各文本摘要的相似度,将最大相似度对应的文本摘要与所述真实未标注音频对应;[0078] 仅在所述相似度达到预设阈值时,将所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0079] 进一步地,所述预训练程序模块还用于:[0080] 将数据增强的音频摘要数据与已有的音频摘要数据融合,利用融合后的音频摘要数据重新训练音频文本检索系统,以用于提升数据增强的音频摘要数据的质量。[0081] 进一步地,所述预训练程序模块用于:[0082] 利用预训练音频神经网络对所述已有的音频摘要数据进行训练,得到预训练音频文本检索系统。[0083] 本发明实施例还提供了一种非易失性计算机存储介质,计算机存储介质存储有计算机可执行指令,该计算机可执行指令可执行上述任意方法实施例中的音频摘要数据增强方法;[0084] 作为一种实施方式,本发明的非易失性计算机存储介质存储有计算机可执行指令,计算机可执行指令设置为:[0085] 利用已有的音频摘要数据,预训练音频文本检索系统,其中,所述音频文本检索系统的输入为音频和文本,输出所述音频和所述文本为音频摘要的相似度;[0086] 将文本训练集和真实未标注音频输入至所述音频文本检索系统,通过相似度确定所述真实未标注音频对应的文本摘要,基于所述真实未标注音频以及所述对应的文本摘要,生成数据增强的音频摘要数据。[0087] 作为一种非易失性计算机可读存储介质,可用于存储非易失性软件程序、非易失性计算机可执行程序以及模块,如本发明实施例中的方法对应的程序指令/模块。一个或者多个程序指令存储在非易失性计算机可读存储介质中,当被处理器执行时,执行上述任意方法实施例中的音频摘要数据增强方法。[0088] 图9是本申请另一实施例提供的音频摘要数据增强方法的电子设备的硬件结构示意图,如图9所示,该设备包括:[0089] 一个或多个处理器910以及存储器920,图9中以一个处理器910为例。音频摘要数据增强方法的设备还可以包括:输入装置930和输出装置940。[0090] 处理器910、存储器920、输入装置930和输出装置940可以通过总线或者其他方式连接,图9中以通过总线连接为例。[0091] 存储器920作为一种非易失性计算机可读存储介质,可用于存储非易失性软件程序、非易失性计算机可执行程序以及模块,如本申请实施例中的音频摘要数据增强方法对应的程序指令/模块。处理器910通过运行存储在存储器920中的非易失性软件程序、指令以及模块,从而执行服务器的各种功能应用以及数据处理,即实现上述方法实施例音频摘要数据增强方法。[0092] 存储器920可以包括存储程序区和存储数据区,其中,存储程序区可存储操作系统、至少一个功能所需要的应用程序;存储数据区可存储数据等。此外,存储器920可以包括高速随机存取存储器,还可以包括非易失性存储器,例如至少一个磁盘存储器件、闪存器件、或其他非易失性固态存储器件。在一些实施例中,存储器920可选包括相对于处理器910远程设置的存储器,这些远程存储器可以通过网络连接至移动装置。上述网络的实例包括但不限于互联网、企业内部网、局域网、移动通信网及其组合。[0093] 输入装置930可接收输入的数字或字符信息。输出装置940可包括显示屏等显示设备。[0094] 所述一个或者多个模块存储在所述存储器920中,当被所述一个或者多个处理器910执行时,执行上述任意方法实施例中的音频摘要数据增强方法。[0095] 上述产品可执行本申请实施例所提供的方法,具备执行方法相应的功能模块和有益效果。未在本实施例中详尽描述的技术细节,可参见本申请实施例所提供的方法。[0096] 非易失性计算机可读存储介质可以包括存储程序区和存储数据区,其中,存储程序区可存储操作系统、至少一个功能所需要的应用程序;存储数据区可存储根据装置的使用所创建的数据等。此外,非易失性计算机可读存储介质可以包括高速随机存取存储器,还可以包括非易失性存储器,例如至少一个磁盘存储器件、闪存器件、或其他非易失性固态存储器件。在一些实施例中,非易失性计算机可读存储介质可选包括相对于处理器远程设置的存储器,这些远程存储器可以通过网络连接至装置。上述网络的实例包括但不限于互联网、企业内部网、局域网、移动通信网及其组合。[0097] 本发明实施例还提供一种电子设备,其包括:至少一个处理器,以及与所述至少一个处理器通信连接的存储器,其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行本发明任一实施例的音频摘要数据增强方法的步骤。[0098] 本申请实施例的电子设备以多种形式存在,包括但不限于:[0099] (1)移动通信设备:这类设备的特点是具备移动通信功能,并且以提供话音、数据通信为主要目标。这类终端包括:智能手机、多媒体手机、功能性手机,以及低端手机等。[0100] (2)超移动个人计算机设备:这类设备属于个人计算机的范畴,有计算和处理功能,一般也具备移动上网特性。这类终端包括:PDA、MID和UMPC设备等,例如平板电脑。[0101] (3)便携式娱乐设备:这类设备可以显示和播放多媒体内容。该类设备包括:音频、视频播放器,掌上游戏机,电子书,以及智能玩具和便携式车载导航设备。[0102] (4)其他具有数据处理功能的电子装置。[0103] 在本文中,诸如第一和第二等之类的关系术语仅仅用来将一个实体或者操作与另一个实体或操作区分开来,而不一定要求或者暗示这些实体或操作之间存在任何这种实际的关系或者顺序。而且,术语“包括”、“包含”,不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、方法、物品或者设备所固有的要素。在没有更多限制的情况下,由语句“包括……”限定的要素,并不排除在包括所述要素的过程、方法、物品或者设备中还存在另外的相同要素。[0104] 以上所描述的装置实施例仅仅是示意性的,其中所述作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施例方案的目的。本领域普通技术人员在不付出创造性的劳动的情况下,即可以理解并实施。[0105] 通过以上的实施方式的描述,本领域的技术人员可以清楚地了解到各实施方式可借助软件加必需的通用硬件平台的方式来实现,当然也可以通过硬件。基于这样的理解,上述技术方案本质上或者说对现有技术做出贡献的部分可以以软件产品的形式体现出来,该计算机软件产品可以存储在计算机可读存储介质中,如ROM/RAM、磁碟、光盘等,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行各个实施例或者实施例的某些部分所述的方法。[0106] 最后应说明的是:以上实施例仅用以说明本发明的技术方案,而非对其限制;尽管参照前述实施例对本发明进行了详细的说明,本领域的普通技术人员应当理解:其依然可以对前述各实施例所记载的技术方案进行修改,或者对其中部分技术特征进行等同替换;而这些修改或者替换,并不使相应技术方案的本质脱离本发明各实施例技术方案的精神和范围。

专利地区:江苏

专利申请日期:2022-04-29

专利公开日期:2024-11-29

专利公告号:CN114860907B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载