产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:实用新型专利;专利名称:基于LLM的数字校园智能问答服务方法和系统
专利类型:实用新型专利
专利申请号:CN202410324629.5
专利申请(专利权)人:内蒙古工业大学
权利人地址:内蒙古自治区呼和浩特市新城区爱民路(北)49号
专利发明(设计)人:王钢,孔令飞,颜培志,刘乃维,李燕
专利摘要:本申请涉及智能问答技术领域,公开了一种基于LLM的数字校园智能问答服务方法和系统,对校园数据进行预处理,预处理完成后,基于预处理得到的文本数据进行分割,将其分割为多个文本块,构建Embedding模型,将第一文本向量数据输入至Embedding模型中进行向量化,得到第二文本向量数据,能够降低第二文本向量的维度,当用户需要进行查询时,可获取第一输入问题对应的嵌入向量,基于相似性计算从第二文本向量数据中匹配到与嵌入向量最相似的多个匹配答案,再将第一输入问题与多个匹配答案作为上下文输入至LLM模型中,以输出回答文本信息,本申请拥有更好的问题理解和答案生成能力,可有效提高校园生活知识问答系统的准确率和智能化水平。
主权利要求:
1.一种基于LLM的数字校园智能问答服务方法,其特征在于,包括:获取校园数据,并对校园数据进行预处理,得到文本数据;
根据预设条件将文本数据分割为多个文本块,并对多个所述文本块进行向量化,得到第一文本向量数据;
构建Embedding模型,并获取训练数据以对Embedding模型进行训练;
将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据;
获取第一输入问题,并将第一输入问题输入至Embedding模型中,以生成与所述第一输入问题对应的嵌入向量;
根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到多个匹配答案;
将第一输入问题与多个匹配答案作为上下文输入至LLM模型,输出回答文本信息;
判断在预设时间内是否接收到根据回答文本信息返回的反馈信息;
若接收到根据回答文本信息返回的反馈信息,获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤;
所述获取校园数据,并对校园数据进行预处理,得到文本数据的步骤,包括:获取校园数据,其中,所述校园数据包括多个数据类型以及每个数据类型对应的数据内容;
判断多个数据类型以及多个数据类型对应的数据内容是否符合预设安全条件;
若多个数据类型以及多个数据类型中有任意一个数据类型和/或数据类型所对应的数据内容不符合预设安全条件,则将该数据类型和/或数据类型所对应的数据内容定义为隐私数据;
对所述隐私数据进行文本提。玫蕉喔鲆私特征词;
将每个隐私特征词作为节点构建隐私特征图谱,其中,隐私特征图谱中相邻节点之间采用连接线进行连接,且若存在相同隐私特征词,则将相同隐私特征词所对应的节点记为一个;
获取每个节点所对应的脱敏预测损失值以及每个节点与相邻节点连接的关联权重值;
根据所述隐私特征图谱计算每个节点的隐私度值,其中,计算公式为:其中,所述Ri表示第i个节点的隐私度值,A表示所有指向Ri节点的集合,xi,j表示第i个节点与第j个节点连接的关联权重值,xi,k表示第i个节点与第k个节点连接的关联权重值,B表示由节点Ri连接出去的节点的集合,Si表示第i个节点在隐私特征图谱中的排序值,Li表示第i个节点所对应的脱敏预测损失值;
从多个节点的隐私度值中提取最大值作为隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息;
对所述映射关键信息进行对称加密,得到加密数据;
将加密数据增加至对应的隐私数据,并对增加了加密数据的隐私数据进行脱敏处理,得到文本数据。
2.根据权利要求1所述的基于LLM的数字校园智能问答服务方法,其特征在于,所述根据预设条件将文本数据分割为多个文本块的步骤,包括:按预设条件对文本数据进行语句划分,得到多个语言数据;
遍历所有语言数据,判断每个语言数据是否属于目标栈;
若该语言数据不属于目标栈,将该语言数据记为分割点,遍历完成后,得到多个分割点;
对分割点与分割点之间的语言数据进行拼接,得到多个拼接文本;
遍历所有拼接文本,判断拼接文本与两端分割点是否为正向拼接,将为正向拼接的分割点记为第一分割点;
将拼接文本与第一分割点进行拼接,得到文本块;
遍历完成后,得到多个文本块。
3.根据权利要求1所述的基于LLM的数字校园智能问答服务方法,其特征在于,所述构建Embedding模型,并获取训练数据以对Embedding模型进行训练的步骤,包括:基于深度学习框架构建Embedding模型;
设定Embedding模型的输入维度和输出维度;
设定Embedding模型的优化器、损失函数以及评估指标;
获取训练数据以对Embedding模型进行训练,在训练过程中,Embedding模型根据输出结果对损失函数进行最小化定义,以完成Embedding模型的训练。
4.根据权利要求1所述的基于LLM的数字校园智能问答服务方法,其特征在于,将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据的步骤,包括:获取第一文本向量数据,并基于第一文本向量数据建立数字编码表,其中,所述第一文本向量数据包括多个词向量以及上下文关系向量,所述数字编码表包括上下文关系向量与对应的多个词向量的映射关系;
获取Embedding模型的输入维度,并根据输入维度构建标准矩阵列表;
基于标准矩阵列表对数字编码表进行维度矩阵转换,得到多个语义矩阵以及多个语义矩阵列表;
按照多个语义矩阵列表的顺序将多个语义矩阵输入Embedding模型中进行向量化,并输出第二文本向量数据。
5.根据权利要求1所述的基于LLM的数字校园智能问答服务方法,其特征在于,所述根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到相似度最高的多个匹配答案的步骤,包括:基于余弦相似度原理计算所述嵌入向量与第二文本向量数据的多个余弦值,其中,所述第二文本向量数据包括多个第二文本向量;
根据多个余弦值从第二文本向量数据中选择topk个相似度最高的第二文本向量,作为第一答案向量;
根据所述嵌入向量获取备选问题向量;
基于余弦相似度原理计算所述嵌入向量与所述备选问题向量的相似度;
判断所述相似度是否为预设值;
若所述相似度为预设值,获取与所述备选问题向量对应的topn个相似度最高第二答案向量,其中,topk个第二文本向量的k值与topn个第二答案向量的n值相等;
将topn个第二答案向量与topk个第一答案向量按照相似度最高的顺序依次进行融合,得到多个匹配答案。
6.根据权利要求1所述的基于LLM的数字校园智能问答服务方法,其特征在于,所述获取至少一个与所述第一输入问题相关的第二输入问题的步骤,包括:获取第一输入问题中的至少一个关键词以及至少一个上下文语境词;
获取与至少一个所述关键词对应的关键向量;
获取与至少一个所述上下文语境词对应的语境向量;
根据所述关键向量和所述语境向量计算关联值,其中,计算公式为:其中,所述S表示关联值,f(a)表示关键向量,f(A)表示关键向量所对应的权重,f(b)表示语境向量,f(B)表示语境向量所对应的权重;
获取与所述关联值对应的近义词向量;
根据所述近义词向量与语境向量生成问题向量,根据所述问题向量生成第二输入问题。
7.一种基于LLM的数字校园智能问答服务系统,其特征在于,包括:预处理模块,用于获取校园数据,并对校园数据进行预处理,得到文本数据;
分割模块,用于根据预设条件将文本数据分割为多个文本块,并对多个所述文本块进行向量化,得到第一文本向量数据;
构建模块,用于构建Embedding模型,并获取训练数据以对Embedding模型进行训练;
向量化模块,用于将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据;
获取模块,用于获取第一输入问题,并将第一输入问题输入至Embedding模型中,以生成与所述第一输入问题对应的嵌入向量;
相似度匹配模块,用于根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到多个匹配答案;
LLM模型模块,用于将第一输入问题与多个匹配答案作为上下文输入至LLM模型,输出回答文本信息;
判断模块,用于判断在预设时间内是否接收到根据回答文本信息返回的反馈信息;
反馈模块,用于若接收到根据回答文本信息返回的反馈信息,获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤;
所述预处理模块,包括:
第一获取数据单元,用于获取校园数据,其中,所述校园数据包括多个数据类型以及每个数据类型对应的数据内容;
判断单元,用于判断多个数据类型以及多个数据类型对应的数据内容是否符合预设安全条件;
若多个数据类型以及多个数据类型中有任意一个数据类型和/或数据类型所对应的数据内容不符合预设安全条件,则将该数据类型和/或数据类型所对应的数据内容定义为隐私数据;
文本提取单元,用于对所述隐私数据进行文本提。玫蕉喔鲆私特征词;
构建单元,用于将每个隐私特征词作为节点构建隐私特征图谱,其中,隐私特征图谱中相邻节点之间采用连接线进行连接,且若存在相同隐私特征词,则将相同隐私特征词所对应的节点记为一个;
第二获取单元,用于获取每个节点所对应的脱敏预测损失值以及每个节点与相邻节点连接的关联权重值;
计算单元,用于根据所述隐私特征图谱计算每个节点的隐私度值,其中,计算公式为:其中,所述Ri表示第i个节点的隐私度值,A表示所有指向Ri节点的集合,xi,j表示第i个节点与第j个节点连接的关联权重值,xi,k表示第i个节点与第k个节点连接的关联权重值,B表示由节点Ri连接出去的节点的集合,Si表示第i个节点在隐私特征图谱中的排序值,Li表示第i个节点所对应的脱敏预测损失值;
提取单元,用于从多个节点的隐私度值中提取最大值作为隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息;
加密单元,用于对所述映射关键信息进行对称加密,得到加密数据;
脱敏单元,用于将加密数据增加至对应的隐私数据,并对增加了加密数据的隐私数据进行脱敏处理,得到文本数据。
8.根据权利要求7所述的基于LLM的数字校园智能问答服务系统,其特征在于,所述分割模块,包括:划分单元,用于按预设条件对文本数据进行语句划分,得到多个语言数据;
第一遍历单元,用于遍历所有语言数据,判断每个语言数据是否属于目标栈;
若该语言数据不属于目标栈,将该语言数据记为分割点,遍历完成后,得到多个分割点;
拼接单元,用于对分割点与分割点之间的语言数据进行拼接,得到多个拼接文本;
第二遍历单元,用于遍历所有拼接文本,判断拼接文本与两端分割点是否为正向拼接,将为正向拼接的分割点记为第一分割点;
第二拼接单元,用于将拼接文本与第一分割点进行拼接,得到文本块,遍历完成后,得到多个文本块。 说明书 : 基于LLM的数字校园智能问答服务方法和系统技术领域[0001] 本申请涉及智能问答技术领域,特别涉及一种基于LLM的数字校园智能问答服务方法和系统。背景技术[0002] 大语言模型(LargeLanguageModel,LLM)是指能够处理和生成自然语言文本的模型。其基于机器学习和人工智能技术,通过学习大量的文本数据,能够生成具有连贯性和语义准确性的文本。大语言模型拥有良好的问题理解和答案生成能力,能够适应不同的应用场景和问题类型,并且能够不断从大量的文本数据中进行学习和优化,生成高质量、连贯、自然的语言文本,具有很强的语言生成能力,已经被广泛应用于自然语言处理领域。然而传统的基于规则或模板检索关键词的方法需要专业人员创建大量的模板和规则,不仅耗费大量时间和人力,也不能真正理解用户问题的语义特征而造成低效率的回答;以校园知识问答系统为例,传统校园知识问答系统均需要设计大量的高质量Q(question,问题)&A(answer,答案)样本数据,其实质就是对学校各类信息进行统计分类,所采用的技术普遍为基于规则匹配或关键词检索技术。然而设计标注大量高质量的Q&A数据库需要耗费大量人力物力,且无法包含所有的问题种类与校园信息,需要时常更新Q&A数据库,流程繁琐,效率低;且学校数据对于训练一个通用大语言模型时的数据量来说是微不足道的,使用极少的数据微调大语言模型,容易造成大语言模型效果下降,从而导致校园知识问答的准确率低。发明内容[0003] 本申请提供了一种基于LLM的数字校园智能问答服务方法,旨在解决现有技术中采用大语言模型针对少量数据进行训练造成问答系统准确率较低的技术问题。[0004] 本申请提供了一种基于LLM的数字校园智能问答服务方法,包括:[0005] 获取校园数据,并对校园数据进行预处理,得到文本数据;[0006] 根据预设条件将文本数据分割为多个文本块,并对多个所述文本块进行向量化,得到第一文本向量数据;[0007] 构建Embedding模型,并获取训练数据以对Embedding模型进行训练;[0008] 将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据;[0009] 获取第一输入问题,并将第一输入问题输入至Embedding模型中,以生成与所述第一输入问题对应的嵌入向量;[0010] 根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到多个匹配答案;[0011] 将第一输入问题与多个匹配答案作为上下文输入至LLM模型,输出回答文本信息;[0012] 判断在预设时间内是否接收到根据回答文本信息返回的反馈信息;[0013] 若接收到根据回答文本信息返回的反馈信息,获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤。[0014] 作为优。龌袢⌒T笆,并对校园数据进行预处理,得到文本数据的步骤,包括:[0015] 获取校园数据,其中,所述校园数据包括多个数据类型以及每个数据类型对应的数据内容;[0016] 判断多个数据类型以及多个数据类型对应的数据内容是否符合预设安全条件;[0017] 若多个数据类型以及多个数据类型中有任意一个数据类型和/或数据类型所对应的数据内容不符合预设安全条件,则将该数据类型和/或数据类型所对应的数据内容定义为隐私数据;[0018] 对所述隐私数据进行文本提。玫蕉喔鲆私特征词;[0019] 将每个隐私特征词作为节点构建隐私特征图谱,其中,隐私特征图谱中相邻节点之间采用连接线进行连接,且若存在相同隐私特征词,则将相同隐私特征词所对应的节点记为一个;[0020] 获取每个节点所对应的脱敏预测损失值以及每个节点与相邻节点连接的关联权重值;[0021] 根据所述隐私特征图谱计算每个节点的隐私度值,其中,计算公式为:[0022][0023] 其中,所述Ri表示第i个节点的隐私度值,A表示所有指向Ri节点的集合,xi,j表示第i个节点与第j个节点连接的关联权重值,xi,k表示第i个节点与第k个节点连接的关联权重值,B表示由节点Ri连接出去的节点的集合,Si表示第i个节点在隐私特征图谱中的排序值,Li表示第i个节点所对应的脱敏预测损失值;[0024] 从多个节点的隐私度值中提取最大值作为隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息;[0025] 对所述映射关键信息进行对称加密,得到加密数据;[0026] 将加密数据增加至对应的隐私数据,并对增加了加密数据的隐私数据进行脱敏处理,得到文本数据。[0027] 作为优。龈菰ど杼跫将文本数据分割为多个文本块的步骤,包括:[0028] 按预设条件对文本数据进行语句划分,得到多个语言数据;[0029] 遍历所有语言数据,判断每个语言数据是否属于目标栈;[0030] 若该语言数据不属于目标栈,将该语言数据记为分割点,遍历完成后,得到多个分割点;[0031] 对分割点与分割点之间的语言数据进行拼接,得到多个拼接文本;[0032] 遍历所有拼接文本,判断拼接文本与两端分割点是否为正向拼接,将为正向拼接的分割点记为第一分割点;[0033] 将拼接文本与第一分割点进行拼接,得到文本块;[0034] 遍历完成后,得到多个文本块。[0035] 作为优。龉菇‥mbedding模型,并获取训练数据以对Embedding模型进行训练的步骤,包括:[0036] 基于深度学习框架构建Embedding模型;[0037] 设定Embedding模型的输入维度和输出维度;[0038] 设定Embedding模型的优化器、损失函数以及评估指标;[0039] 获取训练数据以对Embedding模型进行训练,在训练过程中,Embedding模型根据输出结果对损失函数进行最小化定义,以完成Embedding模型的训练。[0040] 作为优。谝晃谋鞠蛄渴菔淙隕mbedding模型中进行向量化,得到第二文本向量数据的步骤,包括:[0041] 获取第一文本向量数据,并基于第一文本向量数据建立数字编码表,其中,所述第一文本向量数据包括多个词向量以及上下文关系向量,所述数字编码表包括上下文关系向量与对应的多个词向量的映射关系;[0042] 获取Embedding模型的输入维度,并根据输入维度构建标准矩阵列表;[0043] 基于标准矩阵列表对数字编码表进行维度矩阵转换,得到多个语义矩阵以及多个语义矩阵列表;[0044] 按照多个语义矩阵列表的顺序将多个语义矩阵输入Embedding模型中进行向量化,并输出第二文本向量数据。[0045] 作为优。龈菟銮度胂蛄慷缘诙文本向量数据进行相似度匹配搜索,得到相似度最高的多个匹配答案的步骤,包括:[0046] 基于余弦相似度原理计算所述嵌入向量与第二文本向量数据的多个余弦值,其中,所述第二文本向量数据包括多个第二文本向量;[0047] 根据多个余弦值从第二文本向量数据中选择topk个相似度最高的第二文本向量,作为第一答案向量;[0048] 根据所述嵌入向量获取备选问题向量;[0049] 基于余弦相似度原理计算所述嵌入向量与所述备选问题向量的相似度;[0050] 判断所述相似度是否为预设值;[0051] 若所述相似度为预设值,获取与所述备选问题向量对应的topn个相似度最高第二答案向量,其中,topk个第二文本向量的k值与topn个第二答案向量的n值相等;[0052] 将topn个第二答案向量与topk个第一答案向量按照相似度最高的顺序依次进行融合,得到多个匹配答案。[0053] 作为优。龌袢≈辽僖桓鲇胨龅谝皇淙胛侍庀喙氐牡诙输入问题的步骤,包括:[0054] 获取第一输入问题中的至少一个关键词以及至少一个上下文语境词;[0055] 获取与至少一个所述关键词对应的关键向量;[0056] 获取与至少一个所述上下文语境词对应的语境向量;[0057] 根据所述关键向量和所述语境向量计算关联值,其中,计算公式为:[0058][0059] 其中,所述S表示关联值,f(a)表示关键向量,f(A)表示关键向量所对应的权重,f(b)表示语境向量,f(B)表示语境向量所对应的权重;[0060] 获取与所述关联值对应的近义词向量;[0061] 根据所述近义词向量与语境向量生成问题向量,根据所述问题向量生成第二输入问题。[0062] 本申请还提供一种基于LLM的数字校园智能问答服务系统,包括:[0063] 预处理模块,用于获取校园数据,并对校园数据进行预处理,得到文本数据;[0064] 分割模块,用于根据预设条件将文本数据分割为多个文本块,并对多个所述文本块进行向量化,得到第一文本向量数据;[0065] 构建模块,用于构建Embedding模型,并获取训练数据以对Embedding模型进行训练;[0066] 向量化模块,用于将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据;[0067] 获取模块,用于获取第一输入问题,并将第一输入问题输入至Embedding模型中,以生成与所述第一输入问题对应的嵌入向量;[0068] 相似度匹配模块,用于根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到多个匹配答案;[0069] LLM模型模块,用于将第一输入问题与多个匹配答案作为上下文输入至LLM模型,输出回答文本信息;[0070] 判断模块,用于判断在预设时间内是否接收到根据回答文本信息返回的反馈信息;[0071] 反馈模块,用于若接收到根据回答文本信息返回的反馈信息,获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤。[0072] 作为优。鲈ご砟?,包括:[0073] 第一获取数据单元,用于获取校园数据,其中,所述校园数据包括多个数据类型以及每个数据类型对应的数据内容;[0074] 判断单元,用于判断多个数据类型以及多个数据类型对应的数据内容是否符合预设安全条件;[0075] 若多个数据类型以及多个数据类型中有任意一个数据类型和/或数据类型所对应的数据内容不符合预设安全条件,则将该数据类型和/或数据类型所对应的数据内容定义为隐私数据;[0076] 文本提取单元,用于对所述隐私数据进行文本提。玫蕉喔鲆私特征词;[0077] 构建单元,用于将每个隐私特征词作为节点构建隐私特征图谱,其中,隐私特征图谱中相邻节点之间采用连接线进行连接,且若存在相同隐私特征词,则将相同隐私特征词所对应的节点记为一个;[0078] 第二获取单元,用于获取每个节点所对应的脱敏预测损失值以及每个节点与相邻节点连接的关联权重值;[0079] 计算单元,用于根据所述隐私特征图谱计算每个节点的隐私度值,其中,计算公式为:[0080][0081] 其中,所述Ri表示第i个节点的隐私度值,A表示所有指向Ri节点的集合,xi,j表示第i个节点与第j个节点连接的关联权重值,xi,k表示第i个节点与第k个节点连接的关联权重值,B表示由节点Ri连接出去的节点的集合,Si表示第i个节点在隐私特征图谱中的排序值,Li表示第i个节点所对应的脱敏预测损失值;[0082] 提取单元,用于从多个节点的隐私度值中提取最大值作为隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息;[0083] 加密单元,用于对所述映射关键信息进行对称加密,得到加密数据;[0084] 脱敏单元,用于将加密数据增加至对应的隐私数据,并对增加了加密数据的隐私数据进行脱敏处理,得到文本数据。[0085] 作为优。龇指钅?,包括:[0086] 划分单元,用于按预设条件对文本数据进行语句划分,得到多个语言数据;[0087] 第一遍历单元,用于遍历所有语言数据,判断每个语言数据是否属于目标栈;[0088] 若该语言数据不属于目标栈,将该语言数据记为分割点,遍历完成后,得到多个分割点;[0089] 拼接单元,用于对分割点与分割点之间的语言数据进行拼接,得到多个拼接文本;[0090] 第二遍历单元,用于遍历所有拼接文本,判断拼接文本与两端分割点是否为正向拼接,将为正向拼接的分割点记为第一分割点;[0091] 第二拼接单元,用于将拼接文本与第一分割点进行拼接,得到文本块,遍历完成后,得到多个文本块。[0092] 本申请的有益效果为:在获取到校园数据后,先对校园数据进行预处理,这样可以从源头处杜绝生成式大语言模型对真实数据的特征记录和学习以造成的隐私泄露;预处理完成后,基于预处理得到的文本数据进行分割,将其分割为多个文本块,并对其进行向量化,能够使其直接转换为稀疏向量,便于后期数据的处理;构建Embedding模型,并获取训练数据以对Embedding模型进行训练,将第一文本向量数据输入至Embedding模型中进行向量化,得到第二文本向量数据,能够降低第二文本向量的维度,使得生成的第二文本向量数据稠密化,从而能够提高第二文本向量数据的综合信息能力;当用户需要进行查询时,可获取第一输入问题对应的嵌入向量,基于相似性计算从第二文本向量数据中匹配到与嵌入向量最相似的多个匹配答案,再将第一输入问题与多个匹配答案作为上下文输入至LLM模型中,以输出回答文本信息,相比于直接将校园数据输入大语言模型中输出回答文本信息,本申请提高了学校数据的整体可用性,拥有更好的问题理解和答案生成能力,能够适应不同的应用场景和问题类型,可有效提高校园生活知识问答系统的准确率和智能化水平,在一定程度上提高数字校园智能问答服务的准确率。附图说明[0093] 图1为本申请一实施例的方法流程示意图。[0094] 图2为本申请一实施例的系统结构示意图。[0095] 本申请目的的实现、功能特点及优点将结合实施例,参照附图做进一步说明。具体实施方式[0096] 应当理解,此处所描述的具体实施例仅仅用以解释本申请,并不用于限定本申请。[0097] 如图1、图2所示,本申请提供了一种基于LLM的数字校园智能问答服务方法,包括:[0098] S1、获取校园数据,并对校园数据进行预处理,得到文本数据;[0099] S2、根据预设条件将文本数据分割为多个文本块,并对多个所述文本块进行向量化,得到第一文本向量数据;[0100] S3、构建Embedding模型,并获取训练数据以对Embedding模型进行训练;[0101] S4、将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据;[0102] S5、获取第一输入问题,并将第一输入问题输入至Embedding模型中,以生成与所述第一输入问题对应的嵌入向量;[0103] S6、根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到多个匹配答案;[0104] S7、将第一输入问题与多个匹配答案作为上下文输入至LLM模型,输出回答文本信息;[0105] S8、判断在预设时间内是否接收到根据回答文本信息返回的反馈信息;[0106] S9、若接收到根据回答文本信息返回的反馈信息,获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤。[0107] 如上述步骤S1?S9所述,现有技术中传统校园知识问答系统均需要设计大量的高质量问答样本数据,其实质就是对学校各类信息进行统计分类,所采用的技术普遍为基于规则匹配或者关键词检索技术,然而传统的基于规则或模板检索关键词的方法需要专业人员创建大量的模板和规则,不仅耗费大量时间和人力,也不能真正理解用户问题的语义特征而造成低效率的回答,而且没有办法解决校园知识不断迅速更新的问题,可移植性也较差。深度学习方法要求处理的文本是连续的,而校园数据通常种类较多且不连续,此外,深度学习方法所对应的模型通常需要大量的标记数据来训练,而大规模标注数据非常昂贵和耗时,标注数据的稀缺性限制了深度学习方法的性能,部分研究人员提出通过训练好的大语言模型或者直接使用私有数据微调大语言模型,在本地部署问答系统,但是这样需要耗费大量人力物力,且无法包含所有的问题种类,需要时常更新问答数据库,流程繁琐,效率低下,且每个学校的数据都存在区别,单个学校的数据量相对于大语言模型来说又较少,因此少量数据进行训练导致问答系统准确率较低;基于此,本申请首先对校园数据进行获。T笆菘梢园ㄑ植、中心知识库、研究生手册、师生信息等资源数据,因此校园数据中存在隐私数据,由于校园数据中包含隐私数据,若直接将隐私数据输入大语言模型中,会在大语言模型中保留一定的数据特征,造成数据泄露,因此本申请在获取到校园数据后,先对校园数据进行预处理,这样可以从源头处杜绝生成式大语言模型对真实数据的特征记录和学习以造成的隐私泄露;预处理完成后,基于预处理得到的文本数据进行分割,将其分割为多个文本块,并对其进行向量化,将向量化得到的第一文本向量数据存储至LangChain框架的文本向量数据库中,具体的,可基于文本分割器对文本数据进行分割,相较于现有技术中采用例如fine?tuning(微调)模型进行分割,使用文本分割器不需要对文本数据进行训练,并且能够实时添加新的内容,且不用每次加入新的内容就训练一次,这对于时常需要更新内容的校园数据来说,使用文本分割器进行分割,并对其进行向量化能够提高其分割效率,降低分割成本,通过对文本块进行向量化,能够使其直接转换为稀疏向量,便于后期数据的处理;之后可构建Embedding模型,并获取训练数据以对Embedding模型进行训练,Embedding模型是一种在机器学习和自然语言处理领域常用的技术,它旨在将高维度的数据映射到低维度的空间中。通过将第一文本向量数据输入至Embedding模型中进行向量化,得到第二文本向量数据,能够降低第二文本向量的维度,Embedding模型擅长处理高维稀疏向量,通过Embedding模型起到降维、防止参数爆炸的同时,还能够实现稀疏向量稠密化,因此针对校园数据这种数据量较少的,优先考虑使用Embedding模型,这样能够使得生成的第二文本向量数据稠密化,从而能够提高第二文本向量数据的综合信息能力;当用户需要进行查询时,可获取第一输入问题并经过Embedding模型得到与第一输入问题对应的嵌入向量,基于相似性计算从第二文本向量数据中匹配到与嵌入向量最相似的多个匹配答案,再将第一输入问题与多个匹配答案作为上下文输入至LLM模型中,以输出回答文本信息,在生成回答文本信息后,并不是直接退出,本申请还在判断在预设时间内是否接收到根据回答文本信息返回的反馈信息,通过反馈信息可以了解到用户的满意程度,若反馈信息为用户不满意,则获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤中,直至反馈信息为用户满意为止,这样相比于直接将校园数据输入大语言模型中输出回答文本信息,本申请提高了学校数据的整体可用性,与调研所知的现有校园知识问答系统方案相比,本申请拥有更好的问题理解和答案生成能力,能够适应不同的应用场景和问题类型,可有效提高校园生活知识问答系统的准确率和智能化水平,在一定程度上提高数字校园智能问答服务的准确率。需要说明的是,本申请中的步骤不仅适用于校园数据,也适用于医院数据、公司数据等少量数据,在此不做唯一限定。[0108] 在一个实施例中,所述获取校园数据,并对校园数据进行预处理,得到文本数据的步骤S1,包括:[0109] S11、获取校园数据,其中,所述校园数据包括多个数据类型以及每个数据类型对应的数据内容;[0110] S12、判断多个数据类型以及多个数据类型对应的数据内容是否符合预设安全条件;[0111] S13、若多个数据类型以及多个数据类型中有任意一个数据类型和/或数据类型所对应的数据内容不符合预设安全条件,则将该数据类型和/或数据类型所对应的数据内容定义为隐私数据;[0112] S14、对所述隐私数据进行文本提。玫蕉喔鲆私特征词;[0113] S15、将每个隐私特征词作为节点构建隐私特征图谱,其中,隐私特征图谱中相邻节点之间采用连接线进行连接,且若存在相同隐私特征词,则将相同隐私特征词所对应的节点记为一个;[0114] S16、获取每个节点所对应的脱敏预测损失值以及每个节点与相邻节点连接的关联权重值;[0115] S17、根据所述隐私特征图谱计算每个节点的隐私度值,其中,计算公式为:[0116][0117] 其中,所述Ri表示第i个节点的隐私度值,A表示所有指向Ri节点的集合,xi,j表示第i个节点与第j个节点连接的关联权重值,xi,k表示第i个节点与第k个节点连接的关联权重值,B表示由节点Ri连接出去的节点的集合,Si表示第i个节点在隐私特征图谱中的排序值,Li表示第i个节点所对应的脱敏预测损失值;[0118] S18、从多个节点的隐私度值中提取最大值作为隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息;[0119] S19、对所述映射关键信息进行对称加密,得到加密数据;[0120] S191、将加密数据增加至对应的隐私数据,并对增加了加密数据的隐私数据进行脱敏处理,得到文本数据。[0121] 如上述步骤S11?S191所述,由于校园数据中除了知识数据外,还包括师生数据、研究数据等隐私数据,为了对其更好的进行保护,防止在后续的模型中残留部分隐私数据,本实施例在获取到校园数据后,对其校园数据中的数据类型和对应的数据内容进行隐私性判断,从而将隐私数据从校园数据中筛选出来,而不是对整体校园进行隐私保护,这样能够降低运算的复杂程度,且仅对隐私数据进行保护,也能整体提高校园数据的真实性,便于提高后期生成的回答文本信息的准确率;具体的,在筛选出隐私数据后,对隐私数据中的隐私特征词进行提。⒒诙喔鲆私特征词构建隐私特征图谱,在隐私特征图谱中,将每个隐私特征词作为一个节点并对其进行编号,节点与节点之间的关系通过连接线进行相连,这样可通过每个节点所拥有的连接线判断该隐私特征词在该段数据内容中重要隐私程度,从而基于连接线的数量获取其对应的脱敏预测损失值,脱敏预测损失值表示该隐私特征词进行脱敏后所造成的损失精度;且在某些数据内容中,单个的隐私特征词其代表的隐私程度较低,但是与其他隐私特征词结合起来,会提高其隐私程度,因此本实施例除了考虑单个隐私特征词所带来的隐私性影响之外,也考虑隐私特征词与隐私特征词之间结合所带来的隐私性影响,因此,还需要对每个节点与相邻节点连接的关联权重值进行获。ü袢」亓ㄖ刂,能够了解到其结合所带来的隐私程度,从而基于隐私特征图谱、脱敏预测损失值以及关联权重值计算每个节点的隐私度值,这样计算出来的隐私度值能够更加精确的表达出该隐私特征词的隐私程度,计算出每个隐私特征词的隐私度值之后,选择隐私度最大值作为该隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息,对映射关键信息进行加密,并将其增加至对应的隐私数据中,再对整体隐私数据进行脱敏处理,得到文本数据,这样能够查找出隐私数据中的隐私度最高的值,并对其进行单独加密,之后再将其与其他隐私数据进行退敏,从而可加深对隐私度较高的隐私特征词的隐私保护,降低信息泄露的风险。需要说明的是,上述所述的为仅有任意一个数据类型和/或数据类型所对应的数据内容为隐私数据时所采取的步骤,因此其仅对应生成一个隐私特征图谱,当隐私数据为多个时,则生成多个隐私特征图谱,其过程与上述一致,在此不做赘述。[0122] 在一个实施例中,所述根据预设条件将文本数据分割为多个文本块的步骤S2,包括:[0123] S21、按预设条件对文本数据进行语句划分,得到多个语言数据;[0124] S22、遍历所有语言数据,判断每个语言数据是否属于目标栈;[0125] S23、若该语言数据不属于目标栈,将该语言数据记为分割点,遍历完成后,得到多个分割点;[0126] S24、对分割点与分割点之间的语言数据进行拼接,得到多个拼接文本;[0127] S25、遍历所有拼接文本,判断拼接文本与两端分割点是否为正向拼接,将为正向拼接的分割点记为第一分割点;[0128] S26、将拼接文本与第一分割点进行拼接,得到文本块;[0129] S27、遍历完成后,得到多个文本块。[0130] 如上述步骤S21?S27所述,在对文本数据进行分割时,首先按照预设条件对文本数据进行语句划分,其中,预设条件可以是按段划分、按句划分、按章节划分、按词语划分或其他,按照需求划分即可,此处不做唯一限制;划分之后,得到多个语言数据,并以此判断每个语言数据是否属于目标栈,目标栈即为目标主题,若不属于,则将该语言数据记为分割点,遍历所有语言数据后,得到多个分割点,对分割点之间的语言数据进行拼接,得到多个拼接文本,本实施例在分割完成后,判断拼接文本与两端分割点是否为正向拼接,正向拼接即该分割点与拼接文本属于相同的目标主题,将拼接文本与第一分割点进行拼接,得到文本块,这样能够避免将分割点与其他类型的主题进行拼接,能够提高分割的准确率。[0131] 在一个实施例中,所述构建Embedding模型,并获取训练数据以对Embedding模型进行训练的步骤S3,包括:[0132] S31、基于深度学习框架构建Embedding模型;[0133] S32、设定Embedding模型的输入维度和输出维度;[0134] S33、设定Embedding模型的优化器、损失函数以及评估指标;[0135] S34、获取训练数据以对Embedding模型进行训练,在训练过程中,Embedding模型根据输出结果对损失函数进行最小化定义,以完成Embedding模型的训练。[0136] 如上述步骤S31?S34所述,通过构建Embedding模型,这样便于对校园数据进行低维度的转换,在对Embedding模型进行训练时,获取训练数据对其训练,而不是使用校园数据直接训练,这样能够避免校园数据在训练过程中留下数据残留,训练数据可以是校园数据的近似数据,在构建Embedding模型时,可根据数据类型设置不同的需求的输入维度和输出维度、优化器、损失函数以及评估指标等,此处不做唯一限定。[0137] 在一个实施例中,所述将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据的步骤S4,包括:[0138] S41、获取第一文本向量数据,并基于第一文本向量数据建立数字编码表,其中,所述第一文本向量数据包括多个词向量以及上下文关系向量,所述数字编码表包括上下文关系向量与对应的多个词向量的映射关系;[0139] S42、获取Embedding模型的输入维度,并根据输入维度构建标准矩阵列表;[0140] S43、基于标准矩阵列表对数字编码表进行维度矩阵转换,得到多个语义矩阵以及多个语义矩阵列表;[0141] S44、按照多个语义矩阵列表的顺序将多个语义矩阵输入Embedding模型中进行向量化,并输出第二文本向量数据。[0142] 如上述步骤S41?S44所述,在将第一文本向量数据输入Embedding模型之前,为了更好的对语义进行理解,可基于第一文本向量数据建立数字编码表,即将第一文本向量数据以数字编码表的形式进行表示,并获取Embedding模型的输入维度,从而基于输入维度构建标准矩阵列表,基于标准矩阵列表对数字编码表进行维度矩阵转换,从而可得到多个语义矩阵以及多个语义矩阵列表,若直接将第一文本向量数据转换为矩阵列表,容易忽略词向量与词向量之间的上下文关系,造成语义缺失信息,因此通过建立数字编码表可以从表中了解到各向量之间的映射关系,再根据数字编码表进行矩阵转换,并将转换后的多个语义矩阵列表的顺序将多个语义矩阵输入Embedding模型中进行向量化,得到第二文本向量数据,这样能使生成的第二任文本向量数据尽可能的准确、完整以及客观的表达校园数据的语义。[0143] 在一个实施例中,所述根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到相似度最高的多个匹配答案的步骤S6,包括:[0144] S61、基于余弦相似度原理计算所述嵌入向量与第二文本向量数据的多个余弦值,其中,所述第二文本向量数据包括多个第二文本向量;[0145] S62、根据多个余弦值从第二文本向量数据中选择topk个相似度最高的第二文本向量,作为第一答案向量;[0146] S63、根据所述嵌入向量获取备选问题向量;[0147] S64、基于余弦相似度原理计算所述嵌入向量与所述备选问题向量的相似度;[0148] S65、判断所述相似度是否为预设值;[0149] S66、若所述相似度为预设值,获取与所述备选问题向量对应的topn个相似度最高第二答案向量,其中,topk个第二文本向量的k值与topn个第二答案向量的n值相等;[0150] S67、将topn个第二答案向量与topk个第一答案向量按照相似度最高的顺序依次进行融合,得到多个匹配答案。[0151] 如上述步骤S61?S67所述,使用余弦相似度计算嵌入向量与第二文本向量数据之间的相似性,即计算两个向量之间的余弦值,范围在?1到1之间,1表示完全相似,?1表示完全相反,0表示没有相似性,根据相似性度量的值,进行比较和评估,相似性度量越大,对象之间的相似性越高,因此可通过相似性计算从第二文本向量数据中匹配到与嵌入向量最相似的topk个文本向量作为第一答案向量,其中,k的取值范围可以根据自定义,在此不做限定;由于校园数据经常进行更新,因此经常会增加新的第二文本向量,为了更完整的对问题进行回答,本实施例在得到第一答案向量后,基于嵌入向量获取备选问题向量,并基于余弦相似度计算两者的相似度,若相似度为预设值,则获取备选问题向量对应的topn个相似度最高的第二答案向量,其中,n的取值范围与k一致,将topn个第二答案向量与topk个第一答案向量按照相似度最高的顺序依次进行融合,即topn=1的第二答案向量与topk=1的第一答案向量进行融合,topn=2的第二答案向量与topk=2的第一答案向量进行融合,得到多个匹配答案,这样能对匹配答案进行补充,使其的回答更加完整。[0152] 在一个实施例中,所述获取至少一个与所述第一输入问题相关的第二输入问题的步骤S9,包括:[0153] S91、获取第一输入问题中的至少一个关键词以及至少一个上下文语境词;[0154] S92、获取与至少一个所述关键词对应的关键向量;[0155] S93、获取与至少一个所述上下文语境词对应的语境向量;[0156] S94、根据所述关键向量和所述语境向量计算关联值,其中,计算公式为:[0157][0158] 其中,所述S表示关联值,f(a)表示关键向量,f(A)表示关键向量所对应的权重,f(b)表示语境向量,f(B)表示语境向量所对应的权重;[0159] S95、获取与所述关联值对应的近义词向量;[0160] S96、根据所述近义词向量与语境向量生成问题向量,根据所述问题向量生成第二输入问题。[0161] 如上述步骤S91?S96所述,通过获取第一输入问题中的至少一个关键词以及至少一个上下文语境词,这样可基于对应的关键向量和语境向量计算两者的关联值,通过计算关联值有助于了解到关键词在上下文语境中的合理性,从而可根据关联值获取对应的近义词向量,从而使得近义词向量在逻辑上符合第一输入问题,有助于使得生成的第二输入问题更加准确,与第一输入问题更加贴合。[0162] 本申请还提供一种基于LLM的数字校园智能问答服务系统,包括:[0163] 预处理模块1,用于获取校园数据,并对校园数据进行预处理,得到文本数据;[0164] 分割模块2,用于根据预设条件将文本数据分割为多个文本块,并对多个所述文本块进行向量化,得到第一文本向量数据;[0165] 构建模块3,用于构建Embedding模型,并获取训练数据以对Embedding模型进行训练;[0166] 向量化模块4,用于将第一文本向量数据输入Embedding模型中进行向量化,得到第二文本向量数据;[0167] 获取模块5,用于获取第一输入问题,并将第一输入问题输入至Embedding模型中,以生成与所述第一输入问题对应的嵌入向量;[0168] 相似度匹配模块6,用于根据所述嵌入向量对第二文本向量数据进行相似度匹配搜索,得到多个匹配答案;[0169] LLM模型模块7,用于将第一输入问题与多个匹配答案作为上下文输入至LLM模型,输出回答文本信息;[0170] 判断模块8,用于判断在预设时间内是否接收到根据回答文本信息返回的反馈信息;[0171] 反馈模块9,用于若接收到根据回答文本信息返回的反馈信息,获取至少一个与所述第一输入问题相关联的第二输入问题,并将第二输入问题作为第一输入问题返回至所述并将第一输入问题输入至Embedding模型中的步骤。[0172] 在一个实施例中,所述预处理模块1,包括:[0173] 第一获取数据单元,用于获取校园数据,其中,所述校园数据包括多个数据类型以及每个数据类型对应的数据内容;[0174] 判断单元,用于判断多个数据类型以及多个数据类型对应的数据内容是否符合预设安全条件;[0175] 若多个数据类型以及多个数据类型中有任意一个数据类型和/或数据类型所对应的数据内容不符合预设安全条件,则将该数据类型和/或数据类型所对应的数据内容定义为隐私数据;[0176] 文本提取单元,用于对所述隐私数据进行文本提。玫蕉喔鲆私特征词;[0177] 构建单元,用于将每个隐私特征词作为节点构建隐私特征图谱,其中,隐私特征图谱中相邻节点之间采用连接线进行连接,且若存在相同隐私特征词,则将相同隐私特征词所对应的节点记为一个;[0178] 第二获取单元,用于获取每个节点所对应的脱敏预测损失值以及每个节点与相邻节点连接的关联权重值;[0179] 计算单元,用于根据所述隐私特征图谱计算每个节点的隐私度值,其中,计算公式为:[0180][0181] 其中,所述Ri表示第i个节点的隐私度值,A表示所有指向Ri节点的集合,xi,j表示第i个节点与第j个节点连接的关联权重值,xi,k表示第i个节点与第k个节点连接的关联权重值,B表示由节点Ri连接出去的节点的集合,Si表示第i个节点在隐私特征图谱中的排序值,Li表示第i个节点所对应的脱敏预测损失值;[0182] 提取单元,用于从多个节点的隐私度值中提取最大值作为隐私特征图谱的特征值,并将特征值与对应的隐私特征词进行映射,得到映射关键信息;[0183] 加密单元,用于对所述映射关键信息进行对称加密,得到加密数据;[0184] 脱敏单元,用于将加密数据增加至对应的隐私数据,并对增加了加密数据的隐私数据进行脱敏处理,得到文本数据。[0185] 在一个实施例中,所述分割模块2,包括:[0186] 划分单元,用于按预设条件对文本数据进行语句划分,得到多个语言数据;[0187] 第一遍历单元,用于遍历所有语言数据,判断每个语言数据是否属于目标栈;[0188] 若该语言数据不属于目标栈,将该语言数据记为分割点,遍历完成后,得到多个分割点;[0189] 拼接单元,用于对分割点与分割点之间的语言数据进行拼接,得到多个拼接文本;[0190] 第二遍历单元,用于遍历所有拼接文本,判断拼接文本与两端分割点是否为正向拼接,将为正向拼接的分割点记为第一分割点;[0191] 第二拼接单元,用于将拼接文本与第一分割点进行拼接,得到文本块,遍历完成后,得到多个文本块。[0192] 需要说明的是,基于LLM的数字校园智能问答服务系统中的各模块、单元均与基于LLM的数字校园智能问答服务方法中的步骤对应。[0193] 需要说明的是,在本文中,术语“包括”、“包含”或者其任何其它变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、装置、物品或者方法不仅包括那些要素,而且还包括没有明确列出的其它要素,或者是还包括为这种过程、装置、物品或者方法所固有的要素。在没有更多限制的情况下,由语句“包括一个……”限定的要素,并不排除在包括该要素的过程、装置、物品或者方法中还存在另外的相同要素。[0194] 以上所述仅为本申请的优选实施例,并非因此限制本申请的专利范围,凡是利用本申请说明书及附图内容所作的等效结构或等效流程变换,或直接或间接运用在其他相关的技术领域,均同理包括在本申请的专利保护范围内。
专利地区:内蒙古
专利申请日期:2024-03-21
专利公开日期:2024-11-29
专利公告号:CN118194993B