一种模型编辑的方法和装置与流程

专利2026-07-23  5


本发明涉及计算机,更具体地,涉及一种模型编辑的方法和装置。


背景技术:

1、随着科技的发展,智能问答系统的应用越来越广泛,具体的,用户向智能问答系统提出问题后,智能问答系统会针对用户提出的问题给出答案,上述问答过程可以通过大规模语言模型llms实现,上述llms具备理解、分析和生成文本的能力;上述llms存在一个重要的缺点,即由于其庞大的参数数量,预训练的计算成本巨大,当需要将新知识引入到预训练的llms时,考虑到计算资源和数据资源的开销,无法从头开始进行训练,因此,需要在引入新知识时,精确地修改llms中特定的知识参数。

2、现有技术中,采用序列化模型编辑sme方法对llm进行编辑,但上述sme方法仅适用于单次编辑和简单知识编辑的情况,上述sme方法只能处理规模较小的数据量,对于长序列知识编辑仍然面临很大的挑战;并且,在涉及对多条知识进行序列编辑的场景下,只能进行多次编辑,多次编辑会导致在编辑过程中llms的通用能力退化,产生遗忘问题,进而导致在编辑过程中影响llms中的其它参数,使上述llms产生幻觉现象。

3、综上所述,如何降低llms在编辑过程中产生的能力退化问题,是目前需要解决的问题。


技术实现思路

1、有鉴于此,本发明实施例提供了一种模型编辑的方法和装置,可以实现终身模型编辑,并降低llms在编辑过程中产生的能力退化问题。

2、第一方面,本发明实施例提供了一种模型编辑的方法,所述方法包括:

3、确定三组待编辑查询语句,其中,每组所述待编辑查询语句中包括至少一个待编辑查询语句;

4、根据每组所述待编辑查询语句,在知识数据库中检索到其对应的至少一条知识数据;

5、分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的增强表征;

6、根据所述增强表征确定每组所述待编辑查询语句中每一个待编辑查询语句对应的提示字符表征;

7、确定每组所述待编辑查询语句中每一个待编辑查询语句对应的输入嵌入表征;

8、根据每组所述待编辑查询语句中所述每一个待编辑查询语句对应的提示字符表征和所述输入嵌入表征的组合,对大规模语言模型进行编辑,生成更新后的大规模语言模型,并生成至少一个语义向量;

9、根据所述三组待编辑查询语句分别对应的语义向量以及所述增强表征确定损失函数;

10、根据所述损失函数对所述更新后的大规模语言模型进行编辑生成目标大规模语言模型。

11、可选的,所述根据每组所述待编辑查询语句,在知识数据库中检索到其对应的至少一条知识数据,具体包括:

12、在所述知识数据库中,通过检索增强生成的方法检索到所述每组所述待编辑查询语句中每一条所述待编辑查询语句对应的至少一条知识谱图;

13、根据所述至少一条知识图谱生成所述至少一条知识数据。

14、可选的,所述分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的增强表征,具体包括:

15、分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的语义表征;

16、将所述语义表征生成所述增强表征。

17、可选的,所述将所述语义表征生成所述增强表征,具体包括:

18、将每组所述待编辑查询语句的语义表征输入到第一多层感知器层,生成所述待编辑查询语句对应的增强表征。

19、可选的,所述将所述语义表征生成所述增强表征,具体包括:

20、将所述至少一条知识数据的语义表征输入到第二多层感知器层,生成所述至少一条知识数据对应的增强表征。

21、可选的,所述根据所述增强表征确定每组所述待编辑查询语句中每一个待编辑查询语句对应的提示字符表征,具体包括:

22、将所述至少一条知识数据对应的增强表征输入到第三多层感知器层,然后通过激活函数生成所述至少一条知识数据对应的提示字符表征;

23、确定每组所述待编辑查询语句中每一个待编辑查询语句对应的最大相似度索引,其中,所述最大相似度索引表征与所述每一个待编辑查询语句的相似度最大的知识数据的索引;

24、根据所述最大相似度索引确定所述每一个待编辑查询语句对应的提示字符表征。

25、可选的,所述损失函数包括编辑损失函数和提示学习损失函数,所述编辑损失函数包括可靠性能损失函数、通用性能损失函数和泛化性能损失函数。

26、第二方面,本发明实施例提供了一种模型编辑的装置,所述装置包括:

27、确定单元,用于确定三组待编辑查询语句,其中,每组所述待编辑查询语句中包括至少一个待编辑查询语句;

28、检索单元,用于根据每组所述待编辑查询语句,在知识数据库中检索到其对应的至少一条知识数据;

29、所述确定单元,还用于分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的增强表征;

30、所述确定单元,还用于根据所述增强表征确定每组所述待编辑查询语句中每一个待编辑查询语句对应的提示字符表征;

31、所述确定单元,还用于确定每组所述待编辑查询语句中每一个待编辑查询语句对应的输入嵌入表征;

32、生成单元,用于根据每组所述待编辑查询语句中所述每一个待编辑查询语句对应的提示字符表征和所述输入嵌入表征的组合,对大规模语言模型进行编辑,生成更新后的大规模语言模型,并生成至少一个语义向量;

33、所述确定单元,还用于根据所述三组待编辑查询语句分别对应的语义向量以及所述增强表征确定损失函数;

34、所述生成单元,还用于根据所述损失函数对所述更新后的大规模语言模型进行编辑生成目标大规模语言模型。

35、可选的,所述检索单元具体用于:

36、在所述知识数据库中,通过检索增强生成的方法检索到所述每组所述待编辑查询语句中每一条所述待编辑查询语句对应的至少一条知识谱图;

37、根据所述至少一条知识图谱生成所述至少一条知识数据。

38、可选的,所述确定单元具体用于:

39、分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的语义表征;

40、将所述语义表征生成所述增强表征。

41、可选的,所述确定单元具体用于:

42、将每组所述待编辑查询语句的语义表征输入到第一多层感知器层,生成所述待编辑查询语句对应的增强表征。

43、可选的,所述确定单元具体用于:

44、将所述至少一条知识数据的语义表征输入到第二多层感知器层,生成所述至少一条知识数据对应的增强表征。

45、可选的,所述确定单元具体还用于:

46、将所述至少一条知识数据对应的增强表征输入到第三多层感知器层,然后通过激活函数生成所述至少一条知识数据对应的提示字符表征;

47、确定每组所述待编辑查询语句中每一个待编辑查询语句对应的最大相似度索引,其中,所述最大相似度索引表征与所述每一个待编辑查询语句的相似度最大的知识数据的索引;

48、根据所述最大相似度索引确定所述每一个待编辑查询语句对应的提示字符表征。

49、可选的,所述损失函数包括编辑损失函数和提示学习损失函数,所述编辑损失函数包括可靠性能损失函数、通用性能损失函数和泛化性能损失函数。

50、第三方面,本发明实施例提供了一种电子设备,包括存储器和处理器,所述存储器用于存储一条或多条计算机程序指令,其中,所述一条或多条计算机程序指令被所述处理器执行以实现如第一方面或第一方面任一种可能中任一项所述的方法。

51、第四方面,本发明实施例提供了一种计算机可读存储介质,其上存储计算机程序指令,所述计算机程序指令在被处理器执行时实现如第一方面或第一方面任一种可能中任一项所述的方法。

52、本发明实施例中,通过确定三组待编辑查询语句,其中,每组所述待编辑查询语句中包括至少一个待编辑查询语句;根据每组所述待编辑查询语句,在知识数据库中检索到其对应的至少一条知识数据;分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的增强表征;根据所述增强表征确定每组所述待编辑查询语句中每一个待编辑查询语句对应的提示字符表征;确定每组所述待编辑查询语句中每一个待编辑查询语句对应的输入嵌入表征;根据每组所述待编辑查询语句中所述每一个待编辑查询语句对应的提示字符表征和所述输入嵌入表征的组合,对大规模语言模型进行编辑,生成更新后的大规模语言模型,并生成至少一个语义向量;根据所述三组待编辑查询语句分别对应的语义向量以及所述增强表征确定损失函数;根据所述损失函数对所述更新后的大规模语言模型进行编辑生成目标大规模语言模型。通过上述方法,采用检索增强生成从知识数据库中检索到每个待编辑查询语句对应的至少一条知识数据,经过增强表征后进一步进行压缩,生成提示字符表征,根据提示字符表征和输入嵌入表征的组合确定语义向量,由于存在三组待编辑查询语句,可以确定出可靠性,通用性,泛化性分别对应的三种损失函数,以及提示学习损失函数,根据多种损失函数对大规模语言模型进行编辑生成目标大规模语言模型。由于上述模型编辑的方法不改变大规模数据模型的内部参数,仅对新知识进行编辑,因此,可以实现终身模型编辑,并降低llms在编辑过程中产生的能力退化问题。


技术特征:

1.一种模型编辑的方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述根据每组所述待编辑查询语句,在知识数据库中检索到其对应的至少一条知识数据,具体包括:

3.根据权利要求1所述的方法,其特征在于,所述分别确定每组所述待编辑查询语句以及其对应的至少一条知识数据的增强表征,具体包括:

4.根据权利要求3所述的方法,其特征在于,所述将所述语义表征生成所述增强表征,具体包括:

5.根据权利要求3所述的方法,其特征在于,所述将所述语义表征生成所述增强表征,具体包括:

6.根据权利要求1所述的方法,其特征在于,所述根据所述增强表征确定每组所述待编辑查询语句中每一个待编辑查询语句对应的提示字符表征,具体包括:

7.根据权利要求1所述的方法,其特征在于,所述损失函数包括编辑损失函数和提示学习损失函数,所述编辑损失函数包括可靠性能损失函数、通用性能损失函数和泛化性能损失函数。

8.一种模型编辑的装置,其特征在于,所述装置包括:

9.一种电子设备,包括存储器和处理器,其特征在于,所述存储器用于存储一条或多条计算机程序指令,其中,所述一条或多条计算机程序指令被所述处理器执行以实现如权利要求1-7中任一项所述的方法。

10.一种计算机可读存储介质,其特征在于,所述计算机可读存储


技术总结
本发明实施例公开了一种模型编辑的方法和装置。本发明实施例中,通过确定三组待编辑查询语句,在知识数据库中检索到其对应的至少一条知识数据;确定每组待编辑查询语句以及至少一条知识数据的增强表征;根据增强表征确定对应的提示字符表征;确定每一个待编辑查询语句对应的输入嵌入表征;根据提示字符表征和输入嵌入表征的组合,对大规模语言模型进行编辑,生成更新后的大规模语言模型,并生成至少一个语义向量;根据三组待编辑查询语句分别对应的语义向量以及增强表征确定损失函数;根据损失函数对所述更新后的大规模语言模型进行编辑生成目标大规模语言模型。通过上述方法,可以实现终身模型编辑,并降低LLMs在编辑过程中产生的能力退化问题。

技术研发人员:张涛林,陈颀周,李东阳,汪诚愚,黄龙涛,薛晖
受保护的技术使用者:阿里巴巴(中国)有限公司
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-22991.html

最新回复(0)