本公开涉及模型训练领域,尤其涉及一种代码续写模型推理方法、装置、设备及存储介质。
背景技术:
1、随着信息化生产过程中项目规模的扩大,流程和工艺愈加复杂。虽然在信息化项目编程过程中有处理各种异常情况的操作基准,已经训练完成的代码续写大模型在面对实际项目会有泛化性不足的问题,在实际操作中需要依靠大量专业技术人员掌握和积累的丰富经验。为了将这些应对各类情况的主观专家经验以规范的格式保存下来,系统化地应用到不同计算机项目场景中,消除由于普通程序员水平和认知差异,以及人员的流动而影响性能的准确性,对知识进行提取和表示就显得尤为重要。规范化提取的知识可以大大增加代码续写大模型的知识储备和泛化能力,以及认知经验积累年限,快速响应,增强代码续写大模型应用的兼容性和互操作性。
2、然而,目前计算机系统项目生产过程中的知识提取和表示存在下述问题:(1)没有充分利用项目经验信息(2)无法进行在线自主增量式知识学习。基于面向代码续写大语言模型在线运行推理场景的自主增量知识提取和表示方法可以减少规则的精确化和完备化编写,减少大量人工构造数据集和数据标注成本,并且随着代码续写推理系统的运行自主更新优化。
技术实现思路
1、本公开提供了一种代码续写模型推理方法、装置、设备及存储介质,以至少解决现有技术中存在的以上技术问题。
2、根据本公开的第一方面,提供了一种代码续写模型推理方法,包括:
3、基于代码续写插件获取历史时间数据、代码上文数据和代码推理数据,基于所述历史数据、所述代码上文数据和所述代码推理数据构建经验数据库;
4、基于所述经验数据库构建相似度函数,基于所述相似度函数计算代码推理相似的数据向量,基于所述代码推理相似数据向量生成初始参数预测估计值;
5、将所述初始参数预测估计值作为所述第一学习网络的输入生成参数预测估计值;
6、将所述参数预测估计值和下一时刻的时间点作为模型参数,输入所述相似度函数和所述第一学习网络中,得到下一时刻的代码推理结果。
7、在一可实施方式中,所述基于所述历史时间数据、所述代码上文数据和所述代码推理数据构建经验数据库,包括:
8、基于所述历史时间数据、所述代码上文数据和所述代码推理数据建立第一上下文推理关系数据库;
9、将所述第一上下文推理关系数据库中的数据格式进行合并,过滤掉重复信息,并将同类的所述代码上文数据进行收集,得到第二上下文推理关系数据库;
10、获取用户端的第一历史填充信息、第二历史填充信息和未被用户采纳的第三历史填充信息,将所述第一历史填充信息、第二历史填充信息和第三历史填充信息合并为填充数据集;
11、基于相同时刻分别将所述第二上下文推理关系数据库与所述填充数据集相关联,构建数据关联空间,生成经验数据库。
12、在一可实施方式中,所述基于所述经验数据库构建相似度函数,基于所述相似度函数计算代码推理相似的数据向量,包括:
13、所述经验数据库中数据的基本信息单元包括上下文向量单元、填充向量单元和主观策略向量单元,基于所述上下文向量单元获取当前时刻上下文向量;
14、获取第一超参数和第二超参数,基于所述第一超参数、所述第二超参数、所述填充向量单元、所述上下文向量单元和所述当前时刻上下文向量构建相似度函数;
15、将当前时刻的上下文向量作为所述相似度函数的输入,计算所述当前时刻的上下文向量与所述经验数据库中数据向量的相似度,基于所述相似度查找至少一个与所述当前时刻的上下文向量相似的数据向量。
16、在一可实施方式中,所述基于所述代码推理相似数据向量生成初始参数预测估计值,包括:
17、基于所述相似度函数计算第一权重系数,基于所述第一权重系数和所述填充向量单元计算初始参数预测估计值。
18、在一可实施方式中,所述将所述初始参数预测估计值作为所述第一学习网络的输入生成参数预测估计值,包括:
19、获取当前时刻的上下文向量,将所述当前时刻的上下文向量和所述初始参数预测估计值作为参数,输入到所述第一学习网络,基于所述第一学习网络生成所述参数预测估计值。
20、在一可实施方式中,方法还包括:
21、将所述下一时刻的代码推理结果以网络单元的格式存入所述经验数据库,实现对所述经验数据库的更新;
22、基于更新后的所述经验数据库对所述第一学习网络进行离线优化和在线优化。
23、根据本公开的第二方面,提供了一种代码续写模型推理装置,所述装置包括:
24、数据库构建单元,用于基于代码续写插件获取历史时间数据、代码上文数据和代码推理数据,基于所述历史数据、所述代码上文数据和所述代码推理数据构建经验数据库;
25、相似度计算单元,用于基于所述经验数据库构建相似度函数,基于所述相似度函数计算代码推理相似的数据向量,基于所述代码推理相似数据向量生成初始参数预测估计值;
26、参数预测单元,用于将所述初始参数预测估计值作为所述第一学习网络的输入生成参数预测估计值;
27、推理单元,用于将所述参数预测估计值和下一时刻的时间点作为模型参数,输入所述相似度函数和所述第一学习网络中,得到下一时刻的代码推理结果。
28、在一可实施方式中,所述装置还包括:
29、数据更新单元,用于将所述下一时刻的代码推理结果以网络单元的格式存入所述经验数据库,实现对所述经验数据库的更新;基于更新后的所述经验数据库对所述第一学习网络进行离线优化和在线优化。
30、根据本公开的第三方面,提供了一种电子设备,包括:
31、至少一个处理器;以及
32、与所述至少一个处理器通信连接的存储器;其中,
33、所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行本公开所述的方法。
34、根据本公开的第四方面,提供了一种存储有计算机指令的非瞬时计算机可读存储介质,所述计算机指令用于使所述计算机执行本公开所述的方法。
35、本公开的一种代码续写模型推理方法、装置、设备及存储介质,通过收集数据建立经验数据库,基于经验数据构建相似度计算函数,利用相似度计算函数和第一学习网络实现对下一时刻的代码进行推理预测,并将预测结果存储至经验数据库用于数据库更新和第一学习网络的更新。减少规则精确化和完备化编写,大大提高模型泛化性;减少大量人工构造数据集和数据标注成本;能够在线自主增量式知识学习,充分利用项目信息进行模型更新和生成续写知识。
36、应当理解,本部分所描述的内容并非旨在标识本公开的实施例的关键或重要特征,也不用于限制本公开的范围。本公开的其它特征将通过以下的说明书而变得容易理解。
1.一种代码续写模型推理方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述基于所述历史时间数据、所述代码上文数据和所述代码推理数据构建经验数据库,包括:
3.根据权利要求1所述的方法,其特征在于,所述基于所述经验数据库构建相似度函数,基于所述相似度函数计算代码推理相似的数据向量,包括:
4.根据权利要求3所述的方法,其特征在于,所述基于所述代码推理相似数据向量生成初始参数预测估计值,包括:
5.根据权利要求1所述的方法,其特征在于,所述将所述初始参数预测估计值作为所述第一学习网络的输入生成参数预测估计值,包括:
6.根据权利要求1所述的方法,其特征在于,所述方法还包括:
7.一种代码续写模型推理装置,其特征在于,所述装置包括:
8.根据权利要求7所述的装置,其特征在于,所述装置还包括:
9.一种电子设备,其特征在于,包括:
10.一种存储有计算机指令的非瞬时计算机可读存储介质,其特征在于,所述计算机指令用于使计算机执行根据权利要求1-6中任一项所述的方法。
