本申请涉及数据处理,具体涉及一种大模型的敏感信息处理方法、计算机设备及存储介质。
背景技术:
1、大模型是一种通过海量数据训练的深度学习模型,具备生成自然语言文本和深入理解文本含义的能力,可以处理诸如文本摘要、问答、翻译等多样化的自然语言任务。然而,随着大模型在推理问答领域的应用逐渐广泛,一些问题也随之浮现。由于训练数据量、算法优化等因素的限制,大模型在回应用户问题及意图时,有时难以完全遵循当前的价值观导向,甚至可能产生违反现行法律的信息。这类敏感信息的发布不仅会造成不良的社会影响,还会降低用户的使用体验。
2、相应地,本领域需要一种新的大模型的敏感信息处理方案来解决上述问题。
技术实现思路
1、为了克服上述缺陷,提出了本申请,以解决或至少部分地解决大模型对用户问题进行回答时可能涉及敏感信息的技术问题。
2、在第一方面,提供一种大模型的敏感信息处理方法,所述方法包括:获取问题文本;将所述问题文本输入大模型进行推理,实时获取所述大模型生成的流式的答案文本,并缓存所述答案文本;获取所述答案文本的字数信息;基于所述答案文本的字数信息,对所述答案文本进行敏感词校验,所述敏感词校验包括常规校验或分段校验;基于所述答案文本的敏感词校验结果,输出所述答案文本。
3、在上述大模型的敏感信息处理方法的一个技术方案中,在将所述问题文本输入大模型进行推理前,所述方法还包括:调用敏感词服务对所述问题文本进行校验,判断所述问题文本是否包含组合敏感词;在所述问题文本不包含组合敏感词的情况下,将所述问题文本输入大模型进行推理;或,在所述问题文本包含组合敏感词的情况下,输出预设答案文本。
4、在上述大模型的敏感信息处理方法的一个技术方案中,所述基于所述答案文本的字数信息,对所述答案文本进行常规校验,包括:响应于所述答案文本的字数信息等于第一阈值,调用敏感词服务对所述答案文本进行校验,判断所述答案文本是否包含组合敏感词。
5、在上述大模型的敏感信息处理方法的一个技术方案中,所述基于所述答案文本的敏感词校验结果,输出所述答案文本,包括:在所述答案文本不包含组合敏感词的情况下,所述答案文本的敏感词校验结果为校验通过,输出所述答案文本;或,在所述答案文本包含组合敏感词的情况下,所述答案文本的敏感词校验结果为校验不通过,输出预设答案文本。
6、在上述大模型的敏感信息处理方法的一个技术方案中,所述基于所述答案文本的字数信息,对所述答案文本进行分段校验,包括:响应于所述答案文本的字数信息大于第一阈值,采用预设滑动窗口基于预设步长对所述答案文本进行滑动截取,得到多个文本片段;调用敏感词服务对每个所述文本片段进行校验,判断所述文本片段是否包含组合敏感词。
7、在上述大模型的敏感信息处理方法的一个技术方案中,所述基于所述答案文本的敏感词校验结果,输出所述答案文本,还包括:在所述文本片段不包含组合敏感词的情况下,所述文本片段的敏感词校验结果为校验通过,将校验通过的所述文本片段与已输出的所述答案文本进行整合输出。
8、在上述大模型的敏感信息处理方法的一个技术方案中,所述方法还包括:在所述文本片段包含组合敏感词的情况下,所述文本片段的敏感词校验结果为校验不通过,对已输出的所述答案文本执行撤回操作,并输出预设答案文本。
9、在上述大模型的敏感信息处理方法的一个技术方案中,所述方法还包括:获取敏感词集合,所述敏感词集合中包括多个敏感词;对所述敏感词集合中的敏感词进行组合,获得多个组合敏感词;基于所述多个组合敏感词和确定有穷自动机算法构建敏感词服务,所述敏感词服务用于校验文本是否包含组合敏感词。
10、在第二方面,提供一种计算机设备,该计算机设备包括至少一个处理器;以及,与所述至少一个处理器通信连接的存储器;其中,所述存储器中存储有计算机程序,所述计算机程序被所述至少一个处理器执行时实现上述大模型的敏感信息处理方法的技术方案中任一项技术方案所述的方法。
11、在第三方面,提供一种计算机可读存储介质,该计算机可读存储介质其中存储有多条程序代码,所述程序代码适于由处理器加载并运行以执行上述大模型的敏感信息处理方法的技术方案中任一项技术方案所述的方法。
12、本申请上述一个或多个技术方案,至少具有如下一种或多种有益效果:
13、本申请提供的大模型的敏感信息处理方法,包括:获取问题文本;将所述问题文本输入大模型进行推理,实时获取所述大模型生成的流式的答案文本,并缓存所述答案文本;获取所述答案文本的字数信息;基于所述答案文本的字数信息,对所述答案文本进行敏感词校验,所述敏感词校验包括常规校验或分段校验;基于所述答案文本的敏感词校验结果,输出所述答案文本。本申请获取大模型基于问题文本推理生成的流式答案文本,对答案文本进行缓存,并基于答案文本的字数信息,对答案文本执行常规校验或分段校验,进而基于答案文本的校验结果,将答案文本进行输出,能够有效检测并处理大模型生成的答案中涉及的敏感信息,增强输出内容的安全性和规范性,从而进一步提升大模型的整体输出质量。
1.一种大模型的敏感信息处理方法,其特征在于,所述方法包括:
2.根据权利要求1所述的大模型的敏感信息处理方法,其特征在于,在将所述问题文本输入大模型进行推理前,所述方法还包括:
3.根据权利要求1所述的大模型的敏感信息处理方法,其特征在于,所述基于所述答案文本的字数信息,对所述答案文本进行常规校验,包括:
4.根据权利要求3所述的大模型的敏感信息处理方法,其特征在于,所述基于所述答案文本的敏感词校验结果,输出所述答案文本,包括:
5.根据权利要求4所述的大模型的敏感信息处理方法,其特征在于,所述基于所述答案文本的字数信息,对所述答案文本进行分段校验,包括:
6.根据权利要求5所述的大模型的敏感信息处理方法,其特征在于,所述基于所述答案文本的敏感词校验结果,输出所述答案文本,还包括:
7.根据权利要求5所述的大模型的敏感信息处理方法,其特征在于,所述方法还包括:
8.根据权利要求1至7中任一项所述的大模型的敏感信息处理方法,其特征在于,所述方法还包括:
9.一种计算机设备,包括至少一个处理器和至少一个存储器,所述存储器适于存储多条程序代码,其特征在于,所述程序代码适于由所述处理器加载并运行以执行权利要求1至8中任一项所述的大模型的敏感信息处理方法。
10.一种计算机可读存储介质,其中存储有多条程序代码,其特征在于,所述程序代码适于由处理器加载并运行以执行权利要求1至8中任一项所述的大模型的敏感信息处理方法。
