一种风险防御方法及装置与流程

专利2026-08-11  2


本文件涉及大模型风险控制,尤其涉及一种风险防御方法及装置。


背景技术:

1、随着人工智能技术的发展,大模型的规模和性能也在不断提高。目前已经出现了数十亿甚至数万亿参数的大模型,而且大模型可以用于生成文本、翻译语言、编写不同类型的创意内容以及以丰富的信息和多样化的方式回答问题等。随着人们对自己的隐私数据越来越重视,对于大模型的安全防御成为不容忽视的问题。然而,目前大模型的输出内容易于出现ai幻觉、数据泄露、非法内容等风险,而大模型的输出内容代表大模型拥有主体的态度,因此,在大模型的安全防御业务中,如何识别内容攻击以及内容诱导是个重要问题。基于此,需要提供一种针对大模型的风险防御方法。


技术实现思路

1、一方面,本说明书一个或多个实施例提供一种风险防御方法,包括:拦截用户输入目标大模型的目标内容信息;对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,所述风险参数用于判断所述目标内容信息是否对所述目标大模型构成预设风险,所述风险参数包括:内容元素对应的参数、表达手段对应的参数、领域类型对应的参数以及情感类型对应的参数中的一种或多种;基于所述风险参数和预设的风险识别规则,确定与所述目标内容信息相匹配的风险信息;基于所确定的风险信息,通过所述目标大模型对所述目标内容信息进行响应。

2、另一方面,本说明书一个或多个实施例提供一种风险防御装置,包括:信息拦截模块,拦截用户输入目标大模型的目标内容信息;信息拆解模块,对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,所述风险参数用于判断所述目标内容信息是否对所述目标大模型构成预设风险,所述风险参数包括:内容元素对应的参数、表达手段对应的参数、领域类型对应的参数以及情感类型对应的参数中的一种或多种;风险信息确定模块,基于所述风险参数和预设的风险识别规则,确定与所述目标内容信息相匹配的风险信息;响应模块,基于所确定的风险信息,通过所述目标大模型对所述目标内容信息进行响应。

3、再一方面,本说明书一个或多个实施例提供一种电子设备,包括:处理器;以及被安排成存储计算机可执行指令的存储器,在所述可执行指令被执行时,能够使得所述处理器:拦截用户输入目标大模型的目标内容信息;对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,所述风险参数用于判断所述目标内容信息是否对所述目标大模型构成预设风险,所述风险参数包括:内容元素对应的参数、表达手段对应的参数、领域类型对应的参数以及情感类型对应的参数中的一种或多种;基于所述风险参数和预设的风险识别规则,确定与所述目标内容信息相匹配的风险信息;基于所确定的风险信息,通过所述目标大模型对所述目标内容信息进行响应。

4、再一方面,本说明书一个或多个实施例提供存储介质,用于存储计算机程序,所述计算机程序能够被处理器执行以实现以下流程:拦截用户输入目标大模型的目标内容信息;对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,所述风险参数用于判断所述目标内容信息是否对所述目标大模型构成预设风险,所述风险参数包括:内容元素对应的参数、表达手段对应的参数、领域类型对应的参数以及情感类型对应的参数中的一种或多种;基于所述风险参数和预设的风险识别规则,确定与所述目标内容信息相匹配的风险信息;基于所确定的风险信息,通过所述目标大模型对所述目标内容信息进行响应。

5、再一方面,本说明书一个或多个实施例还提供了一种计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现以下流程:拦截用户输入目标大模型的目标内容信息;对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,所述风险参数用于判断所述目标内容信息是否对所述目标大模型构成预设风险,所述风险参数包括:内容元素对应的参数、表达手段对应的参数、领域类型对应的参数以及情感类型对应的参数中的一种或多种;基于所述风险参数和预设的风险识别规则,确定与所述目标内容信息相匹配的风险信息;基于所确定的风险信息,通过所述目标大模型对所述目标内容信息进行响应。



技术特征:

1.一种风险防御方法,包括:

2.根据权利要求1所述的方法,所述基于所述风险参数和预设的风险识别规则,确定与所述目标内容信息相匹配的风险信息,包括:

3.根据权利要求1所述的方法,所述风险参数包括内容元素对应的参数,则对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,包括:

4.根据权利要求3所述的方法,从所述目标内容信息中提取与所述预设风险相匹配的内容元素,并基于所提取的内容元素确定所述目标内容信息的风险参数,包括:

5.根据权利要求1所述的方法,所述风险参数包括表达手段对应的参数,则对所述目标内容信息进行内容拆解处理,得到所述目标内容信息的风险参数,包括:

6.根据权利要求5所述的方法,所述基本表达手段的类型包括:用于评论的表达手段、用于模型信息获取的表达手段、用于获取客观事实的表达手段、用于获取建议的表达手段以及无实际意图的表达手段中的一种或多种;

7.根据权利要求1所述的方法,所述风险参数包括领域类型对应的参数,所述领域类型包括:国家政策治理领域、医疗领域、政务领域、金融领域以及泛领域中的一种或多种;

8.根据权利要求1所述的方法,所述基于所确定的风险信息,通过所述目标大模型对所述目标内容信息进行响应,包括:

9.一种风险防御装置,包括:

10.一种电子设备,包括:


技术总结
本说明书一个或多个实施例公开了一种风险防御方法及装置,该方法首先拦截用户输入目标大模型的目标内容信息,并对目标内容信息进行内容拆解处理,得到目标内容信息的风险参数,风险参数用于判断目标内容信息是否对目标大模型构成预设风险,风险参数包括:内容元素对应的参数、表达手段对应的参数、领域类型对应的参数以及情感类型对应的参数中的一种或多种,其次,基于风险参数和预设的风险识别规则,确定与目标内容信息相匹配的风险信息,最后基于所确定的风险信息,通过目标大模型对目标内容信息进行响应。

技术研发人员:黄梅红,孙传亮,朱耀伟
受保护的技术使用者:支付宝(杭州)信息技术有限公司
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-23570.html

最新回复(0)