一种基于脉冲神经网络的自然语言处理方法及系统

专利2026-08-30  15


本申请涉及自然语言处理,特别是涉及一种基于脉冲神经网络的自然语言处理方法及系统。


背景技术:

1、自然语言处理(natural language processing,nlp)是人工智能领域中的重要分支,涉及文本分类、语义分析、机器翻译、对话问答等任务,这些任务通常涉及到更高级的语义理解和推理,相对于其他任务更加复杂。目前,自然语言处理领域主要使用大型语言模型(large language model,llm)完成各项任务,而这类模型会使用大量计算资源,耗费大量时间与能源,如此大的训练成本开销在实际应用过程中往往是不可接受的。

2、随着预训练大模型的兴起,人工神经网络(artificialneuralnetwork,ann)在自然语言处理上的表现达到了新的高度。然而,随着任务的复杂程度,网络模型的结构也越来越复杂庞大,随之带来了无比巨大的算力开销,计算资源和时间成本成为了实际应用中不可忽视的问题。其中,transformer是一种人工神经网络的基础架构,其核心是其独特的自注意力机制,它允许模型同时考虑输入序列中的所有位置之间的依赖关系,其由若干个相同的层堆叠而成,每一层包含两个子层:一个多头自注意力子层和一个前馈全连接网络子层,这两个子层都带有残差连接和层归一化以稳定训练和优化表现。而由于transformer计算过程依赖的大量浮点数矩阵相乘操作,大型语言模型的训练需要海量的计算资源,通常涉及到数千个gpu或tpu的并行使用,耗费大量时间与能源,如此大的训练成本开销往往是不可接受的。不仅如此,规模如此庞大的模型,在推理时也有着极高的功耗,推理效率低下,因而无法在计算资源有限的终端设备和边缘应用场景部署,限制了其应用范围。因此,自然语言处理领域迫切需要寻找一种更加高效的实现方式。


技术实现思路

1、本申请的目的是提供一种基于脉冲神经网络的自然语言处理方法及系统,可基于脉冲神经网络对transformer架构进行改进,充分挖掘脉冲计算的能效潜力,节省大量计算资源。

2、为实现上述目的,本申请提供了如下方案:

3、第一方面,本申请提供了一种基于脉冲神经网络的自然语言处理方法,包括以下步骤:

4、基于脉冲神经网络和transformer模型结构,构建得到自然语言处理模型。所述自然语言处理模型中包括依次连接的嵌入层、多步脉冲编码层、若干个脉冲transformer层和预测头,所述脉冲transformer层中包括若干个脉冲神经元;所述嵌入层用于将输入到所述自然语言处理模型中的自然语言文本,转换成句子向量;所述多步脉冲编码层,用于将所述嵌入层输出的句子向量转换为脉冲序列;所述脉冲transformer层,用于提取得到所述脉冲序列的特征信息;所述预测头,用于根据最后一层所述脉冲transformer层输出的特征信息,预测输出自然语言处理结果。

5、基于保持神经元脉冲发放率稳定的原则,初始化所述自然语言处理模型中的参数。

6、基于知识蒸馏算法,将在任务集上训练好的人工神经网络模型中的知识,蒸馏到所述自然语言处理模型中,得到训练好的自然语言处理模型;任务集包括若干条自然语言文本和对应的自然语言处理结果。

7、获取待识别的自然语言文本,输入到训练好的所述自然语言处理模型中,得到自然语言处理结果。

8、可选地,脉冲transformer层中包括脉冲注意力模块和前馈模块,脉冲注意力模块和前馈模块均具有脉冲残差连接。

9、可选地,基于知识蒸馏算法,将在任务集上训练好的人工神经网络模型中的知识,蒸馏到所述自然语言处理模型中,得到训练好的自然语言处理模型,具体包括以下步骤:

10、根据在任务集上训练好的人工神经网络模型和所述自然语言处理模型的输出分布,确定logits蒸馏损失函数。

11、根据在任务集上训练好的人工神经网络模型和所述自然语言处理模型最后一层注意力矩阵之间的均方误差,确定注意力蒸馏损失函数。

12、基于所述logits蒸馏损失函数和所述注意力蒸馏损失函数,确定综合蒸馏损失函数。

13、以所述综合蒸馏损失函数最小为目标,优化所述自然语言处理模型的参数,得到训练好的自然语言处理模型。

14、第二方面,对应于前述的基于脉冲神经网络的自然语言处理方法,本发明还提供了一种基于脉冲神经网络的自然语言处理系统,所述基于脉冲神经网络的自然语言处理系统在被计算机运行时,执行如前文所述的基于脉冲神经网络的自然语言处理方法。

15、根据本申请提供的具体实施例,本申请公开了以下技术效果:

16、本申请提供了一种基于脉冲神经网络的自然语言处理方法及系统,基于脉冲神经网络和transformer模型结构,构建得到包括依次连接的嵌入层、多步脉冲编码层、若干个脉冲transformer层和预测头的自然语言处理模型,基于保持神经元脉冲发放率稳定的原则,初始化自然语言处理模型中的参数,最后还基于知识蒸馏算法,将在任务集上训练好的人工神经网络模型中的知识,蒸馏到自然语言处理模型中;本申请上述方案摒弃了传统transformer网络结构中的层归一化和原始自注意力机制等与脉冲神经网络不兼容的计算组件,构建了纯脉冲transformer架构,充分挖掘脉冲计算的能效潜力,还设计了用于文本数据的多步脉冲编码策略,以及基于稳定脉冲发放速率原则的参数初始化方法;此外,有效地将人工神经网络模型在任务集上训练得到的知识迁移到自然语言处理模型中,充分利用现有的人工神经网络模型的预训练,无需从零开始进行大规模的预训练过程,避免了海量计算资源的耗费。



技术特征:

1.一种基于脉冲神经网络的自然语言处理方法,其特征在于,所述基于脉冲神经网络的自然语言处理方法包括:

2.根据权利要求1所述的基于脉冲神经网络的自然语言处理方法,其特征在于,所述脉冲transformer层中包括脉冲注意力模块和前馈模块,所述脉冲注意力模块和所述前馈模块均具有脉冲残差连接。

3.根据权利要求2所述的基于脉冲神经网络的自然语言处理方法,其特征在于,所述脉冲注意力模块如下式所示:

4.根据权利要求3所述的基于脉冲神经网络的自然语言处理方法,其特征在于,所述脉冲残差连接如下式所示:

5.根据权利要求4所述的基于脉冲神经网络的自然语言处理方法,其特征在于,所述脉冲神经元根据下式进行脉冲计算:

6.根据权利要求5所述的基于脉冲神经网络的自然语言处理方法,其特征在于,所述多步脉冲编码层根据下式进行多步脉冲编码:

7.根据权利要求6所述的基于脉冲神经网络的自然语言处理方法,其特征在于,根据下式初始化所述自然语言处理模型中的参数:

8.根据权利要求7所述的基于脉冲神经网络的自然语言处理方法,其特征在于,基于知识蒸馏算法,将在任务集上训练好的人工神经网络模型中的知识,蒸馏到所述自然语言处理模型中,得到训练好的自然语言处理模型,具体包括:

9.根据权利要求8所述的基于脉冲神经网络的自然语言处理方法,其特征在于,所述logits蒸馏损失函数如下式所示:

10.一种基于脉冲神经网络的自然语言处理系统,其特征在于,所述基于脉冲神经网络的自然语言处理系统在被计算机运行时,执行如权利要求1-9任一项所述的基于脉冲神经网络的自然语言处理方法。


技术总结
本申请公开了一种基于脉冲神经网络的自然语言处理方法及系统,涉及自然语言处理技术领域,该方法基于脉冲神经网络和Transformer结构,构建得到包括依次连接的嵌入层、多步脉冲编码层、若干个脉冲Transformer层和预测头的自然语言处理模型,充分挖掘脉冲计算的能效潜力;随后基于保持神经元脉冲发放率稳定的原则,初始化自然语言处理模型中的参数,最后还基于知识蒸馏算法,将在任务集上训练好的人工神经网络模型中的知识,蒸馏到自然语言处理模型中,充分利用现有的人工神经网络模型的预训练,无需从零开始进行大规模的预训练过程,有效地将人工神经网络模型的知识蒸馏到脉冲神经网络模型中,避免了海量计算资源的耗费。

技术研发人员:唐华锦,张家瑜,申江荣,潘纲
受保护的技术使用者:浙江大学
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-24225.html

最新回复(0)