一种面向英语学科分级阅读的可控文本简化方法

专利2026-09-26  11


本发明涉及一种面向英语学科分级阅读的可控文本简化方法,属于文本简化。


背景技术:

1、llama系列模型是由meta公司开发的一系列开源大规模语言模型。这些模型旨在提供高效的文本生成和理解能力,同时减少训练和推理过程中的计算成本。llama系列提供了多种参数规模的模型并且优化了架构和训练过程,降低了所需的计算资源,并且在多个基准任务上表现出色,尤其是生成式任务。其优秀的性能与llama系列模型所采用的decoder-only架构密不可分,这种结构仅使用transformer的解码器部分,使得架构更加简洁且更适合文本生成任务。同时,通过优化的decoder-only模型在训练时可以利用并行计算,极大提高了效率。目前最新的llama3.1相较于llama2模型在上下文窗口、支持的语言数量、token数量都有显著提升,其8b和70b版本均超越同等尺寸的其他开源模型,在各种基准测试中表现出色。

2、在深度学习中,训练器是一种用于管理和执行训练过程的高级工具或模块。其封装了模型训练的核心步骤,使得整个训练过程更加自动化、模块化和易于管理。本方法选用的训练器是transformers库中的trainer类,它是hugging face提供的一个高层次api,用于简化使用transformer模型进行训练和评估的过程。trainer类将模型训练、评估、日志记录、模型保存等多个复杂步骤进行了封装,帮助用户快速实现模型的训练和部署,同时也提供了灵活的api供高级用户进行自定义,极大简化了transformer模型的使用流程。其内部的核心部分是compute_loss方法,该方法负责计算训练过程中需要最小化的损失函数。若用户希望自定义损失函数,可以通过重写compute_loss方法,返回计算的损失值,从而在反向传播阶段按特定任务的需求更新模型的可训练参数。

3、lora是一种轻量级的模型调整方法,专门用于大型语言模型(如gpt、bert等)的高效适应和调整。通过在原始参数矩阵上添加小规模的低秩矩阵,并在调整过程中冻结原始参数矩阵仅更新低秩矩阵的参数,有效减少了大型模型调整的计算和存储成本,是一种高效且灵活的模型适应方法。

4、控制令牌(control tokens)在可控文本生成中扮演着关键的角色,他们用来引导生成模型输出符合特定要求的文本。control tokens可以直接嵌入到输入文本中,作为生成条件的一部分,明确告诉模型需要生成哪种类型的文本,用户可以在不重新训练模型的情况下,灵活地控制生成内容的特定方面。

5、上述内容仅用于辅助理解本发明的技术方案,并不代表承认上述内容是现有技术。


技术实现思路

1、本发明要解决的技术问题是提供一种面向英语学科分级阅读的可控文本简化方法,在不改变模型结构的情况下,传统文本简化方法在可控性和简化性能上不足的问题。

2、本发明的技术方案是:一种面向英语学科分级阅读的可控文本简化方法,具体步骤为:

3、step1:构建以[复杂句,简单句,控制令牌]形式的专用数据集;

4、对于给定的复杂句有多种简化版本的原始数据,其中为复杂句的不同人工简化结果。以复杂句和简化句作为输入,即可需要的控制令牌为,得到与的单词量、字符量、字符相似度、单词难度、语法相似度之间的比值。公式如下:

5、

6、按照上述方法获得每个人工简化句的控制令牌,将每个简单句、复杂句及其所述控制令牌构建成专用数据集

7、step2:构建面向显式可控的输入模板,并整合专用数据集,得到llama3.1模型的输入;

8、step2.1构建了一个能够整合所有控制令牌prompt模板,从而进行显式地对复杂句进行可控简化,具体如下:

9、prompt:"below is an instruction that describes a task, paired with aninput that provides further context. write a response that appropriatelycompletes the request.### instruction:simplify the sentence given below byreferring to the control tokens.### input:w_{w} c_{c} l_{l} wr_{wr} dtd_{dtd}{comp}### response: "

10、由于llama3.1模型仅支持英文输入,因此本发明所述构建面向显式可控的输入模板仅能以英文形式呈现,该模板意思为:“下面是一个描述任务的指令,与提供进一步上下文的输入配对。编写一个适当地完成请求的响应。指令:参考控制令牌简化下面给出的句子。输入:{控制令牌} {复杂句}。输出:{简单句}。”

11、step2.2:将所述的控制令牌以及复杂句整合进所述prompt模板中形成llama3.1模型输入,以作为标签,即:

12、

13、

14、得到的模型输入和标签如下所示:

15、example input:"below is an instruction that describes a task, pairedwith an input that provides further context. write a response thatappropriately completes the request.### instruction:simplify the sentencegiven below by referring to the control tokens.### input:w_{} c_{} l_{} wr_{} dtd_{} {}### response:"

16、example label:。

17、step3:构建针对简化生成和可控令牌回归的损失函数,得到专用训练器。

18、使用继承于huggingface的transformers库的trainer类的训练器,对所述训练器训练损失的计算方法进行重写,得到专用训练器,在模型训练过程中,所述专用训练器首先根据新的计算方法确定训练损失,然后利用所述训练损失的梯度信息执行反向传播算法,以优化并更新模型的参数。这种方法使得训练过程能够反映特定的性能指标,所述特定的性能指标指的是生成文本的控制令牌与标签的控制令牌之间的mse(均方误差),它反映了生成文本的可控特性。所述训练器损失计算方法为分别计算模型生成简化文本的标准损失和自定义的控制令牌损失,即:

19、

20、其中是模型生成简化文本的标准损失,这是目标简单句(标签)和模型生成的简单句之间的交叉熵损失,即:

21、

22、是引入的控制令牌的损失,计算了生成目标简单句(标签)的控制令牌和模型生成的简单句的控制令牌之间的平均绝对误差,即:

23、

24、其中,是比例系数。

25、step4:利用llama3.1模型的输入、输出结果和专用训练器,基于lora方法对llama3.1模型进行调整;

26、基于unsloth框架,加载llama3.1模型和相应的lora适配器,将lora应用到模型中。使用所述专用训练器,加载所述专用数据集,并以所述prompt模型输入llama3.1模型。训练器即可按照配置的信息,在每次按照模型损失函数计算完训练损失后反向传播更新lora方法引入的低秩矩阵的参数。在训练完成后,保存调整后的模型权重,即可在后续任务中调用调整后的模型。

27、step5:构建模型输入指令,通过调整后的llama3.1模型,输出简单句:

28、对于一个新的复杂句,模型生成简单句的控制令牌设为,将所述新的复杂句及所述控制令牌放入所述prompt模板中,获得模型的输入,即:

29、

30、将输入调整后的llama3.1模型中,使用模型的生成方法(model.generate)得到模型输出的token序列,再将此token序列使用llama3.1模型的tokenizer解码即可得到输出的简单句:

31、=fine-tuned llama3.1 

32、其中,fine-tuned llama3.1 表示将输入调整好的llama3.1模型中获取输出。

33、本发明的有益效果是:本发明与现有技术相比,能实现具有显式指标控制的英语文本简化功能,将显式的控制令牌输入模型中,在不改变模型结构的情况下,一定程度上实现有监督训练的效果,有效提升文本简化算法的可控性和简化性能。


技术特征:

1.一种面向英语学科分级阅读的可控文本简化方法,其特征在于:

2.根据权利要求1所述的面向英语学科分级阅读的可控文本简化方法,其特征在于,所述step1具体为:

3.根据权利要求2所述的面向英语学科分级阅读的可控文本简化方法,其特征在于,所述构建面向显式可控的输入模板包括:

4.根据权利要求1所述的面向英语学科分级阅读的可控文本简化方法,其特征在于,所述step3具体为:

5.根据权利要求3所述的面向英语学科分级阅读的可控文本简化方法,其特征在于,所述step4具体为:

6.根据权利要求1所述的面向英语学科分级阅读的可控文本简化方法,其特征在于,所述step5具体为:


技术总结
本发明涉及一种面向英语学科分级阅读的可控文本简化方法,属于文本简化技术领域。首先,构建[复杂句,简单句,控制令牌]形式的专用数据集;其次,构建面向显式可控的输入模板,并整合专用数据集,得到Llama3.1模型的输入;然后,构建针对简化生成和可控令牌回归的损失函数,得到专用训练器;再利用Llama3.1模型的输入、输出结果和专用训练器,基于LoRA方法对Llama3.1模型进行调整;最后,构建模型输入指令,通过调整后的Llama3.1模型,输出简单句。本发明能实现具有显式指标控制的英语文本简化功能,将显式的控制令牌输入模型中,在不改变模型结构的情况下,一定程度上实现有监督训练的效果,有效提升文本简化算法的可控性和简化性能。

技术研发人员:张姝,陈书雨,李子杰,吕晋鑫,韩晓瑜,陈恳
受保护的技术使用者:云南师范大学
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-24908.html

最新回复(0)