利用深度学习的烟草行业文档自动分类与存储方法与流程

专利2026-09-16  3


本发明涉及深度学习,尤其涉及利用深度学习的烟草行业文档自动分类与存储方法。


背景技术:

1、随着烟草在管理创新方面取得显著成就,通过多年的努力已经积累了成千上万个优秀的创新成果,这些成果不仅是组织智慧的结晶,也是推动企业持续发展的宝贵资源。然而,当前这些创新成果的管理和共享机制尚存不足,主要依赖于人工的点对点传递方式,导致成果利用效率低下,难以实现其最大的价值。

2、在当前的信息时代,企业和组织面临着如何有效管理和利用日益增长的数据资源的挑战。特别是在知识密集型行业,如烟草行业,拥有大量未充分利用的文档资源,这对于维护企业的创新能力和竞争优势至关重要。

3、近年来,深度学习技术,尤其是预训练语言模型如bert和roberta,在自然语言处理领域取得了显著的进展。这些技术在文本分类、实体识别等任务中展现出卓越的性能,提供了优化知识库系统的新途径。尽管这些模型在一般语言处理任务中表现良好,但它们在特定行业的知识库应用研究还相对不足,特别是在烟草行业的管理创新成果文档处理上。目前,对于如何将这些先进的深度学习技术应用于特定行业的知识管理和检索系统中,还缺乏深入的研究,存在着如何高效地构建和维护知识库,以及如何提高知识检索的准确性和效率的问题未被充分解决。


技术实现思路

1、本发明的目的是为了解决现有技术中存在的缺点,而提出的利用深度学习的烟草行业文档自动分类与存储方法。

2、为了实现上述目的,本发明采用了如下技术方案:

3、利用深度学习的烟草行业文档自动分类与存储方法,包括以下具体步骤:

4、s1:模型选择:考虑到烟草行业大量的中文文档和需要准确理解复杂管理知识的需求,选择了roberta作为预训练模型基础,roberta的高效的信息处理机制和对中文语料优异的理解能力,使其成为构建知识库和实现智能搜索功能的理想选择;

5、s2:模型预训练过程:

6、s2a:maskedlanguagemodel(mlm)阶段:模型随机掩盖输入文本的一部分词汇,然后预测这些掩盖的词汇,通过这种方式学习语言的深层语义关系;

7、s2b:动态掩码生成阶段:与bert不同,roberta在每次数据传递时动态改变掩码词汇,增加了模型训练的难度和多样性;

8、s3:数据准备与预处理:

9、s3a:数据收集:从烟草公司的内部数据库中收集行业文档;

10、s3b:文档格式转换:利用自动化脚本将所有非文本格式文档转换为纯文本格式,去除格式化元素,以便后续处理;

11、s3c:文本清洗:对转换后的文本内容进行清洗,去除无关信息,同时剔除或替换文本中的特殊字符和非结构化信息;

12、s3d:分词处理:考虑到中文文档的特点,采用基于深度学习的中文分词工具进行分词处理,确保文本被正确切分成词或短语,并将所有文本标准化为小写(对于英文部分),以统一数据格式;

13、s3e:停用词去除:根据预先定义的停用词表,去除文本中的常见停用词,如“的”、“是”、“在”等,这些词虽然使用频繁,但对理解文档含义贡献有限;

14、s3f:数据增强:为避免模型训练时的数据偏差,采取数据增强策略,例如通过同义词替换、句子重组等方法生成新的文本实例,可以帮助模型学习到更加泛化的语言特征,提高在不同类型文档上的性能;

15、s4:模型微调策略:

16、s4a:定义任务特定的模型架构:对于知识库构建而言,通常涉及文档分类或相似文档检索等任务,因此在roberta语言模型顶部添加一个或多个全连接层作为输出层,以适应这些任务;

17、s4b:选择合适的损失函数和优化器:根据任务的不同,选择合适的损失函数来指导模型训练;对于分类任务,使用交叉熵损失函数;对于相似度匹配任务,使用余弦相似度作为损失函数;同时选择一个有效的优化器(如adamw)来调整模型参数,以达到更好的训练效果;

18、s4c:参数设置和调整策略:对学习率、批处理大小和训练周期进行设定和调整;

19、s5:模型微调过程:将预处理后的文档数据输入roberta模型,并根据任务特定层的输出计算损失,然后通过反向传播算法调整模型参数;

20、s5a:数据分批处理:由于文档数据集可能相当庞大,通常需要将数据分批次(batch)输入模型,这样既可以提高内存利用率,也有助于模型的泛化能力;

21、s5b:早停法(earlystopping):为了避免过拟合,可以在验证集的性能不再提升时提前终止训练,这种方法可以帮助我们在提高模型性能和防止过拟合之间找到一个平衡点;

22、s6:实体识别与标签化:在模型微调完成后,利用微调后的roberta模型执行命名实体识别任务,通过定义一套针对管理创新成果文档的实体类型,模型能够自动识别文档中的关键信息,并将其标记为相应的实体,为文档的自动标签化提供支持;

23、s7:性能评估:

24、s7a:数据集构建:从烟草公司收集的管理创新成果文档中,随机选取80%作为训练集、10%作为验证集、剩余10%作为测试集,确保数据集覆盖广泛的管理创新主题和内容类型;

25、s7b:性能评估指标:为了全面评价模型的性能,选用了几种常见的评估指标,包括精确度(precision)、召回率(recall)、f1分数(f1score)和模型在测试集上的准确率(accuracy),这些指标能够综合反映模型在分类或相似文档检索任务上的表现;

26、s7c:对比模型设置:为了验证微调后roberta模型的有效性,选取了几个基线模型进行比较,包括未经微调的原始roberta模型、bert以及传统的tf-idf加机器学习分类器(如svm)的组合作为基准进行比较分析,这样的比较可以直观地展示微调过程对模型性能的提升;

27、s7d:实验环境:所有实验均在具有nvidiateslagpu支持的高性能计算环境中进行,以确保训练和测试过程的高效率;

28、s8:实验结果:

29、s8a:文档分类任务:微调后的roberta模型在测试集上的准确率达到了92%,相比之下,未经微调的原始roberta模型的准确率为85%,而传统的bert模型和tf-idf加svm分类器的组合分别为87%和83%,这一结果表明,微调过程显著提高了roberta模型在特定任务上的性能;

30、s8b:相似文档检索任务:使用余弦相似度作为相似度评分标准,微调后的roberta模型在检索任务上的表现同样优于比较组,具体的,基于微调roberta模型的检索系统在top-5准确率上达到了90%,而原始roberta模型和bert模型分别为82%和85%,tf-idf加svm组合的方法为80%,这进一步证实了微调在提高模型对文档深层语义理解和检索性能方面的重要性;

31、s8c:训练和推理时间:在训练效率方面,微调roberta模型的过程耗时相较于从头训练模型大大缩短,具体而言,微调整个过程在实验环境中平均耗时约为2小时,而训练一个从头开始的相似规模的模型可能需要超过12小时。

32、作为本发明的进一步技术方案,所述s3a中,为确保数据的质量和可用性,只选择内容完整、格式统一的文档;考虑到知识库的目标是促进知识的共享和复用,特别关注具有普遍适用性和转化潜力的创新成果文档。

33、作为本发明的进一步技术方案,所述s3b中,非文本格式文档包括pdf、word等,格式化元素包括图片、表格和特殊格式等。

34、作为本发明的进一步技术方案,所述s3c中,无关信息包括页眉、页脚、图表描述、参考文献等。

35、作为本发明的进一步技术方案,所述s3d中,基于深度学习的中文分词工具采用bert的分词器。

36、作为本发明的进一步技术方案,所述s4c中,具体的参数设置和调整策略为:

37、学习率:选择相对较小的学习率(如5e-5或更小),以防止在微调过程中对预训练好的模型参数造成过大扰动;

38、批处理大小:根据可用的计算资源,适当调整批处理大小(batchsize),在保证模型训练效率的同时,避免因资源限制导致的训练问题。

39、训练周期:设定合理的训练周期(epochs),太少的训练周期可能导致模型欠拟合,而太多的训练周期则可能导致过拟合,通过在验证集上监控模型性能,动态调整训练周期。

40、作为本发明的进一步技术方案,所述s5中,模型微调过程通常在验证集上进行监控,以确定模型何时达到最优表现或开始过拟合。

41、作为本发明的进一步技术方案,所述s6中,文档的实体类型包括项目名称、关键技术、效果指标等。

42、作为本发明的进一步技术方案,所述s7a中,训练集用于模型的微调,验证集用于调整模型参数和早停法的应用,测试集则用于最终的性能评估。

43、作为本发明的进一步技术方案,所述s8c中,微调后的模型在推理时的响应速度也满足实时检索的需求,平均响应时间在100毫秒以内,这对于构建实用的知识库系统来说至关重要。

44、本发明的有益效果为:通过微调roberta模型,成功地在烟草的管理创新成果知识库构建任务中实现了高效的文档分类和相似文档检索,展示了基于深度学习的自然语言处理技术在专业知识库构建领域的应用潜力;本发明的主要优势包括:

45、1.强大的上下文理解能力:与传统的文本处理方法相比,基于roberta的方法能更好地捕捉和理解文档中的复杂语境和细微语义差别,这对于准确分类和有效检索管理创新成果文档至关重要。

46、2.灵活的微调能力:微调预训练模型的策略为模型在特定任务上的优化提供了极大的灵活性和效率,通过对烟草的具体数据进行微调,roberta模型能够更精确地适应和处理管理创新成果的文档特点,而不是依赖通用的语言模型。

47、3.高效的数据处理:在处理大规模文档数据集方面,使用roberta模型进行微调的方法显示出了高效的数据处理能力,这一点在文档量庞大且更新频繁的知识库构建任务中尤为重要。

48、4.改善的用户体验:基于微调roberta模型的知识库系统在检索结果的相关性和系统响应速度上都得到了用户的高度评价,提供快速准确的检索结果直接影响到用户体验和知识库的实用价值。


技术特征:

1.利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,包括以下具体步骤:

2.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s3a中,为确保数据的质量和可用性,只选择内容完整、格式统一的文档;考虑到知识库的目标是促进知识的共享和复用,特别关注具有普遍适用性和转化潜力的创新成果文档。

3.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s3b中,非文本格式文档包括pdf、word等,格式化元素包括图片、表格和特殊格式等。

4.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s3c中,无关信息包括页眉、页脚、图表描述、参考文献等。

5.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s3d中,基于深度学习的中文分词工具采用bert的分词器。

6.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s4c中,具体的参数设置和调整策略为:

7.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s5中,模型微调过程通常在验证集上进行监控,以确定模型何时达到最优表现或开始过拟合。

8.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s6中,文档的实体类型包括项目名称、关键技术、效果指标等。

9.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s7a中,训练集用于模型的微调,验证集用于调整模型参数和早停法的应用,测试集则用于最终的性能评估。

10.根据权利要求1所述的利用深度学习的烟草行业文档自动分类与存储方法,其特征在于,所述s8c中,微调后的模型在推理时的响应速度也满足实时检索的需求,平均响应时间在100毫秒以内,这对于构建实用的知识库系统来说至关重要。


技术总结
本发明涉及深度学习技术领域,公开了利用深度学习的烟草行业文档自动分类与存储方法,包括以下步骤:模型选择;模型预训练过程:MLM阶段、动态掩码生成阶段;数据准备与预处理:数据收集、文档格式转换、文本清洗、分词处理、停用词去除、数据增强;模型微调策略:定义任务特定的模型架构、选择合适的损失函数和优化器、参数设置和调整策略;模型微调过程:数据分批处理、早停法;实体识别与标签化;性能评估:数据集构建、性能评估指标、对比模型设置、实验环境;实验结果:文档分类任务、相似文档检索任务、训练和推理时间。本发明通过微调RoBERTa预训练模型,使其具有强大的上下文理解能力、灵活的微调能力、高效的数据处理能力,还改善了用户体验。

技术研发人员:赵秋晨,贾冰,张子超
受保护的技术使用者:山东济宁烟草有限公司
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-24598.html

最新回复(0)