本发明涉及大数据领域,尤其涉及一种基于大数据的标准智库数据检索方法及系统。
背景技术:
1、随着信息技术的迅猛发展,大数据已经成为现代社会的重要资源。在各行各业中,数据检索技术都扮演着至关重要的角色,特别是在标准智库领域。标准智库是指集中存储、管理和提供各类标准信息的数据库或知识库。由于标准信息的庞大、多样和动态性,如何高效地检索标准智库中的数据成为了研究的热点和难点。
2、标准智库是存储各种标准、规范、指南等文档的数据库,文档通常具有结构复杂、内容繁多的特点。同时,由于标准文档的更新速度较快,新的标准不断出现,旧的标准可能被废弃或修改,这进一步增加了数据检索的难度。传统的数据检索方法往往难以满足标准智库数据检索的准确性。因此,如何高效、准确地从这些数据中检索出有价值的信息成为了一个亟待解决的问题。
技术实现思路
1、本发明的目的是要提供一种基于大数据的标准智库数据检索方法。
2、为达到上述目的,本发明是按照以下技术方案实施的:
3、本发明包括以下步骤:
4、采集标准智库的用户检索数据和智库数据,对所述用户检索数据和所述智库数据进行预处理;
5、根据关键度对所述检索数据进行语义抽取获得核心特征,对所述智库数据进行文本信息嵌入获得完备数据;
6、根据语义相似度对所述核心特征和所述完备数据进行匹配获得池配数据,对所述池配数据进行组合筛选获得补充数据;
7、根据所述补充数据构建标准智库数据检索模型,将待检索数据输入所述标准智库数据检索模型,输出检索结果。
8、进一步的,根据关键度对所述检索数据进行语义抽取获得核心特征的方法,包括:
9、采用词聚类算法提取检索数据的命名实体,获得实体向量,将实体向量输入语义抽取模型;
10、获取位置的实体向量信息和关系的语义向量,计算语义关系的判定概率:
11、
12、其中语义关系w的判定概率为语义关系w的偏置为vw,语义关系w的权重为ηw,索引值矩阵为g,实体值矩阵为u,实体索引值矩阵为h,矩阵的转置为t,实体索引值矩阵h的维度为bh,语义关系w和命名实体y的关联度为ζ(w,y),激活函数为softmax(·),偏差系数为σ,自然常数为e;
13、将判定概率大于0.763的语义关系作为有效语义关系,
14、计算注意力权重:
15、
16、其中第a个注意力权重为第a个有效语义关系为fa,第a个跨度语义向量的第κ个字符为fa,κ,键为x,键x的维度为bx,字符的数量为m,第a个语义的正确概率为da;
17、计算跨度语义向量:
18、
19、其中跨度语义向量为fsn,通过字符级粒度和深层语义理解能力,捕捉卡度语义向量内的细粒度语义信息;
20、计算跨度向量和有效语义关系匹配实体对的概率,表达式为:
21、
22、其中有效语义关系fa和跨度语义向量fsn的匹配实体对概率为q(fsn,wa);
23、给出损失函数,表达式为:
24、
25、其中有效语义关系的数量为有效语义关系fa的判定概率为
26、将损失函数值小于0.17的跨度语义向量输出为核心特征。
27、进一步的,对所述智库数据进行文本信息嵌入获得完备数据的方法,包括:
28、采集分块后智库数据的前向块核心信息和当前模块,获取前向块核心信息的实体,根据前向块核心信息的实体计算改进实体嵌入向量:
29、
30、其中第ι层的第c个实体嵌入向量为潜在文本向量为eτ,实体的嵌入矩阵表示为实体的数量为n,转置为t,偏置为δτ,层数为第ι层的第c个实体的注意力分数为第c个改进实体嵌入向量为
31、计算注意力分数:
32、
33、其中注意力函数的参数为μ,跳嵌入表示为zι;
34、采用决策树算法抽取前向块核心信息的语义关系,获得语义关系向量,计算综合文本信息:
35、
36、其中综合文本信息为第ι层的第c个改进实体嵌入向量为第ι层的语义关系向量为kι;
37、将综合文本信息嵌入当前模块,将嵌入后的当前模块输出完备数据。
38、进一步的,根据语义相似度对所述核心特征和所述完备数据进行匹配获得池配数据的方法,包括:
39、对核心特征和完备数据进行词袋表示分别得到核心特征向量、完备数据向量;
40、采用截断奇异分解对核心特征向量、完备数据向量进行矩阵分解,获得核心特征向量的词语义向量和完备数据向量的文本语义向量;
41、计算词语义向量和文本语义向量的余弦相似度:
42、
43、其中词语义向量组为u,第r个文本语义向量为kr,词语义向量组u和文本语义向量kr的余弦相似度为第m个维度第i个词语义向量ui,m,词语义向量的数量为n,第m个维度第r个文本语义向量为kr,m,维度的数量为p;
44、计算标准差:
45、
46、其中第i个词语义向量在p维语义空间的第维属性值为第r个文本语义向量在p维语义空间的第维属性平均值为词语义向量的第p维属性值为ufp,第r个文本语义向量在p维语义空间的第维属性值为属性值ufp和属性值的标准差为
47、计算文本语义向量的信息熵:
48、
49、其中属性值的信息熵为属性平均值中属性为零的词语义向量数量为属性值中属性不为零的文本语义向量数量为属性值中属性为零的文本语义向量数量为
50、计算文本语义和词语义的区分度:
51、
52、其中文本语义和词语义的区分度为ψ,计算词语义向量和文本语义向量的语义相似度:
53、
54、其中第一超参数为δ1,第二超参数为δ2,第r个文本语义向量的特征词为uyr,第i个词语义向量在p维语义空间的特征词为uyi,p,第r个文本语义向量在p维语义空间的特征词为kyr,p,文本语义中出现词语义的频率为v(uyi,p,kyr,p),文本语义文本的平均词项长度为avgl,词语义向量u和文本语义向量kr的语义相似度为
55、将语义相似度大于0.673的完备数据输出为池配数据。
56、进一步的,对所述池配数据进行组合筛选获得补充数据的方法,包括:
57、对池配数据进行随机组合获得组合句子,计算组合句子和检索数据的语义偏差度:
58、
59、其中第j种组合句子为检索数据为组合句子和检索数据的语义偏差度为组合句子的语义向量为检索数据的语义向量为组合句子和检索数据的语义相似度为
60、将语义偏差度小于0.091的池配数据输出为补充数据。
61、进一步的,根据所述补充数据构建标准智库数据检索模型的方法,包括:
62、标准智库数据检索模型包括随机森林算法、深度学习算法、图的检索增强生成算法;
63、随机森林算法将用户检索数据按照6:1随机划分成训练数据和测试数据;
64、深度学习算法通过循环结构保留历史信息,捕捉训练数据中不同命名实体的依赖规律,根据依赖规律抽取训练数据的语义主题;
65、图的检索增强生成算法通过构建知识图谱,并利用图机器学习算法对语义主题进行语义聚合,识别与查询语义聚合后的主题模块,输出检索结果;
66、将测试数据输入标准智库数据检索模型,输出预测检索结果,计算预测检索结果和实际检索结果的语义方差,根据语义方差调整标准智库数据检索模型的超参数,直到方差小于0.17停止调整。
67、第二方面一种基于大数据的标准智库数据检索系统,包括:
68、数据采集模块:用于采集标准智库的用户检索数据和智库数据,对所述用户检索数据和所述智库数据进行预处理;
69、数据处理模块:用于根据关键度对所述检索数据进行语义抽取获得核心特征,对所述智库数据进行文本信息嵌入获得完备数据;
70、检索匹配模块:用于根据语义相似度对所述核心特征和所述完备数据进行匹配获得池配数据,对所述池配数据进行组合筛选获得补充数据;
71、模型构建模块:用于根据所述补充数据构建标准智库数据检索模型,将待检索数据输入所述标准智库数据检索模型,输出检索结果。
72、第三方面,本技术实施例还提供一种电子设备,包括:
73、处理器;以及被安排成存储计算机可执行指令的存储器,所述可执行指令在被执行时使所述处理器执行第一方面所述的方法步骤。
74、第四方面,本技术实施例还提供一种计算机可读存储介质,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序当被包括多个应用程序的电子设备执行时,使得所述电子设备执行第一方面所述的方法步骤。
75、本发明的有益效果是:
76、本发明是一种基于大数据的标准智库数据检索方法及系统,与现有技术相比,本发明具有以下技术效果:
77、本发明通过预处理、语义抽取、文本信息嵌入、数据匹配、组合筛序和模型构建步骤,可以提高基于大数据的标准智库数据检索的准确性,从而提高基于大数据的标准智库数据检索的精度,将基于大数据的标准智库数据检索优化,可以大大节省资源,提高工作效率,可以实现对基于大数据的标准智库数据的智能检索,实时对基于大数据的标准智库数据检索进行检索修正,对基于大数据的标准智库数据检索具有重要意义,可以适应不同标准的基于大数据的标准智库数据检索、不同基于大数据的标准智库数据检索需求,具有一定的普适性。
1.一种基于大数据的标准智库数据检索方法,其特征在于,包括以下步骤:
2.根据权利要求1所述一种基于大数据的标准智库数据检索方法,其特征在于,根据关键度对所述检索数据进行语义抽取获得核心特征的方法,包括:
3.根据权利要求1所述一种基于大数据的标准智库数据检索方法,其特征在于,对所述智库数据进行文本信息嵌入获得完备数据的方法,包括:
4.根据权利要求1所述一种基于大数据的标准智库数据检索方法,其特征在于,根据语义相似度对所述核心特征和所述完备数据进行匹配获得池配数据的方法,包括:
5.根据权利要求1所述一种基于大数据的标准智库数据检索方法,其特征在于,对所述池配数据进行组合筛选获得补充数据的方法,包括:
6.根据权利要求1所述一种基于大数据的标准智库数据检索方法,其特征在于,根据所述补充数据构建标准智库数据检索模型的方法,包括:
7.一种基于大数据的标准智库数据检索系统,其特征在于,包括:
8.一种电子设备,包括:处理器;以及
9.一种计算机可读存储介质,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序当被包括多个应用程序的电子设备执行时,使得所述电子设备执行所述权利要求1~6任一所述方法。
