本发明属于智算中心液冷控制,具体来说,涉及一种适用于智算中心服务器与冷板式液冷系统的协同控制方法。
背景技术:
1、智算中心作为人工智能技术的基础设施,近年来正处于高速发展阶段。与传统的数据中心相比,智算中心的功率密度更高,其单机架功率可达40kw以上,因此常应用冷板式液冷系统进行冷却。与通算中心的服务器相比,智算中心服务器的功率变化极为迅速,但现有的控制策略中未能形成服务器与冷却系统的有效协同,导致智算中心存在严重的过冷问题,造成了能耗的巨大浪费。
2、为了提高冷板式液冷系统的精准供冷能力,目前采用的一种有效方式是在二次环路(微模块环路)的末端机架/服务器进/出水管路上增加电动阀,并基于服务器温度预测,通过液冷分配单元(cdu)和阀门的联动实现冷量的精确调控。然而,由于二次环路管网的长度通常较短,且其水力特性较为复杂,使得单一支路的阀门调控易造成整个管网各支路流量的剧烈变化,以至于影响智算中心的安全稳定。此外,受限于流体输配及热容特性,液冷系统的冷量供给难以动态匹配各智算服务器(配有gpu)的散热量变化。为此,需探究服务器与冷板式液冷系统的协同控制技术。
技术实现思路
1、本发明提供一种适用于智算中心服务器与冷板式液冷系统的协同控制方法,以解决智算中心在节能调度中易出现过冷的技术问题,从而提高智算中心的整体能效和运行稳定性。
2、为解决上述技术问题,本发明实施例采用如下技术方案:
3、本发明实施例提供一种适用于智算中心服务器与冷板式液冷系统的协同控制方法,包括以下步骤:
4、步骤10,获取智算中心在预设时间段内的it系统调度数据和液冷冷却系统数据,分别建立服务器实时功耗模型、冷却塔功耗模型、水泵功耗模型和服务器温度快速预测模型;
5、步骤20,基于服务器实时功耗模型、冷却塔功耗模型、水泵功耗模型和服务器温度快速预测模型,采用实时联合和定时顺序相结合的优化方法,对虚拟机部署及冷板式液冷系统进行协同控制。
6、作为本发明实施例的进一步改进,所述it系统调度数据包括虚拟机cpu资源需求、虚拟机gpu资源需求、虚拟机与服务器间映射关系、各服务器cpu使用率、各服务器gpu使用率、各服务器实时功耗和各服务器芯片温度;所述液冷冷却系统数据包括一次侧各水泵流量、一次侧各水泵功耗、一次侧各阀门开度、各cdu水泵流量、各cdu水泵功耗、室外湿球温度、各冷却塔进出水温差、各冷却塔逼近度、各冷却塔功耗和各冷却塔流量。
7、作为本发明实施例的进一步改进,所述步骤10中,根据it系统调度数据,建立智算中心的服务器实时功耗模型;
8、具体包括:
9、步骤101,从it系统调度数据中筛选出各服务器在不同cpu及gpu使用率下的功耗数据;
10、步骤102,根据各服务器在cpu和gpu使用率为0状态下的功耗数据,建立服务器静态功耗矩阵;
11、步骤103,根据各服务器实时功耗随cpu使用率的变化数据,采用多元线性回归方法拟合出各服务器的cpu使用率与动态功耗的转换系数,构成cpu使用率与动态功耗的转换系数矩阵;根据各服务器实时功耗随gpu使用率的变化数据,采用多元线性回归方法拟合出各服务器的gpu使用率与动态功耗的转换系数,构成gpu使用率与动态功耗的转换系数矩阵;
12、步骤104,将服务器静态功耗矩阵、cpu使用率与运行功耗的转换系数矩阵和gpu使用率与运行功耗的转换系数矩阵相结合,得到式(1)所示的智算中心服务器实时功耗模型:
13、ppm(t)=psc(t)+uvm,cpu(t)*mmvm→pm(a(t),f(t))*fh,cpu+uvm,gpu(t)*mmvm→pm(a(t),f(t))*fh,gpu
14、式(1)
15、式中,ppm(t)表示服务器实时功耗矩阵,psc(t)表示服务器静态功耗矩阵,uvm,cpu(t)表示虚拟机的cpu资源需求矩阵,mmvm→pm(a(t),f(t))表示虚拟机与服务器间的映射矩阵,a(t)表示虚拟机实时部署矩阵,f(t)表示虚拟机迁移矩阵,uvm,cpu(t)*mmvm→pm(a(t),f(t))表示各服务器的cpu使用率,fh,cpu表示cpu使用率与动态功耗的转换系数矩阵,uvm,gpu(t)表示虚拟机的gpu资源需求矩阵,uvm,gpu(t)*mmvm→pm(a(t),f(t))表示各服务器的gpu使用率,fh,gpu表示gpu使用率与动态功耗的转换系数矩阵。
16、作为本发明实施例的进一步改进,所述步骤10中,根据液冷冷却系统数据,建立式(2)所示的冷却塔功耗模型:
17、
18、式中,pt(t)表示冷却塔实时功耗,pt,e表示冷却塔额定工况功耗,δtt(t)表示冷却塔进出水实时温差,δtt,e表示冷却塔进出水额定工况温差,tapp(t)表示冷却塔实时逼近度,tapp,e表示冷却塔额定工况逼近度,twb(t)表示室外湿球实时温度,twb,e表示室外湿球额定工况温度,mcw(t)表示冷却塔实时流量,mcw,e表示冷却塔额定工况流量,a,b,c,d,e,f,g,h,i,j,k,l,m,n,o分别表示各次项拟合系数。
19、作为本发明实施例的进一步改进,所述步骤10中,根据液冷冷却系统数据,分别为一次侧水泵和各cdu水泵建立式(3)所示的水泵功耗模型:
20、
21、式中,ppump(t)表示水泵实时功耗,m(t)表示水泵实时流量,mdes表示水泵额定工况流量,ppump,des表示水泵额定工况功耗,b1,b2,n分别表示拟合系数。
22、作为本发明实施例的进一步改进,所述步骤10中,根据it系统调度数据和液冷冷却系统数据,建立服务器温度快速预测模型;
23、具体包括:
24、步骤131,从it系统调度数据中筛选出虚拟机与服务器间映射关系、虚拟机cpu资源需求、虚拟机gpu资源需求和各服务器芯片最高温度,从液冷冷却系统数据中筛选出一次侧各水泵流量、一次侧各水泵功耗、一次侧各阀门开度、各cdu水泵流量、各cdu水泵功耗、室外湿球温度、各冷却塔进出水温差、各冷却塔逼近度和各冷却塔功耗,构成建模数据集;
25、步骤132,基于建模数据集,将各cdu水泵流量、室外湿球温度、各冷却塔逼近度、一次侧各水泵流量、一次侧各阀门开度、各服务器的cpu使用率及各服务器的gpu使用率作为卷积神经网络模型的输入变量,将各服务器的芯片最高温度作为卷积神经网络模型的输出变量,对卷积神经网络模型进行训练,得到服务器温度快速预测模型。
26、作为本发明实施例的进一步改进,所述步骤20中,采用实时联合和定时顺序相结合的优化方法,对虚拟机部署及冷板式液冷系统进行协同控制,包括:
27、步骤21,当云平台收到新虚拟机部署请求时,随机选取一个可供部署的智算微模块作为部署微模块,对新虚拟机在部署微模块中的部署位置与部署微模块对应的各cdu水泵流量进行联合优化,以实现部署微模块的服务器与对应的各cdu水泵功耗之和最低;
28、步骤22,每到给定时刻,先对各服务器上运行的虚拟机进行整体迁移,实现智算微模块开启数量最少;然后对各cdu水泵流量、一次环路各水泵流量、一次侧各阀门开度和各冷却塔逼近度进行优化,实现冷板式液冷系统总能耗最小。
29、作为本发明实施例的进一步改进,所述步骤21具体包括:
30、步骤211,当云平台接收到新虚拟机的部署请求后,根据新虚拟机的cpu资源需求和gpu资源需求,对所有活跃服务器的剩余cpu资源和gpu资源进行遍历,以寻找可供部署的服务器;
31、步骤212,如果存在可供部署的服务器,则将可供部署的服务器所在的智算微模块作为新虚拟机部署的部署微模块,将可供部署的服务器作为新虚拟机部署的优化变量,并执行步骤213;如果所有智算微模块中活跃服务器的剩余cpu资源和gpu资源都无法部署新虚拟机,则随机选择一个存在休眠服务器的智算微模块作为部署微模块,随机将部署微模块中一台休眠服务器转入活跃状态,部署新虚拟机,并执行步骤214;
32、步骤213,以实现新虚拟机部署后部署微模块总功耗最低为优化目标,以各服务器上运行的所有虚拟机的使用资源之和不超过服务器额定资源总量,以及各服务器芯片最高温度不超过预设温度阈值为优化约束,采用遗传算法对部署微模块的新虚拟机部署位置与部署微模块对应的各cdu中水泵流量进行联合优化,得到最优的虚拟机实时部署位置和最优的各cdu水泵流量;由云平台根据最优的虚拟机实时部署位置落实新虚拟机的部署,由冷板式液冷系统根据最优的各cdu水泵流量对部署微模块对应的各cdu水泵的流量进行控制;
33、步骤214,以实现新虚拟机部署后部署微模块对应的各cdu水泵功耗之和最低为优化目标,以各服务器芯片最高温度不能超过预设温度阈值为约束,采用遗传算法对部署微模块对应的各cdu水泵流量进行优化,得到最优的各cdu水泵流量;由冷板式液冷系统根据最优的各cdu水泵流量对部署微模块对应的各cdu水泵的流量进行控制。
34、作为本发明实施例的进一步改进,所述步骤22具体包括:
35、步骤221,在给定时刻,根据智算中心所有服务器上运行的全部虚拟机数量及其资源需求之和计算所需的最少活跃服务器台数;
36、步骤222,根据所需的最少活跃服务器台数,按照智算微模块编号顺序、各智算微模块中机架编号顺序和各机架上服务器编号顺序选取服务器作为下一时段的活跃服务器,直到选取的服务器数量达到最少活跃服务器台数为止;
37、步骤223,依据负载均衡策略,将既有虚拟机均匀迁移至被选取的各活跃服务器上;休眠空闲服务器;
38、步骤224,以实现冷板式液冷系统总功耗最低为优化目标,以各服务器芯片最高温度不超过预设温度阈值为约束,采用遗传算法对各cdu水泵流量、一次侧各水泵流量、一次侧各阀门开度和各冷却塔逼近度进行优化,得到最优的各cdu水泵流量、最优的一次侧各水泵流量、最优的一次侧各阀门开度和最优的各冷却塔逼近度;
39、步骤225,由冷板式液冷系统根据最优的各cdu水泵流量对各cdu水泵的流量进行调控,根据最优的一次侧各水泵流量对一次侧各水泵的流量进行调控,根据最优的一次侧各阀门开度对一次侧各阀门的开度进行调控,根据最优的各冷却塔逼近度对各冷却塔的逼近度进行调控。
40、与现有技术相比,本发明的技术方案具有以下有益效果:
41、本发明提供的一种适用于智算中心服务器与冷板式液冷系统的协同控制方法,首先获取智算中心在预设时间段内的it系统调度数据和液冷冷却系统数据,分别建立服务器实时功耗模型、冷却塔功耗模型、水泵功耗模型和服务器温度快速预测模型;然后在控制阶段,采用实时部署优化时,对新虚拟机在部署微模块中的部署位置与对应的各cdu水泵流量进行联合优化,提高部署微模块中服务器散热与二次环路冷量分配之间的实时匹配度,以减少部署微模块内的过冷量,从而实现单个虚拟机部署下的服务器与cdu水泵功耗之和最低;采用定时顺序优化时,在给定时间节点先对各服务器上运行的虚拟机进行整体迁移,以使得智算微模块的开启数量最低,在此基础上,对各cdu水泵流量、一次环路各水泵流量、一次侧各阀门开度和各冷却塔逼近度进行优化,以实现冷板式液冷系统的总能耗最低,并促成服务器散热与二次环路冷量分配之间的定时高度匹配,从而进一步提高智算中心的冷量利用效率;通过实时联合优化与定时顺序优化的配合,可实现智算中心的整体能效和运行稳定性的提升。
1.一种适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述it系统调度数据包括虚拟机cpu资源需求、虚拟机gpu资源需求、虚拟机与服务器间映射关系、各服务器cpu使用率、各服务器gpu使用率、各服务器实时功耗和各服务器芯片温度;所述液冷冷却系统数据包括一次侧各水泵流量、一次侧各水泵功耗、一次侧各阀门开度、各cdu水泵流量、各cdu水泵功耗、室外湿球温度、各冷却塔进出水温差、各冷却塔逼近度、各冷却塔功耗和各冷却塔流量。
3.根据权利要求2所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤10中,根据it系统调度数据,建立智算中心服务器的实时功耗模型;
4.根据权利要求2所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤10中,根据液冷冷却系统数据,建立式(2)所示的冷却塔功耗模型:
5.根据权利要求2所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤10中,根据液冷冷却系统数据,分别为一次侧水泵和各cdu水泵建立式(3)所示的水泵功耗模型:
6.根据权利要求2所述的用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤10中,根据it系统调度数据和液冷冷却系统数据,建立服务器温度快速预测模型;
7.根据权利要求1所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤20中,采用实时联合和定时顺序相结合的优化方法,对虚拟机部署及冷板式液冷系统进行协同控制,包括:
8.根据权利要求7所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤21具体包括:
9.根据权利要求7所述的适用于智算中心服务器与冷板式液冷系统的协同控制方法,其特征在于,所述步骤22具体包括:
