基于深度强化学习的面向异构资源的自适应任务调度方法

专利2026-08-19  27


本发明涉及异构算力平台,特别是涉及一种基于深度强化学习的面向异构资源的自适应任务调度方法。


背景技术:

1、随着云计算时代的到来,大量的异构任务难以在单个服务器上运行,需要依赖更为复杂的异构算力平台。现代高性能计算应用程序通常使用基于dag任务图模型表示任务之间的依赖关系。异构算力平台的dag任务调度是一个np难问题,并在实际调度中更为复杂。

2、任务调度大多只考虑单一类型的任务,没有考虑到任务的偏好性和节点的优异性,并且自适应能力较差。同时,目前基于启发式的任务调度算法,缺乏场景的通用性,难以应对较为复杂的任务调度环境;基于机器学习的任务调度方法也是研究热点,但是由于算法的复杂性导致建模难度大并且训练时间长。除此以外,目前的任务调度策略大多以单目标为优化目标,没有全面考虑任务调度时异构算力平台的性能。


技术实现思路

1、为了克服现有技术的不足,本发明的目的是提供基于深度强化学习的面向异构资源的自适应任务调度方法,考虑最小化任务的调度时长和最大化负载均衡度两个优化目标,同时考虑任务的类型以及节点的特性,为用户输入的dag任务实现最佳的任务调度策略。

2、为实现上述目的,本发明提供了如下方案:

3、一种基于深度强化学习的面向异构资源的自适应任务调度方法,包括:

4、获取用户输入的带标签的dag任务,并对所述dag任务进行提取,得到dag任务信息;

5、获取异构算力平台每个节点的资源信息;

6、根据所述异构算力平台的各类所述资源信息和所述dag任务信息建立并训练双智能体深度强化学习模型;

7、在模拟的异构算力平台环境下,利用训练得到的双智能体深度强化任务调度学习模型的输出对所述dag任务进行调度。

8、优选地,所述dag任务信息包括:待调度任务在不同节点上的计算开销、网络开销和存储开销以及所述待调度任务在不同节点的运行时间。

9、优选地,所述资源信息包括计算资源、存储资源和网络资源。

10、优选地,对所述dag任务进行提取,得到dag任务信息,包括:

11、用矩阵w=v×q表示待调度任务在不同节点上的计算开销;其中q为q个异构算力平台的节点,v为v个待调度任务;

12、用矩阵x=v×q表示待调度任务在不同节点上的存储开销;

13、用矩阵y=v×q表示待调度任务在不同节点上的通信开销;

14、利用st(vi,qj)表示任务vi在节点qj的开始的运行时间,st(vi,qj)=max{qj最早的空闲时间,aft},其中aft表示任务vi所有前继任务的结束时间。

15、优选地,获取异构算力平台每个节点的资源信息,包括:

16、将异构算力平台每个节点的计算资源用一个四元组wres-i表示;wres-i={ccore-i,cspeed-i,gi,gspeed-i},i=1,...,q;其中,ccore-i表示当前节点的cpu核数,cspeed-i表示当前节点的cpu计算速度,gi表示当前节点gpu的大小,gspeed-i表示当前gpu的计算速度;

17、将异构算力平台每个节点的存储资源用一个三元组xres-i表示;xres-i={mi,di,rwi},i=1,...,q;其中,mi表示当前节点的内存大小,di表示当前节点的磁盘大小,rwi表示当前节点的读写速度;

18、将异构算力平台每个节点的网络资源用一个三元组yres-i表示;yres-i={bi,li,tri},i=1,...,q;其中,bi表示当前节点的网络带宽,li表示当前节点的网络延迟,tri表示当前节点的数据传输速率。

19、优选地,获取异构算力平台每个节点的资源信息,包括:

20、调度时间优化为最小化makespan;其中,makespan=ft(vn)-st(v0),其中ft(vn)为终点任务的结束时间,st(v0)为起点任务的开始时间;

21、分别计算资源的负载均衡度σw、存储资源的负载均衡度σx和网络资源的负载均衡度σy;其中σy=σb为带宽使用量的标准差,σcpu为cpu利用率的标准差,σgpu为gpu使用率的标准差,σm为内存使用率的标准差,σd为缓存使用率的标准差。

22、优选地,建立双智能体深度强化学习模型的步骤包括:

23、构建任务智能体;所述任务智能体的优化目标为最小化调度时间;每个所述任务智能体均由各自的actor网络和critic网络组成;actor网络状态输入s的表达式为:s={n,st(vi,qj)|j=1,...,q};其中,n表示当前可执行的任务数量,q为q个异构算力节点,j为异构算力节点的数量;每个时间步的奖励函数rt的计算公式为

24、其中vi为任务智能体输出的action,即待调度的任务,qq为节点智能体输出的action,即节点编号;

25、构建节点智能体;所述节点智能体用于根据任务智能体输出的action网络启动不同的资源智能体,有三个可选择,包括:计算资源智能体、存储资源智能体和网络资源智能体;任务标签为0,启动计算资源智能体,任务标签为1,启动存储资源智能体,任务标签为2,启动网络资源智能体;

26、计算资源智能体的优化目标为最小化计算资源σw,actor网络状态输入s的表达式为:s={wres-i,wij|j=1,...,p},每个时间步的奖励函数为:其中是任务vi调度完成后节点的计算资源利用率标准差,是任务vi-1调度完成后节点的计算资源利用率标准差;

27、存储资源智能体的优化目标为最小化σx,actor网络状态输入s的表达式为:s={xres-i,xij|j=1,...,p},每个时间步的奖励函数为:其中是任务vi调度完成后节点的存储资源利用率标准差,是任务vi-1调度完成后节点的存储资源利用率标准差;

28、网络资源智能体的优化目标为最小化σy,actor网络状态输入s={yres-i,yij|j=1,...,p},每个时间步的奖励函数为:其中是任务vi调度完成后节点的网络资源利用率标准差,是任务vi-1调度完成后节点的网络资源利用率标准差;

29、优选地,训练双智能体深度强化学习模型的步骤包括:

30、利用maac算法对建立的双智能体深度强化学习模型进行更新训练,得到自适应的双智能体深度强化学习模型;

31、利用注意力机制对任务智能体和节点智能体的交互进行建模,更新各自的actor网络和critic网络,用联合损失函数对critic网络进行分别更新,更新的公式为:其中,

32、为价值函数,o为智能体的状态观测集合,a为智能体的动作集合,d为经验回放池,为在给定其观察到的局部状态oi选择动作ai的概率,θ为网络参数,ri为即时奖励,γ为折扣因子,α是注意力权重;

33、在计算q值时,利用注意力机制同时考虑两个智能体的关系,将两个智能体i、j的状态观测和动作信息均作为critic网络的输入,公式为其中,f通过深度神经网络实现,o为两个智能体的状态观测集合,a为两个智能体的动作集合,gi为mlp层的embedding操作,xi为智能体j的状态观测和动作信息,公式为xi=αvj=αh(vgj(oj,aj));其中,α是智能体i对智能体j的注意力权重,vj是智能体j状态和动作的embedding,即首先用gj对观测状态和动作信息进行embedding编码,然后利用线性矩阵v进行线性变换,最后进行非线性操作h;两个智能体的注意力权重α,用相似性表示,计算方法为欧氏距离,其中,x=(x1,x2,...,xn)=(o1,a1)表示任务智能体的状态观测和动作的集合,o1是任务智能体的状态观测向量,a1是任务智能体的动作输出,y=(y1,y2,...,yn)=(o2,a2)表示节点智能体的状态观测和动作的集合,o2是节点智能体的状态观测向量,a2是节点智能体的动作输出。

34、优选地,两个智能体的actor网络的策略通过随机策略梯度进行更新;所述随机策略梯度的更新公式为:其中,b(s,a\i)利用计算优势函数的反事实基线,为价值函数,o为智能体的状态观测集合,a为智能体的动作集合,d为经验回放池,为在给定其观察到的局部状态oi选择动作ai的概率。

35、根据本发明提供的具体实施例,本发明公开了以下技术效果:

36、本发明提供了一种基于深度强化学习的面向异构资源的自适应任务调度方法,包括:获取用户输入的带标签的dag任务,并对所述dag任务进行提取,得到dag任务信息;获取异构算力平台每个节点的资源信息;根据所述异构算力平台的各类所述资源信息和所述dag任务信息建立并训练双智能体深度强化学习模型;在模拟的异构算力平台环境下,利用训练得到的双智能体深度强化任务调度学习模型的输出对所述dag任务进行调度。本发明。本发明充分考虑了任务的对资源的需求偏好性以及节点的资源优势性,能够根据任务的需求匹配对应的节点,提高调度效率。


技术特征:

1.一种基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,包括:

2.根据权利要求1所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,所述dag任务信息包括:待调度任务在不同节点上的计算开销、网络开销和存储开销以及所述待调度任务在不同节点的运行时间。

3.根据权利要求1所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,所述资源信息包括计算资源、存储资源和网络资源。

4.根据权利要求2所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,对所述dag任务进行提取,得到dag任务信息,包括:

5.根据权利要求3所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,获取异构算力平台每个节点的资源信息,包括:

6.根据权利要求3所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,获取异构算力平台每个节点的资源信息,包括:

7.根据权利要求5所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,建立双智能体深度强化学习模型的步骤包括:

8.根据权利要求7所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,训练双智能体深度强化学习模型的步骤包括:

9.根据权利要求8所述的基于深度强化学习的面向异构资源的自适应任务调度方法,其特征在于,两个智能体的actor网络的策略通过随机策略梯度进行更新;所述随机策略梯度的更新公式为:其中,b(s,a\i)利用计算优势函数的反事实基线。


技术总结
本发明提供了一种基于深度强化学习的面向异构资源的自适应任务调度方法,涉及异构算力平台技术领域,方法包括:获取用户输入的带标签的DAG任务,并对所述DAG任务进行提取,得到DAG任务信息;获取异构算力平台每个节点的资源信息;根据所述异构算力平台的各类所述资源信息和所述DAG任务信息建立并训练双智能体深度强化学习模型;在模拟的异构算力平台环境下,利用训练得到的双智能体深度强化任务调度学习模型的输出对所述DAG任务进行调度。本发明充分考虑了任务的对资源的需求偏好性以及节点的资源优势性,能够根据任务的需求匹配对应的节点,提高调度效率。

技术研发人员:于秀丽,朱国平,李雪倩,徐鹏
受保护的技术使用者:北京邮电大学
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-23835.html

最新回复(0)