一种文生图方法、装置、设备及计算机可读存储介质与流程

专利2026-08-25  27


本发明涉及计算机领域,特别涉及一种文生图方法、装置、设备及计算机可读存储介质。


背景技术:

1、近年来,针对图像生成算法的研究取得了显著的进展。其中,去噪扩散概率模型(简称扩散模型)相比于现有方法具有更好的训练稳定性和采样多样性以及更高的生成质量,逐渐成为一种流行的图像生成方法。扩散模型在前向阶段中对图像逐步施加噪声,直至图像被破坏变成完全的高斯噪声,然后在逆向阶段学习从高斯噪声还原为原始图像的过程。在推理阶段中,扩散模型采样一个随机的高斯噪声图像,然后通过对噪声图像进行多步去噪来生成目标图像,在每一步的去噪过程中,模型会预测当前步骤所需要去除的噪音,所有时间步骤共享一套网络参数。在预测噪音的过程中,可以利用交叉注意力机制,将文本信息注入到网络中,来引导图像生成过程,使所生成的图像内容符合所提供的文本描述。

2、现有的文生图扩散模型的表达能力有限,利用文生图扩散模型生成的图像质量不佳,且生成图像与所提供的文本之间的相关性仍有进一步提升的空间。


技术实现思路

1、有鉴于此,本发明的目的在于提供一种文生图方法、装置、设备及计算机可读存储介质,解决了现有技术中文生图扩散模型的表达能力有限,生成图像质量不佳,且生成图像与所提供的文本之间的相关性仍有进一步提升空间的问题。

2、为解决上述技术问题,本发明提供了一种文生图方法,包括:

3、获取预训练好的文生图扩散模型,所述文生图扩散模型包括文本编码器和带有专家调整模块的去噪模型;所述带有专家调整模块的去噪模型包括混合专家模型和主干模型;

4、将文本提示词输入至所述文本编码器中,得到文本嵌入;

5、根据时间嵌入和所述文本嵌入,利用所述混合专家模型确定在不同去噪时间段内激活的目标模型;

6、在不同去噪时间段,通过相对应的所述目标模型和所述主干模型对所述去噪模型自生成的带噪图像进行去噪处理,生成所述文本提示词对应的图像。

7、可选的,所述预训练好的文生图扩散模型还包括先验模型;

8、相应的,在得到所述文本嵌入之后,还包括:

9、将所述文本嵌入输入至所述先验模型中,得到图像嵌入;

10、相应的,所述根据时间嵌入和所述文本嵌入,利用所述混合专家模型确定在不同去噪时间段内激活的目标模型,包括:

11、根据所述文本嵌入、所述时间嵌入和所述图像嵌入,利用所述文生图扩散模型中的混合专家模型确定在不同去噪时间段内激活的目标模型。

12、可选的,所述先验模型的训练过程,包括:

13、获取训练图像和对应的文本描述;

14、利用clip模型的文本编码器将所述文本描述编码为训练文本嵌入;

15、利用clip模型的图像编码器将所述训练图像编码为训练图像嵌入;

16、将所述训练文本嵌入输入至初始先验模型中,得到预测图像嵌入;

17、利用损失函数计算所述预测图像嵌入与所述训练图像嵌入之间的损失值,当满足条件时,训练结束,得到所述先验模型。

18、可选的,所述损失函数为:

19、fθ表示先验模型;表示基于初始先验模型得到的预测图像嵌入;zi′表示训练图像嵌入;zt′表示训练文本嵌入;lprior表示先验模型的损失函数;t表示时间步骤;t表示总的时间步骤;表示求期望;qt表示t时刻下带噪的图像特征的真实分布;表示从qt中采样得到的一个带噪的图像特征。

20、可选的,根据所述文本嵌入、所述时间嵌入和所述图像嵌入,利用所述文生图扩散模型中的混合专家模型确定在不同去噪时间段内激活的目标模型,包括:

21、所述混合专家模型中的门控单元按照确定在不同去噪时间段内激活的目标模型;

22、其中,[;]表示向量的拼接,w表示映射矩阵;t表示时间步骤;t表示总的时间步骤;zt表示文本嵌入;zi表示图像嵌入;表示不激活混合专家模型中的任何一个模型;g(·)表示门控单元。

23、可选的,所述带有专家调整模块的去噪模型在训练过程中的损失函数为:

24、

25、其中,其中,φ0表示主干模型参数;φi表示混合专家模型中单个支路的模型参数;l表示带有专家调整模块的去噪模型的训练损失函数;x0表示未加噪的干净图像;表示标准分布;∈是从标准分布中采样出的噪声;xt表示带噪图像;t表示时间步骤;t表示总的时间步骤;表示求期望;q(x0)表示图像的真是分布;zt′表示训练文本嵌入;zi′表示训练图像嵌入。

26、本发明还提供了一种文生图装置,包括:

27、模型获取模块,用于获取预训练好的文生图扩散模型,所述文生图扩散模型包括文本编码器和带有专家调整模块的去噪模型;所述带有专家调整模块的去噪模型包括混合专家模型和主干模型;

28、第一输入模块,用于将文本提示词输入至所述文本编码器中,得到文本嵌入;

29、模型激活模块,用于根据时间嵌入和所述文本嵌入,利用所述混合专家模型确定在不同去噪时间段内激活的目标模型;

30、图像生成模块,用于在不同去噪时间段,通过相对应的所述目标模型和所述主干模型对所述去噪模型自生成的带噪图像进行去噪处理,生成所述文本提示词对应的图像。

31、可选的,所述预训练好的文生图扩散模型还包括先验模型;

32、相应的,还包括:

33、第二输入模块,用于所述将所述文本嵌入输入至所述先验模型中,得到图像嵌入;

34、相应的,所述模型激活模块,包括:

35、模型激活单元,用于根据所述文本嵌入、所述时间嵌入和所述图像嵌入,利用所述文生图扩散模型中的混合专家模型确定在不同去噪时间段内激活的目标模型。

36、本发明还提供了一种文生图设备,包括:

37、存储器,用于存储计算机程序;

38、处理器,用于执行所述计算机程序时实现上述的文生图方法的步骤。

39、本发明还提供了一种计算机可读存储介质,所述计算机可读存储介质中存储有计算机可执行指令,所述计算机可执行指令被处理器加载并执行时,实现上述的文生图方法的步骤。

40、可见,本发明通过获取预训练好的文生图扩散模型,文生图扩散模型包括文本编码器和带有专家调整模块的去噪模型;去噪模型包括混合专家模型和主干模型;将文本提示词输入至文本编码器中,得到文本嵌入;根据时间嵌入和文本嵌入,利用混合专家模型确定在不同去噪时间段内激活的目标模型;在不同去噪时间段,通过相对应的目标模型和主干模型对去噪模型自生成的带噪图像进行去噪处理,生成文本提示词对应的图像。本方法对文生图扩散模型的结构进行改进,通过在主干模型的基础上添加基于混合专家模型的模型支路,构成带有专家调整模块的去噪模型。在不同的时间步骤激活不同的目标模型,使其与主干模型组合形成多套去噪模型参数,以此提升文生图扩散模型的表达能力和对不同风格的兼容能力,进而提升了文生图扩散模型的图像生成效果;并且,当训练数据中包含不同风格的图像,多种风格的图像会互相影响时,本发明也可以保证训练得到的文生图模型对单个风格图像的生成效果。

41、此外,本发明还提供了一种文生图装置、设备及计算机可读存储介质,同样具有上述有益效果。


技术特征:

1.一种文生图方法,其特征在于,包括:

2.根据权利要求1所述的文生图方法,其特征在于,所述预训练好的文生图扩散模型还包括先验模型;

3.根据权利要求2所述的文生图方法,其特征在于,所述先验模型的训练过程,包括:

4.根据权利要求3所述的文生图方法,其特征在于,所述损失函数为

5.根据权利要求2所述的文生图方法,其特征在于,根据所述文本嵌入、所述时间嵌入和所述图像嵌入,利用所述文生图扩散模型中的混合专家模型确定在不同去噪时间段内激活的目标模型,包括:

6.根据权利要求1所述的文生图方法,其特征在于,所述带有专家调整模块的去噪模型在训练过程中的损失函数为:

7.一种文生图装置,其特征在于,包括:

8.根据权利要求7所述的文生图装置,其特征在于,所述预训练好的文生图扩散模型还包括先验模型;

9.一种文生图设备,其特征在于,包括:

10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有计算机可执行指令,所述计算机可执行指令被处理器加载并执行时,实现如权利要求1至6任一项所述的文生图方法的步骤。


技术总结
本发明公开了一种文生图方法、装置、设备及计算机可读存储介质,应用于计算机领域,包括:获取预训练好的文生图扩散模型,文生图扩散模型包括文本编码器和带有专家调整模块的去噪模型;带有专家调整模块的去噪模型包括混合专家模型和主干模型;将文本提示词输入至文本编码器中,得到文本嵌入;根据时间嵌入和文本嵌入,利用混合专家模型确定在不同去噪时间段内激活的目标模型;在不同去噪时间段,通过相对应的目标模型和主干模型对去噪模型自生成的带噪图像进行去噪处理,生成文本提示词对应的图像。本发明提升了文生图扩散模型的表达能力和对不同风格的兼容能力,进而提升了文生图扩散模型的图像生成效果。

技术研发人员:李嘉成
受保护的技术使用者:浙江同花顺智能科技有限公司
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-24032.html

最新回复(0)