一种模型训练的方法、图像生成的方法及装置与流程

专利2026-09-11  3


本说明书涉及图像处理领域,尤其涉及一种模型训练的方法、图像生成的方法及装置。


背景技术:

1、目前,伴随着人工智能领域的飞速发展和进步,文生图技术也越发趋于成熟,其能够凭借对文本数据的理解与转化,高效地创造出丰富且多样的高质量图像。文生图技术正日益普及并广泛应用于众多行业领域之中,例如是创意设计领域、媒体宣传领域、个人信息变更领域等,其在各领域中所带来的实用性和便利性都是无与伦比的。

2、在现阶段的文生图技术中,为了针对某一目标物进行多元化的图像创作,主要会利用带有目标物的实例图片作为参照基础,再施加相应的文本描述,以基于目标物进行多样化的图像生成。但是现阶段的文生图技术在针对目标物进行多样化图像生成时,所生成出的图像的多样性效果较差,无法很好的展现出目标物在不同场景或形态下的实际表现情况。并且通过此种手段所生成出的图像还可能存在对原本实例图像中的目标物进行异化失真的情况,进而对目标物的真实性以及与原示例图像之间的一致性造成负面影响。

3、因此,如何能够针对目标物生成出高保真且多样化的丰富多元图像,则是亟待解决的问题。


技术实现思路

1、本说明书提供一种模型训练的方法、图像生成的方法及装置,以部分的解决现有技术存在的上述问题。

2、本说明书采用下述技术方案:

3、本说明书提供了一种模型训练的方法,包括:

4、获取包含有指定对象的原始图像,以及文本描述信息,所述文本描述信息用于表示基于所述原始图像所生成的包含有所述指定对象的目标图像的图像内容;

5、将所述原始图像和所述文本描述信息输入到待训练的图像生成模型中,以使所述图像生成模型基于所述原始图像,生成所述目标图像;

6、将所述文本描述信息输入到所述图像生成模型中,以使所述图像生成模型生成出与所述文本描述信息对应的先验图像,以及确定所述原始图像对应的标签信息,所述标签信息用于表示所述原始图像中包含的所述指定对象,并将所述标签信息和所述先验图像输入到所述图像生成模型中,以使所述图像生成模型根据所述标签信息,对所述先验图像进行重构,得到重构先验图像;

7、确定针对所述目标图像的参照数据,并根据所述参照数据以及所述目标图像,确定第一偏差,以及根据所述先验图像和所述重构先验图像,确定第二偏差;

8、以最小化所述第一偏差和所述第二偏差为优化目标,对所述图像生成模型进行训练。

9、可选的,将所述原始图像和所述文本描述信息输入到待训练的图像生成模型中,以使所述图像生成模型基于所述原始图像,生成目标图像,具体包括:

10、将所述原始图像和所述文本描述信息输入到所述图像生成模型中,以使所述图像生成模型根据所述原始图像,确定出所述原始图像对应的原始特征数据,以及根据所述文本描述信息,确定出所述文本描述信息对应的文本特征数据,并根据所述原始特征数据和所述文本特征数据,确定出针对所述原始图像以及所述文本描述信息的融合特征数据,以及根据所述融合特征数据,生成所述目标图像。

11、可选的,确定针对所述目标图像的参照数据,具体包括:

12、根据所述原始图像,确定所述原始图像对应的原始特征数据;

13、根据所述文本描述信息,确定所述文本描述信息对应的文本特征数据;

14、根据所述原始特征数据和所述文本特征数,确定针对所述目标图像的参照数据;

15、根据所述参照数据以及所述目标图像,确定第一偏差,具体包括:

16、根据所述目标图像,确定所述目标图像对应的目标特征数据;

17、确定所述目标特征数据与所述参照数据之间的偏差,作为所述第一偏差。

18、可选的,根据所述先验图像和所述重构先验图像,确定第二偏差,具体包括:

19、根据所述重构先验图像,确定所述重构先验图像对应的重构特征数据;

20、根据所述先验图像,确定所述先验图像对应的先验特征数据,以及根据所述标签信息,确定出所述标签信息对应的标签特征数据;

21、根据所述先验特征数据以及所述标签特征数据,确定针对所述重构先验图像的重构参考数据;

22、根据所述重构特征数据和所述重构参考数据,确定所述第二偏差。

23、可选的,根据所述重构特征数据和所述重构参考数据,确定所述第二偏差,具体包括:

24、确定所述重构特征数据与所述重构参考数据之间的偏差,作为中间偏差;

25、将所述先验图像和所述原始图像输入到预设的图像相似度计算模型中,以使所述图像相似度计算模型确定处所述先验图像与所述原始图像之间的相似度值;

26、根据所述中间偏差和所述相似度值,确定所述第二偏差。

27、本说明书提供了一种图像生成的方法,包括:

28、接收图像创建请求;

29、根据所述图像创建请求,获取创建图像所需的包含有指定对象的原始图像,以及文本描述信息,所述文本描述信息用于表示基于所述原始图像所生成的包含有所述指定对象的目标图像的图像内容;

30、将所述原始图像和所述文本描述信息输入到图像生成模型中,以使所述图像生成模型基于所述原始图像,生成所述目标图像,所述图像生成模型是通过如上述模型训练的方法训练得到的。

31、本说明书提供了一种模型训练的装置,包括:

32、获取模块,用于获取包含有指定对象的原始图像,以及文本描述信息,所述文本描述信息用于表示基于所述原始图像所生成的包含有所述指定对象的目标图像的图像内容;

33、生成模块,用于将所述原始图像和所述文本描述信息输入到待训练的图像生成模型中,以使所述图像生成模型基于所述原始图像,生成所述目标图像;

34、重构模块,用于将所述文本描述信息输入到所述图像生成模型中,以使所述图像生成模型生成出与所述文本描述信息对应的先验图像,以及确定所述原始图像对应的标签信息,所述标签信息用于表示所述原始图像中包含的所述指定对象,并将所述标签信息和所述先验图像输入到所述图像生成模型中,以使所述图像生成模型根据所述标签信息,对所述先验图像进行重构,得到重构先验图像;

35、偏差确定模块,用于确定针对所述目标图像的参照数据,并根据所述参照数据以及所述目标图像,确定第一偏差,以及根据所述先验图像和所述重构先验图像,确定第二偏差;

36、训练模块,用于以最小化所述第一偏差和所述第二偏差为优化目标,对所述图像生成模型进行训练。

37、可选的,所述生成模块具体用于,将所述原始图像和所述文本描述信息输入到所述图像生成模型中,以使所述图像生成模型根据所述原始图像,确定出所述原始图像对应的原始特征数据,以及根据所述文本描述信息,确定出所述文本描述信息对应的文本特征数据,并根据所述原始特征数据和所述文本特征数据,确定出针对所述原始图像以及所述文本描述信息的融合特征数据,以及根据所述融合特征数据,生成所述目标图像。

38、可选的,所述偏差确定模块具体用于,根据所述原始图像,确定所述原始图像对应的原始特征数据;根据所述文本描述信息,确定所述文本描述信息对应的文本特征数据;根据所述原始特征数据和所述文本特征数,确定针对所述目标图像的参照数据;

39、所述偏差确定模块具体用于,根据所述目标图像,确定所述目标图像对应的目标特征数据;确定所述目标特征数据与所述参照数据之间的偏差,作为所述第一偏差。

40、可选的,所述偏差确定模块具体用于,根据所述重构先验图像,确定所述重构先验图像对应的重构特征数据;根据所述先验图像,确定所述先验图像对应的先验特征数据,以及根据所述标签信息,确定出所述标签信息对应的标签特征数据;根据所述先验特征数据以及所述标签特征数据,确定针对所述重构先验图像的重构参考数据;根据所述重构特征数据和所述重构参考数据,确定所述第二偏差。

41、可选的,所述偏差确定模块具体用于,确定所述重构特征数据与所述重构参考数据之间的偏差,作为中间偏差;将所述先验图像和所述原始图像输入到预设的图像相似度计算模型中,以使所述图像相似度计算模型确定处所述先验图像与所述原始图像之间的相似度值;根据所述中间偏差和所述相似度值,确定所述第二偏差。

42、本说明书提供了一种图像生成的装置,包括:

43、接收模块,用于接收图像创建请求;

44、获取模块,用于根据所述图像创建请求,获取创建图像所需的包含有指定对象的原始图像,以及文本描述信息,所述文本描述信息用于表示基于所述原始图像所生成的包含有所述指定对象的目标图像的图像内容;

45、图像生成模块,用于将所述原始图像和所述文本描述信息输入到图像生成模型中,以使所述图像生成模型基于所述原始图像,生成所述目标图像,所述图像生成模型是通过如上述模型训练的方法训练得到的。

46、本说明书提供了一种计算机可读存储介质,所述存储介质存储有计算机程序,所述计算机程序被处理器执行时实现上述模型训练的方法、图像生成的方法。

47、本说明书提供了一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现上述模型训练的方法、图像生成的方法。

48、本说明书采用的上述至少一个技术方案能够达到以下有益效果:

49、从上述方法可以看出,在本说明书提供的模型训练的方法、图像生成的方法中,可以将获取到的包含有指定对象的原始图像以及文本描述信息输入到待训练的图像生成模型中,使得图像生成模型可以生成出包含有指定对象的目标图像。紧接着,可以将文本描述信息单独输入到图像生成模型中,使得图像生成模型可以根据文本描述信息生成出对应的先验图像,并同时确定出原始图像对应的标签信息,将标签信息与先验图像再输入到图像生成模型中,使得图像生成模型可以根据标签信息,生成先验图像的重构先验图像。最后,根据目标图像和目标图像的参照数据,确定第一偏差,以及根据先验图像和重构先验图像,确定第二偏差,以最小化第一偏差和第二偏差为优化目标,对图像生成模型进行训练。训练后的图像生成模型用于根据原始图像和文本描述信息进行图像生成。

50、从上述内容可以看出,本说明书提供的模型训练的方法、图像生成的方法,可以根据文本描述信息生成相应的先验图像,并根据原始图像的标签信息通过图像生成模型对先验图像进行图像重构,进而根据重构先验图像和先验图像对图像生成模型进行训练优化。通过本方法训练后的图像生成模型可以生成出既保留原始图像中的指定对象,又高度符合文本描述信息的多样化图像,有效提高了图像生成模型在进行针对指定对象进行多元性图像创作时的图像扩展能力,同时又完整保护了原有指定对象的特征信息的完整性,极大程度上提高了生成出的目标图像中指定对象的保真性。


技术特征:

1.一种模型训练的方法,包括:

2.如权利要求1所述的方法,将所述原始图像和所述文本描述信息输入到待训练的图像生成模型中,以使所述图像生成模型基于所述原始图像,生成目标图像,具体包括:

3.如权利要求1所述的方法,确定针对所述目标图像的参照数据,具体包括:

4.如权利要求1所述的方法,根据所述先验图像和所述重构先验图像,确定第二偏差,具体包括:

5.如权利要求4所述的方法,根据所述重构特征数据和所述重构参考数据,确定所述第二偏差,具体包括:

6.一种图像生成方法,包括:

7.一种模型训练的装置,包括:

8.如权利要求7所述的装置,所述生成模块具体用于,将所述原始图像和所述文本描述信息输入到所述图像生成模型中,以使所述图像生成模型根据所述原始图像,确定出所述原始图像对应的原始特征数据,以及根据所述文本描述信息,确定出所述文本描述信息对应的文本特征数据,并根据所述原始特征数据和所述文本特征数据,确定出针对所述原始图像以及所述文本描述信息的融合特征数据,以及根据所述融合特征数据,生成所述目标图像。

9.如权利要求7所述的装置,所述偏差确定模块具体用于,根据所述原始图像,确定所述原始图像对应的原始特征数据;根据所述文本描述信息,确定所述文本描述信息对应的文本特征数据;根据所述原始特征数据和所述文本特征数,确定针对所述目标图像的参照数据;

10.如权利要求7所述的装置,所述偏差确定模块具体用于,根据所述重构先验图像,确定所述重构先验图像对应的重构特征数据;根据所述先验图像,确定所述先验图像对应的先验特征数据,以及根据所述标签信息,确定出所述标签信息对应的标签特征数据;根据所述先验特征数据以及所述标签特征数据,确定针对所述重构先验图像的重构参考数据;根据所述重构特征数据和所述重构参考数据,确定所述第二偏差。

11.如权利要求10所述的装置,所述偏差确定模块具体用于,确定所述重构特征数据与所述重构参考数据之间的偏差,作为中间偏差;将所述先验图像和所述原始图像输入到预设的图像相似度计算模型中,以使所述图像相似度计算模型确定处所述先验图像与所述原始图像之间的相似度值;根据所述中间偏差和所述相似度值,确定所述第二偏差。

12.一种图像生成的装置,包括:

13.一种计算机可读存储介质,所述存储介质存储有计算机程序,所述计算机程序被处理器执行时实现上述权利要求1~6任一项所述的方法。

14.一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现上述权利要求1~6任一项所述的方法。


技术总结
本说明书公开了一种模型训练的方法、图像生成的方法及装置,具体包括:将原始图像以及文本描述信息输入到待训练的图像生成模型中,使得图像生成模型生成包含有指定对象的目标图像。将文本描述信息输入图像生成模型中,以生成出先验图像,并确定原始图像的标签信息,使图像生成模型根据标签信息,生成重构先验图像。根据目标图像和目标图像的参照数据确定第一偏差,根据先验图像和重构先验图像确定第二偏差。以最小化第一偏差和第二偏差为优化目标,训练图像生成模型。通过本方法可以有效提高图像生成模型在进行图像创作时的扩展能力,同时又完整保护了指定对象特征信息的完整性,极大程度上提高了目标图像中指定对象的保真性。

技术研发人员:洪燕,兰钧,祝慧佳,王维强
受保护的技术使用者:支付宝(杭州)信息技术有限公司
技术研发日:
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-24464.html

最新回复(0)