AIGC大一统模型来了!CV界泰斗黄煦涛创立团队提出“全能Diffusion”

首页 > 科技

AIGC大一统模型来了!CV界泰斗黄煦涛创立团队提出“全能Diffusion”

来源:韩剧集合处 发布时间:2022-11-29 16:01

  新智元报道  

编纂:好困 David

【新智元导读】在各种Diffusion「AI大画家」中学习一番之后,这款全能型Diffusion要完成AIGC界的「大一统」!

Diffusion模型的最新进展在很多天生任务中树立了一个令人印象深刻的里程碑。诸如DALL·E 2、Imagen和Stable Diffusion(SD)等引人瞩目的工作,引起了学术界和工业界的极大爱好。

不外,固然这些模型表现惊艳,但基本都是专一于某一类任务,好比由给定文本天生图像,而对于不同类型的任务,则往往需要专门单独练习,或重新构建新模型。

那么能不能在前人基础上搞一个「全能型」的Diffusion,实现AIGC模型的大一统呢?有人就在努力沿着这个方向进行探索,并已经取得了进展。

这个来自伊利诺伊大学厄巴纳-香槟分校、得克萨斯大学奥斯汀分校的联合团队,试图将现有的单流Diffusion扩展为多流网络,称为Versatile Diffusion(VD),这是第一个同一的多流多模态Diffusion框架,是迈向通用天生性人工智能的一步。

论文地址:https://arxiv.org/abs/2211.08332

Versatile Diffusion除了普通的文字天生图像功能之外,还可以输入图像天生类似图像,输入图像天生文字,输入文字天生相似文字,图片语义解耦编纂,输入图像及文字天生视频,根据隐空间编纂图像内容等等。

未来的版本还将支持更多的模式,如语音、音乐、视频和3D。

据论文先容,现已证实VD及其基础框架具有以下上风:

a) 可以以具有竞争力的高质量处理所有子任务。

b) 支持新的扩展和应用,如图形风格和语义的分离、图像-文本双引导天生等。

c) 通过这些实验和应用,为天生的输出提供了更丰硕的语义洞察力。

在练习数据集方面,VD使用带有自定义数据过滤器的Laion2B-en作为主要数据集。

首次探索

VD的一个令人兴奋的发现是,它可以从语义中增强或减少图像风格,而无需进一步监视。

这样的现象激发作者去探索一个全新的领域,其中,风格和语义之间的分离可以发生在具有任意风格和任意内容的图像上。

作者表示,他们是第一个探索:a)在没有领域规范的情况下,对天然图像的语义和风格进行解读;b)扩散模型潜伏空间上的语义和风格分解的团队。

在下图中,作者首先天生输入图像的变体,然后以语义(左边)或风格(右边)为重点对其进行操纵。

因为VD同时支持图像到文本和文本到图像,因此作者团队第一次尝试了通过以下步骤从文本提示的角度编纂图像:a)将图像转换成文本,b)编纂文本,c)将文本转换回图像。

在实验中作者从图像中删除了描述的内容,然后用这种图像-文本-图像(I2T2I)范式添加新的内容。与绘画或其他需要物体位置作为输入的图像编辑方法不同,VD的I2T2I不需要掩码,由于它可以按照指令自动定位和替代物体。

不外,I2T2I的输出图像与输入图像的像素不一致,这是因为图像到文本的语义提炼和文本到图像的内容创建造成的。

在下图的展示中,输入的图像首先被翻译成prompt,然后用减法(红框)和加法(绿框)对prompt进行编纂。最后,编纂后的prompt被翻译成图像。

此外,他们也是第一个探索基于给定的文字去天生相似文字的团队。

上一篇:网友口中那个... 下一篇:当年此人差点...
猜你喜欢
热门阅读
同类推荐