您当前的位: 首页 > 行业数据 >

每日关注!微软亚洲研究院推出NUWA-XL超长视频生成模型

来源:站长之家 2023-04-20 13:49:45


(资料图片仅供参考)

编程客栈()4月20日 消息:你相信吗?只要php输入16句简单描述,AI就能生成11分钟的动画了。

近日,微软亚洲研究院推出了NUWA-XL超长视频生成模型,采用创新的Diffusion over DiffusionjOjoKmg架构,通过「从粗到细」的生成过程,可以并行生成高质量的超长视频,为多模态大模型提供了新的解题思路。

论文地址:https://arxiv.org/abs/2303.12346

NUWA-XL「从粗到细」的生成方法具有三个优势:

分层结构使模型能够直接在长视频上进行训练,python从而消除了训练和推理之间的差距。

模型包含多个局部扩散模型,自然支持并行推理,可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下,当生android成1024帧时,NUWA-XL 使平均推理时间从7.55分钟减少到26秒,速度提升了94.26%。

由于视频的长度可以相对于深度 m 呈指数级扩展,因此模型可以很容易地扩展出更长的视频。

目前,长视频生成的多数方法是采用「Autoregressive over X」架构,这种方法存在训练-推理差距的问题,导致不真实的、扭曲的镜头变化。

NUWA-XL的推出填补了长视频生成领域的空白,为人工智能在视频jOjoKmg生成方面的应用提供了新的可能性。

微软亚洲研究院首席研究员段楠表示,目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息,但仅限于图片,输出依旧是文字或代码。因此,当前和未来的研究方向非常明确,就是将语言和视觉的理解和生成融入到一个基础大模型中,以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法,使人工智能模型更加通用。

关键词:
家电经销商为谋生路“七十二变” 卖车卖酒为多触点获客

家电作为家庭主要的大宗消费,是促进消费的重要方向和增长点。近年来,我国家电行业逐步走出了震荡调整周期,在新的基础上迈出了高质量发展

2022-08-08
中国电信首发天翼量子高清密话

在5月17日世界电信和信息社会日到来之际,中国电信发布业内首款基于量子信息技术的VoLTE加密通话产品——天翼量子高清密话。该产品采用国产

2022-05-16
郑州发布96号通告:部分区域实行分类管理及调整封控管控区域

郑州市新冠肺炎疫情防控指挥部办公室关于部分区域实行分类管理及调整封控管控区域的通告(2022年96号)根据疫情形势变化,经郑州市疫情防控

2022-05-16
点赞!郑州市这些家庭和个人上榜了!

5月15日是国际家庭日,全国妇联共表彰997户全国五好家庭,200个全国家庭工作先进集体,198名全国家庭工作先进个人,揭晓997户全国最美家庭

2022-05-16
今日,周口项城有序恢复中心城区正常生产生活秩序

为统筹疫情防控和经济社会发展,根据项城市中心城区和郑郭镇11轮全员核酸检测结果,经专家组研判,市疫情防控指挥部决定自5月16日零时起,

2022-05-16
郑州各公园广场加强游客戴口罩管理

根据《郑州市人民代表大会常务委员会关于新冠肺炎疫情常态化防控期间佩戴口罩和使用场所码的决定》,处于人员密集的露天广场、剧场、公园等

2022-05-16
x 广告
x 广告

Copyright ©  2015-2022 东方数据网版权所有  备案号:沪ICP备2020036824号-8   联系邮箱:562 66 29@qq.com