(function(){var el = document.createElement("script");el.src = "https://lf1-cdn-tos.bytegoofy.com/goofy/ttzz/push.js?0fd7cab5264a0de33b798f00c6b460fb0c1e12a69e1478bfe42a3cdd45db451bbc434964556b7d7129e9b750ed197d397efd7b0c6c715c1701396e1af40cec962b8d7c8c6655c9b00211740aa8a98e2e";el.id = "ttzz";var s = document.getElementsByTagName("script")[0];s.parentNode.insertBefore(el, s);})(window)
古风汉服美女图集

我们介绍了 Phenaki,这是一种能够在给定一系列文本提示的情况下进行逼真的视频合成的模型。由于计算成本、高质量文本视频数据的数量有限以及视频长度可变,从文本生成视频尤其具有挑战性。为了解决这些问题,我们引入了一种用于学习视频表示的新因果模型,该模型将视频压缩为离散标记的小型表示。这个分词器及时使用因果注意力,这使得它可以处理可变长度的视频。为了从文本生成视频标记,我们使用了一个以预先计算的文本标记为条件的双向屏蔽转换器。生成的视频令牌随后被去令牌化以创建实际视频。为了解决数据问题,我们展示了对大量图像文本对以及较少数量的视频文本示例的联合训练如何产生超出视频数据集中可用内容的泛化。与之前的视频生成方法相比,Phenaki 可以在开放域中以一系列提示(即时间可变文本或故事、为条件生成任意长视频。据我们所知,这是第一次有论文研究从时间变量提示生成视频。此外,所提出的视频编码器-解码器在时空质量和每个视频的令牌数量方面优于文献中当前使用的所有每帧基线。Phenaki 可以根据开放域中的一系列提示(即时间可变文本或故事、生成任意长视频。据我们所知,这是第一次有论文研究从时间变量提示生成视频。此外,所提出的视频编码器-解码器在时空质量和每个视频的令牌数量方面优于文献中当前使用的所有每帧基线。Phenaki 可以根据开放域中的一系列提示(即时间可变文本或故事、生成任意长视频。据我们所知,这是第一次有论文研究从时间变量提示生成视频。此外,所提出的视频编码器-解码器在时空质量和每个视频的令牌数量方面优于文献中当前使用的所有每帧基线。


    Phenaki
    收录说明:
    1、本网页并非 Phenaki 官网网址页面,此页面内容编录于互联网,只作展示之用;
    2、如果有与 Phenaki 相关业务事宜,请访问其网站并获取联系方式;
    3、本站与 Phenaki 无任何关系,对于 Phenaki 网站中的信息,请用户谨慎辨识其真伪。
    4、本站收录 Phenaki 时,此站内容访问正常,如遇跳转非法网站,有可能此网站被非法入侵或者已更换新网址,导致旧网址被非法使用,
    5、如果你是网站站长或者负责人,不想被收录请邮件删除:i-hu#Foxmail.com (#换@)

    前往AI网址导航
    © 版权声明

    相关文章