文生视频模型生成的视频,提示词为:A stylish woman walks down a Tokyo street filled with warm glowing neon and animated city signage. She wears a black leather jacket, a long red dress, and black boots, and carries a black purse. She wears sunglasses and red lipstick. She walks confidently and casually. The street is damp and reflective, creating a mirror effect of the colorful lights. Many pedestrians walk about.]]
文本到视频模型()是一种机器学习模型,它使用自然语言描述作为输入,生成与输入文本相关的视频。 2020年代,高质量文本到视频生成的进展主要得益于视频扩散模型的发展。
模型
目前存在多种文本到视频模型,包括开源模型。中文输入的模型 CogVideo是最早开发的文本到视频模型之一,拥有94亿参数,其开源代码演示版本于2022年在GitHub上发布。 同年,Meta Platforms发布了部分文本到视频模型“Make-A-Video”, 而Google的Brain(后为Google DeepMind)推出了Imagen Video,这是一个基于3D U-Net的文本到视频模型。
2023年3月,一篇题为“VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation”的研究论文发表,提出了一种新的视频生成方法。 VideoFusion模型将扩散过程分解为两个部分:基础噪声和残差噪声,这些部分在帧之间共享以确保时间一致性。通过使用预训练的图像扩散模型作为基础生成器,该模型能够高效生成高质量且连贯的视频。通过在视频数据上微调预训练模型,解决了图像和视频数据之间的领域差距,增强了模型生成逼真且一致视频序列的能力。
2024年1月,Google宣布开发了一款名为Lumiere的文本到视频模型,预计将集成先进的视频编辑功能。 Matthias Niessner和Lourdes Agapito在AI公司Synthesia致力于开发3D神经渲染技术,通过使用2D和3D神经表示形状、外观和运动,实现可控的视频合成。 2024年6月,Luma Labs推出了其Dream Machine视频工具。 同月, 快手将其Kling AI文本到视频模型扩展到国际用户。2024年7月,TikTok母公司字节跳动通过其子公司Faceu Technology在中国发布了Jimeng AI。 到2024年9月,中国AI公司MiniMax推出了其video-01模型,加入了智谱AI、百川智能和月之暗面等AI模型公司的行列,推动中国在AI技术领域的参与。
文本到视频模型的替代方法包括 Google的Phenaki、Hour One、Colossyan, 以及OpenAI的Sora。 此外,还出现了Plug-and-Play、Text2LIVE和TuneAVideo等文本到视频模型。 Google还计划在2025年为YouTube Shorts推出名为Veo的视频生成工具。 FLUX.1的开发者Black Forest Labs宣布了其文本到视频模型SOTA。
架构与训练
文本到视频模型的开发采用多种架构。与文生图模型类似,这些模型可使用循环神经网络(如长短期记忆网络)进行训练,此类方法应用于像素转换模型和随机视频生成模型,分别提升连贯性与真实感。 其他替代架构包括Transformer模型。生成对抗网络、变分自编码器(用于人体运动预测) 以及扩散模型也被用于图像生成部分的开发。
用于模型训练的文本-视频数据集包括WebVid-10M、HDVILA-100M、CCV、ActivityNet和Panda-70M等。 这些数据集包含数百万原始视频、生成视频、带字幕视频及辅助训练的文本信息。此外PromptSource、DiffusionDB和VidProM等数据集提供多样化文本输入,指导模型解析不同提示。
|专注企业培训与营销数字人生成
|高画质生成,含风格化与分镜模式
|自然动态生成,用户友好界面
|影视级定制化生成
|支持细节丰富、动态感强的情绪化视频生成,处于安全测试阶段
|定价未公布
|预计支持长视频(时长待定)
|多语言(未具体说明)
|}
相关条目
- 文生图模型
- VideoPoet(未发布的谷歌模型,Lumiere (文生视频模型)前身)
- 深度伪造
- 人体图像合成
- ChatGPT
参考资料
评论 (0)