Hugging Face Blog·· 2023-05-08AI 评分47
Hugging Face 深度解析文本到视频模型:从 GAN 到扩散模型的发展与挑战
A Dive into Text-to-Video Models
AI 导读
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则采用扩散模型。
来源:Hugging Face Blog · huggingface.co