Search
❯
Feb 15, 20241 min read
OpenAI 发布的文本到视频生成模型,能够根据文本提示生成长达 60 秒的高质量视频。基于扩散 Transformer 架构,将视频压缩为时空潜在 patch 进行处理。