跳到正文
原文
Lilian Weng — Lil’Log·· 2024-04-12AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

视频生成的扩散模型:从 3D U-Net 到 Sora 的 DiT

Diffusion Models for Video Generation

AI 导读

扩散模型已从图像合成扩展到视频生成,需额外处理帧间时序一致性并依赖更多世界知识。从零训练路线中,VDM 用 3D U-Net 将空间与时间操作分解处理,Imagen Video 则以 7 个扩散模型级联输出 1280x768、24 fps 视频,并通过渐进蒸馏将采样步数降至每个模型 8 步。OpenAI 的 Sora 则改用 DiT 架构,在视频与图像潜码的时空 patch 序列上运算。

来源:Lilian Weng — Lil’Log · lilianweng.github.io