从“一句话理解视频生成”、Video VAE、DiT、Wan vs LTX 怎么选和失败案例诊断开始,先知道每个模块在系统里干什么。
Video generation foundations
视频生成模型技术原理
视频生成模型真正生成的通常不是像素,而是一个被压缩后的“时空草稿”。本文聚焦 latent-space DiT / diffusion-flow 系视频模型,解释 Wan、LTX、VACE、S2V、Animate 等开放生态工作流背后的共同工程骨架。
阅读路线图
这篇文章不是覆盖所有视频生成路线的百科,而是解释 2024-2026 年开放生态中最常见的一类 latent-space DiT / diffusion-flow 视频模型。
重点看 token 成本、条件控制、多尺度 pipeline、显存与速度优化、模型选择矩阵,判断瓶颈在哪、该用什么控制信号或工程组件。
重点看 Flow Matching / Rectified Flow、SNR 与 timestep、Wan2.2 MoE、LTX 双流音视频 DiT、VACE 的统一任务协议,区分已知机制、工程假设和版本边界。
本文聚焦 latent-space DiT / diffusion-flow 视频模型。传统 GAN 视频生成、纯自回归视频 token 生成、NeRF/4D reconstruction、游戏引擎仿真和世界模型不是本文主线。
一句话理解视频生成
模型不是直接“画视频”,而是在压缩后的时空草稿本上反复修改,再把草稿本翻译回视频。
Video VAE 把原始视频压缩成更小的 latent 草稿本。
DiT 在 latent tokens 上理解文字、参考图、姿态、镜头和声音条件。
Diffusion / Flow Matching 决定如何从噪声一步步走向成片。
decoder 把 latent 草稿本还原成像素视频,upscaler / detailer 继续补细节。
Video VAE 像把一段电影压缩成低维分镜;DiT 像剪辑师在分镜上安排角色、动作、镜头和条件;采样器决定每一步怎么把噪声草稿修成成片。
为什么视频生成通常不直接生成像素
一段视频同时包含时间、空间、人物、动作、镜头、光照和声音。如果直接在像素级建模,token 数和注意力成本会迅速爆炸。
统一 pipeline
像素视频进入 Video VAE encoder,得到 latent tokens;模型在 latent 空间预测噪声、\(x_0\)、\(v\) 或 flow velocity;最后由 decoder 还原成可观看视频。
图注:这是 latent-space video generation 的通用骨架,具体模型会在 VAE、tokenizer、attention、scheduler 和条件注入上做不同取舍。
这个写法故意不用统一的 DiT_denoise()。不同训练范式可能预测 noise、score、\(x_0\)、\(v\) 或 flow velocity,把它们都叫 denoising 会混淆模型目标。
Video VAE:视频的压缩器和还原器
Video VAE 像把一部电影压缩成低维分镜。生成模型不直接在原始像素上工作,而是在更小、更便宜的 latent 空间里规划画面和动作。
VAE 把视频变成草稿本,草稿本越小,生成越便宜;但草稿本太粗,细节就会丢。
encoder 将像素视频压缩到 latent space,decoder 将 latent tokens 还原成像素视频。Video VAE 相比 image VAE 多了时间维,需要压缩运动、节奏和时序一致性。
temporal stride 和 spatial stride 决定 token 数上限。高压缩可能导致细节糊、文字坏、手部不稳、边缘抖动和快速运动损失。
| 机制 | 直观理解 | 工程影响 |
|---|---|---|
| 2D VAE | 逐帧或近似逐帧压缩 | 实现简单,但时间一致性主要交给后续模型或后处理 |
| 3D Video VAE | 把空间和时间一起压缩 | 能编码运动和短时一致性,但训练和解码成本更高 |
| 3D causal VAE | 只依赖当前和过去帧进行时间压缩 | 更适合长视频、分段生成和流式处理 |
| decoder / upscaler / detailer | 把草稿翻译成成片并补细节 | 高压缩路线尤其依赖这些组件补回纹理、边缘和局部运动 |
技术注释:为什么 VAE 是硬瓶颈
Video VAE 的重建误差会成为整个生成系统的硬瓶颈。即使 DiT 在 latent 空间预测正确,decoder 如果无法稳定还原高频细节,最终视频仍会出现糊、闪烁或局部结构错误。
Latent Tokens 与 Token Cost Lab
视频生成的主要瓶颈是 token 数。帧数、分辨率、VAE 下采样率、latent patch size 和采样步数共同决定显存与速度压力。
其中 \(s\) 是 Video VAE 的时间 / 空间下采样率,\(p\) 是 latent patchification 的 patch size。如果某个模型已经把 patchification 吸收到 VAE 或 tokenizer 内部,就不要重复计算。
Token Cost Lab
默认值使用 80 frames、1280×720、temporal stride 4、spatial stride 16、patch size 1 和 30 sampling steps。
图注:\(N^2\) 是 full spatiotemporal attention 的上界直觉。真实模型可能使用窗口注意力、分解时空注意力、KV 优化、多尺度生成或分辨率分阶段策略,因此实际成本可能低于这个粗略上界。
latent tokens = 72,000; attention N² upper bound = 5,184,000,000; sampler work upper bound at 30 steps = 155,520,000,000
默认像素 token 数为 73,728,000。压缩率降低了模型主干 token 数,但 decoder、upscaler 和 detailer 仍会消耗显存与时间。
DiT:为什么 Transformer 适合视频
DiT 像一个能同时看很多格子的剪辑师。它不只看单帧,还要理解不同时间、不同空间位置之间的关系。
DiT,即 Diffusion Transformer,是把扩散模型中的主干网络从 U-Net 换成 Transformer。视频被压缩成 latent tokens 后,DiT 在这些 tokens 上建模:哪些 token 属于同一个角色,哪些 token 对应同一次运动,哪些 token 应该响应同一个 prompt、参考图或音频节奏。
| 机制 | 直观理解 | 工程影响 |
|---|---|---|
| Spatial attention | 看同一帧内不同区域关系 | 提升构图和局部一致性 |
| Temporal attention | 看不同帧之间的关系 | 提升运动连续性,减少闪烁 |
| Full spatiotemporal attention | 同时看时间和空间所有 token | 表达力强,但成本最高 |
| Window / factorized attention | 只看局部或拆分时空 | 更省显存,但长程关系可能变弱 |
| 3D position encoding / RoPE | 告诉模型 token 在哪一帧、哪个位置 | 帮助模型区分空间位置、时间顺序和镜头运动 |
U-Net 的归纳偏置更偏局部卷积和多尺度特征;Transformer 更适合大规模 token 关系建模,也更容易 scale up。但 token 数、KV cache、attention map 和激活显存会成为主要瓶颈。
Diffusion、Flow Matching 与 Rectified Flow
Diffusion 像把脏图一点点擦干净;Flow Matching 像在每个位置给一个方向箭头,告诉 latent 下一步该往哪里走。
| 范式 | 模型通常预测什么 | 采样怎么理解 | 适合强调的点 |
|---|---|---|---|
| DDPM / diffusion | noise / score / \(x_0\) | 多步去噪 | 直观、历史最常见 |
| EDM / v-prediction | velocity-like target | 在噪声和数据之间稳定插值 | 稳定性和调度设计 |
| Flow Matching | velocity field \(v_\theta(z_t,t,c)\) | 解 ODE,把源分布运输到数据分布 | 路径、速度场、采样步数 |
| Rectified Flow | 更直的 velocity field | 尽量走直线路径 | 更少步数、更容易蒸馏 |
更稳妥的采样伪代码
z = sample_noise(shape)
for t in schedule:
pred = model(z, t, condition)
z = sampler_step(z, pred, t)
video = vae.decode(z)
同样是“从噪声走向数据”,不同范式的模型预测目标和 sampler_step 解释并不一样。把所有模型都写成 denoise() 会遮住这些差异。
条件控制:prompt 为什么不够
文字 prompt 能描述语义,但很难精确控制人物身份、动作轨迹、镜头运动、局部编辑区域和音画同步。现代视频生成工作流通常会组合多种条件。
| 条件类型 | 例子 | 控制什么 |
|---|---|---|
| 语义条件 | text prompt | 主题、风格、事件、镜头描述 |
| 外观条件 | reference image、identity image、style image | 人脸、角色、服装、画风 |
| 几何条件 | pose、depth、canny、optical flow、layout | 姿态、轮廓、空间结构、运动方向 |
| 局部编辑条件 | mask、inpaint region | 哪些区域变、哪些区域不变 |
| 镜头条件 | camera path、trajectory | 推拉摇移、视角变化 |
| 声音条件 | speech、music、sound event | 口型、节奏、情绪、音画同步 |
| 注入方式 | 直观理解 | 优点 | 风险 |
|---|---|---|---|
| Cross-attention | 让 latent 去读条件信息 | 灵活,适合文本和图像语义 | 控制偏软 |
| Latent concat | 把条件直接拼到 latent | 约束强 | 训练和适配成本高 |
| Adapter / ControlNet-like branch | 给基座模型外挂控制分支 | 控制稳定,可组合 | 组件复杂,显存增加 |
| LoRA / IC-LoRA | 给模型插轻量技能包 | 训练和部署轻便 | 能力边界依赖数据和基座 |
Wan 生态:从开放视频生成到角色、编辑与音频驱动
Wan 更像一个开放视频生成与控制平台。它的价值不只在于 T2V / I2V 基础模型,还在于围绕角色、编辑、姿态、镜头和音频驱动形成了一组可组合工作流。
Wan2.2 MoE:按生成阶段分专家
Wan2.2 的 MoE 不应简单类比成 LLM 里的 token-level router。更直观的理解是:同一段生成过程的不同阶段由不同专家负责。
图注:官方材料将 A14B 系列描述为高噪声专家与低噪声专家组合,并使用 SNR / timestep 相关机制决定专家切换;具体参数量以官方模型卡为准。
高噪阶段先决定 layout / motion;低噪阶段再强化 detail / texture。
VACE 版本边界
VACE 的关键思想是把 reference-to-video、video-to-video、masked video editing、multi-condition editing 等任务统一到同一个条件协议中。公开资料中更明确的版本包括 Wan2.1-VACE 与 VACE-LTX-Video-0.9。涉及 Wan2.2 的 VACE 工作流时,需要按具体模型卡、repo 或社区实现确认,不应默认视为官方核心模型。
社区扩展标注
DiffSynth-Studio、ComfyUI-WanVideoWrapper、LightX2V、TeaCache、Video-As-Prompt、Wan-Move、Helios、DriVerse、AniCrafter、HyperMotion、UniAnimate-DiT 等应标注为社区或研究扩展,不应描述成官方核心能力。
LTX 生态:从快速视频生成到音视频联合生成
LTX 更像一个面向生产效率的视频 / 音视频生成栈。它的关键词不是单一模型,而是高压缩 latent、快速推理、多尺度 pipeline、LoRA / IC-LoRA 工作流,以及后续的联合音视频生成。
LTXV:高压缩 video-only latent diffusion
LTXV 可以理解为 LTX 生态中偏 video-only 的一代基础模型。它强调高压缩 Video-VAE、较少 latent tokens、快速生成和生产流组件。高压缩的优势是速度快、成本低;代价是重建细节和高频信息更依赖 decoder、upscaler 和后处理。
LTX-2 / LTX-2.3:joint audio-video foundation model
LTX-2 / LTX-2.3 不应被简单写成 LTXV 的小版本升级。它们面向 joint audio-video generation,把视频和音频作为更紧密的多模态生成问题处理。官方材料中,LTX-2.3 被描述为使用非对称双流 diffusion transformer:视频流、音频流分别建模,再通过双向 cross-attention 做同步。
LTX multiscale pipeline
低分辨率阶段负责全局构图、主体运动和镜头节奏;upscaler 提升分辨率和帧率;detail/refinement 补充纹理、边缘、局部运动和光照。
图注:base 阶段决定语义和运动,upscaler 更适合补细节;如果 base 阶段人物、动作或镜头已经错了,后处理通常很难彻底救回来。
Audio-driven Video vs Joint Audio-Video
不能简单说“Wan 是音频驱动,LTX 是生成音频”。更准确的说法是:Wan-S2V 代表 audio / speech-conditioned video generation;LTX-2 / LTX-2.3 则把音频和视频作为更联合的生成对象。
| 类型 | 输入 | 输出 | 代表方向 | 容易误解的点 |
|---|---|---|---|---|
| Audio / Speech-driven video | 图片 / 角色 + 音频 + prompt | 视频,音频通常是输入条件 | Wan-S2V | 不是“生成音频”,而是用音频驱动画面和口型 |
| Text-to-audio-video | 文本 prompt | 视频 + 音频 | LTX-2 / LTX-2.3 | 模型需要同时考虑视觉语义和声音事件 |
| Audio-conditioned joint generation | 音频 + prompt / reference | 与音频节奏或语义一致的视频,可能保留或生成音频 | LTX-2.3 类工作流 | 不同产品工作流的输入输出边界要看具体模型卡 |
Wan vs LTX:怎么选
选择模型生态时,不要只看模型名。分辨率、fps、steps、upscaler、control、后处理、显存和工作流成熟度都会影响最终结果。
| 需求 | 更适合优先看 | 原因 |
|---|
| 维度 | Wan 生态 | LTX 生态 |
|---|
失败案例诊断:问题、原因与修复方向
这一节把概念落到实战:先判断失败症状,再判断是条件、VAE、采样、时序、控制还是后处理的问题。
| 症状 | 可能原因 | 修复方向 |
|---|---|---|
| 人脸漂移 | reference 注入弱、长视频身份记忆不足 | 使用 identity reference、角色 LoRA、分段一致性策略 |
| 动作僵硬 | motion prior 弱、I2V 过度保守 | 增加 pose / flow / camera control,强化动作 prompt |
| 细节发糊 | VAE 压缩高、base 分辨率低、采样步不足 | 使用 spatial upscaler、detailer、tile refine,适当增加 steps |
| 画面闪烁 | temporal consistency 弱、局部编辑过强 | 降低局部编辑强度,使用 temporal-aware upscaler 或分段平滑 |
| prompt 不听话 | 文本条件弱、条件冲突、prompt 过长 | 拆分 prompt,使用 reference / mask / pose 补强 |
| 音画不同步 | 音频条件注入弱,视频和音频不是联合建模 | 使用 S2V 专用模型或 joint audio-video 模型 |
| 显存爆炸 | token 数过高、full attention、VAE decode、upscaler 占用大 | 降低分辨率 / 帧数,使用 FP8、offload、distilled 模型、多阶段生成 |
| upscaler 救不回来 | base 阶段结构已经错了 | 先修 base prompt / control,不要指望后处理修正语义错误 |
工程优化:显存、速度、长视频与多尺度 pipeline
视频生成的工程优化通常不是单点优化,而是减少 token、减少采样步、降低精度、分阶段生成和管理条件冲突的组合拳。
降低帧数、分辨率、latent 网格或 patch 数。token 数下降通常比微调 prompt 更直接影响显存和延迟。
使用 distillation、Rectified Flow、更好的 scheduler。代价是少步模型需要专门训练或蒸馏。
FP8 / INT8 / mixed precision / quantization 可降显存,但质量退化和算子支持要实测。
先低分辨率确定构图和运动,再 upscale / refine。base 阶段语义错了,后处理通常救不回来。
VAE decode、temporal upscaler 和 tile refine 也会吃显存。不要只估算 DiT 主干。
text、image、pose、mask、audio 条件越多,冲突概率越高。强控制条件应按优先级组合。
常见误解与技术边界
保留不确定性比写绝对结论更重要。具体能力、license、速度、显存和商业使用边界应以官方模型卡、repo 或论文为准。
FAQ
- 误解一:视频生成模型直接生成像素。 多数现代开放视频模型不是直接生成像素,而是在 latent space 中生成,再由 decoder 还原。
- 误解二:token 数只和分辨率有关。 视频 token 数同时受帧数、空间分辨率、VAE 下采样率、latent patch size、fps、duration 和 attention 策略影响。
- 误解三:Flow Matching 就是普通 diffusion 换名字。 二者都可以从噪声走向数据,但预测目标和采样解释不同。
- 误解四:Wan2.2 MoE 和 LLM MoE 一样。 Wan2.2 的 MoE 更接近按生成阶段 / timestep 分专家,而不是每个 token 单独路由到专家。
- 误解五:Wan-S2V 会生成音频。 Wan-S2V 更准确地说是 speech / audio-conditioned video generation。
- 误解六:LTXV、LTX-2、LTX-2.3 是简单小版本升级。 LTXV 更偏 video-only 快速生成;LTX-2 / LTX-2.3 更偏联合音视频生成。
- 误解七:upscaler 能解决一切质量问题。 upscaler 更擅长补细节,不擅长修正 base 阶段已经错误的人物、动作、空间关系和语义。
现代视频生成的核心矛盾是:视频的信息量极大,但我们希望模型既能理解长程时空关系,又能在有限显存和时间内生成稳定画面。Video VAE 通过压缩降低成本,DiT 通过 token 建模提升全局理解,Diffusion / Flow Matching 提供从噪声到视频的生成路径,各类 condition 则把 prompt 扩展成可控的生产工作流。
Wan 和 LTX 的差异,本质上不是谁简单替代谁,而是工程取舍不同:Wan 更像开放高质量视频生成与控制生态,适合角色、编辑、S2V 和复杂工作流;LTX 更像高效率视频 / 音视频生产栈,适合快速迭代、多尺度生成和 joint audio-video 方向。
理解这些底层取舍,比背模型名更重要。
参考资料与进一步阅读
这里列出可核验来源。具体模型能力、license、参数和部署细节应以官方仓库、论文、模型卡或项目页为准。
| 来源 | 类型 | 对应章节 | 阅读价值 |
|---|---|---|---|
| DiT: Scalable Diffusion Models with Transformers | 论文 | DiT | 理解为什么 Transformer 可作为扩散模型主干 |
| Flow Matching for Generative Modeling | 论文 | Flow Matching | 理解速度场与分布运输视角 |
| Wan2.2 GitHub | 官方资料 | Wan2.2 MoE | 核验高 / 低噪声专家、A14B、TI2V、VAE 描述 |
| Wan2.2 T2V A14B Model Card | 模型卡 | Wan2.2 | 核验 A14B 系列定位和模型边界 |
| Wan2.2 S2V Model Card | 模型卡 | S2V | 核验 image + audio + prompt 到视频的任务边界 |
| VACE repo / VACE paper | 论文 / 官方 repo | VACE | 核验 VCU、Context Adapter、统一视频编辑任务 |
| LTXV official page / LTX-Video paper | 官方资料 / 论文 | LTXV | 核验高压缩 Video-VAE、快速视频生成、生产组件 |
| LTX official page | 官方资料 | Joint audio-video | 核验 LTX-2 / LTX-2.3、双流音视频 DiT 与同步音视频生成能力 |