Video generation foundations

视频生成模型技术原理

视频生成模型真正生成的通常不是像素,而是一个被压缩后的“时空草稿”。本文聚焦 latent-space DiT / diffusion-flow 系视频模型,解释 Wan、LTX、VACE、S2V、Animate 等开放生态工作流背后的共同工程骨架。

Video VAE Latent Tokens DiT Diffusion Flow Matching Wan LTX VACE Audio-Video

阅读路线图

这篇文章不是覆盖所有视频生成路线的百科,而是解释 2024-2026 年开放生态中最常见的一类 latent-space DiT / diffusion-flow 视频模型。

先建立直觉

从“一句话理解视频生成”、Video VAE、DiT、Wan vs LTX 怎么选和失败案例诊断开始,先知道每个模块在系统里干什么。

再看工程取舍

重点看 token 成本、条件控制、多尺度 pipeline、显存与速度优化、模型选择矩阵,判断瓶颈在哪、该用什么控制信号或工程组件。

最后追机制边界

重点看 Flow Matching / Rectified Flow、SNR 与 timestep、Wan2.2 MoE、LTX 双流音视频 DiT、VACE 的统一任务协议,区分已知机制、工程假设和版本边界。

边界声明

本文聚焦 latent-space DiT / diffusion-flow 视频模型。传统 GAN 视频生成、纯自回归视频 token 生成、NeRF/4D reconstruction、游戏引擎仿真和世界模型不是本文主线。

一句话理解视频生成

模型不是直接“画视频”,而是在压缩后的时空草稿本上反复修改,再把草稿本翻译回视频。

1压缩

Video VAE 把原始视频压缩成更小的 latent 草稿本。

2规划

DiT 在 latent tokens 上理解文字、参考图、姿态、镜头和声音条件。

3生成路径

Diffusion / Flow Matching 决定如何从噪声一步步走向成片。

4还原

decoder 把 latent 草稿本还原成像素视频,upscaler / detailer 继续补细节。

人话理解

Video VAE 像把一段电影压缩成低维分镜;DiT 像剪辑师在分镜上安排角色、动作、镜头和条件;采样器决定每一步怎么把噪声草稿修成成片。

为什么视频生成通常不直接生成像素

一段视频同时包含时间、空间、人物、动作、镜头、光照和声音。如果直接在像素级建模,token 数和注意力成本会迅速爆炸。

统一 pipeline

像素视频进入 Video VAE encoder,得到 latent tokens;模型在 latent 空间预测噪声、\(x_0\)、\(v\) 或 flow velocity;最后由 decoder 还原成可观看视频。

图注:这是 latent-space video generation 的通用骨架,具体模型会在 VAE、tokenizer、attention、scheduler 和条件注入上做不同取舍。

video frames T × H × W × 3 Video VAE encoder latent tokens z_t decoder x_hat model(z_t, t, condition) noise / x0 / v / flow velocity
\[ x\in\mathbb{R}^{T\times H\times W\times 3},\quad z=\mathrm{VAE}_{enc}(x),\quad \mathrm{pred}=\mathrm{model}(z_t,t,c),\quad \hat{x}=\mathrm{VAE}_{dec}(z_0). \]

这个写法故意不用统一的 DiT_denoise()。不同训练范式可能预测 noise、score、\(x_0\)、\(v\) 或 flow velocity,把它们都叫 denoising 会混淆模型目标。

Video VAE:视频的压缩器和还原器

Video VAE 像把一部电影压缩成低维分镜。生成模型不直接在原始像素上工作,而是在更小、更便宜的 latent 空间里规划画面和动作。

一句人话

VAE 把视频变成草稿本,草稿本越小,生成越便宜;但草稿本太粗,细节就会丢。

技术定义

encoder 将像素视频压缩到 latent space,decoder 将 latent tokens 还原成像素视频。Video VAE 相比 image VAE 多了时间维,需要压缩运动、节奏和时序一致性。

工程后果

temporal stride 和 spatial stride 决定 token 数上限。高压缩可能导致细节糊、文字坏、手部不稳、边缘抖动和快速运动损失。

机制直观理解工程影响
2D VAE逐帧或近似逐帧压缩实现简单,但时间一致性主要交给后续模型或后处理
3D Video VAE把空间和时间一起压缩能编码运动和短时一致性,但训练和解码成本更高
3D causal VAE只依赖当前和过去帧进行时间压缩更适合长视频、分段生成和流式处理
decoder / upscaler / detailer把草稿翻译成成片并补细节高压缩路线尤其依赖这些组件补回纹理、边缘和局部运动
技术注释:为什么 VAE 是硬瓶颈

Video VAE 的重建误差会成为整个生成系统的硬瓶颈。即使 DiT 在 latent 空间预测正确,decoder 如果无法稳定还原高频细节,最终视频仍会出现糊、闪烁或局部结构错误。

Latent Tokens 与 Token Cost Lab

视频生成的主要瓶颈是 token 数。帧数、分辨率、VAE 下采样率、latent patch size 和采样步数共同决定显存与速度压力。

\[ N_{\mathrm{latent}}\approx \left\lceil \frac{T}{s_t p_t} \right\rceil \left\lceil \frac{H}{s_h p_h} \right\rceil \left\lceil \frac{W}{s_w p_w} \right\rceil . \]

其中 \(s\) 是 Video VAE 的时间 / 空间下采样率,\(p\) 是 latent patchification 的 patch size。如果某个模型已经把 patchification 吸收到 VAE 或 tokenizer 内部,就不要重复计算。

Token Cost Lab

默认值使用 80 frames、1280×720、temporal stride 4、spatial stride 16、patch size 1 和 30 sampling steps。

图注:\(N^2\) 是 full spatiotemporal attention 的上界直觉。真实模型可能使用窗口注意力、分解时空注意力、KV 优化、多尺度生成或分辨率分阶段策略,因此实际成本可能低于这个粗略上界。

pixel tokens73,728,000
latent tokens72,000
attention N² upper bound5,184,000,000
sampler work upper bound155,520,000,000

latent tokens = 72,000; attention N² upper bound = 5,184,000,000; sampler work upper bound at 30 steps = 155,520,000,000

默认像素 token 数为 73,728,000。压缩率降低了模型主干 token 数,但 decoder、upscaler 和 detailer 仍会消耗显存与时间。

DiT:为什么 Transformer 适合视频

DiT 像一个能同时看很多格子的剪辑师。它不只看单帧,还要理解不同时间、不同空间位置之间的关系。

DiT,即 Diffusion Transformer,是把扩散模型中的主干网络从 U-Net 换成 Transformer。视频被压缩成 latent tokens 后,DiT 在这些 tokens 上建模:哪些 token 属于同一个角色,哪些 token 对应同一次运动,哪些 token 应该响应同一个 prompt、参考图或音频节奏。

机制直观理解工程影响
Spatial attention看同一帧内不同区域关系提升构图和局部一致性
Temporal attention看不同帧之间的关系提升运动连续性,减少闪烁
Full spatiotemporal attention同时看时间和空间所有 token表达力强,但成本最高
Window / factorized attention只看局部或拆分时空更省显存,但长程关系可能变弱
3D position encoding / RoPE告诉模型 token 在哪一帧、哪个位置帮助模型区分空间位置、时间顺序和镜头运动

U-Net 的归纳偏置更偏局部卷积和多尺度特征;Transformer 更适合大规模 token 关系建模,也更容易 scale up。但 token 数、KV cache、attention map 和激活显存会成为主要瓶颈。

Diffusion、Flow Matching 与 Rectified Flow

Diffusion 像把脏图一点点擦干净;Flow Matching 像在每个位置给一个方向箭头,告诉 latent 下一步该往哪里走。

范式模型通常预测什么采样怎么理解适合强调的点
DDPM / diffusionnoise / score / \(x_0\)多步去噪直观、历史最常见
EDM / v-predictionvelocity-like target在噪声和数据之间稳定插值稳定性和调度设计
Flow Matchingvelocity field \(v_\theta(z_t,t,c)\)解 ODE,把源分布运输到数据分布路径、速度场、采样步数
Rectified Flow更直的 velocity field尽量走直线路径更少步数、更容易蒸馏

更稳妥的采样伪代码

z = sample_noise(shape)
for t in schedule:
    pred = model(z, t, condition)
    z = sampler_step(z, pred, t)
video = vae.decode(z)

同样是“从噪声走向数据”,不同范式的模型预测目标和 sampler_step 解释并不一样。把所有模型都写成 denoise() 会遮住这些差异。

条件控制:prompt 为什么不够

文字 prompt 能描述语义,但很难精确控制人物身份、动作轨迹、镜头运动、局部编辑区域和音画同步。现代视频生成工作流通常会组合多种条件。

条件类型例子控制什么
语义条件text prompt主题、风格、事件、镜头描述
外观条件reference image、identity image、style image人脸、角色、服装、画风
几何条件pose、depth、canny、optical flow、layout姿态、轮廓、空间结构、运动方向
局部编辑条件mask、inpaint region哪些区域变、哪些区域不变
镜头条件camera path、trajectory推拉摇移、视角变化
声音条件speech、music、sound event口型、节奏、情绪、音画同步
注入方式直观理解优点风险
Cross-attention让 latent 去读条件信息灵活,适合文本和图像语义控制偏软
Latent concat把条件直接拼到 latent约束强训练和适配成本高
Adapter / ControlNet-like branch给基座模型外挂控制分支控制稳定,可组合组件复杂,显存增加
LoRA / IC-LoRA给模型插轻量技能包训练和部署轻便能力边界依赖数据和基座

Wan 生态:从开放视频生成到角色、编辑与音频驱动

Wan 更像一个开放视频生成与控制平台。它的价值不只在于 T2V / I2V 基础模型,还在于围绕角色、编辑、姿态、镜头和音频驱动形成了一组可组合工作流。

WAN
T2V / I2V / TI2V基础生成与统一文本/图像到视频路线
Wan2.2 MoE高噪声专家负责结构,低噪声专家负责细节
VACE统一生成、编辑和控制任务协议
Animate身份保持、动作迁移、角色替换
S2Vspeech / audio-conditioned character video
Fun-Control / Camera姿态、结构和镜头控制

Wan2.2 MoE:按生成阶段分专家

Wan2.2 的 MoE 不应简单类比成 LLM 里的 token-level router。更直观的理解是:同一段生成过程的不同阶段由不同专家负责。

图注:官方材料将 A14B 系列描述为高噪声专家与低噪声专家组合,并使用 SNR / timestep 相关机制决定专家切换;具体参数量以官方模型卡为准。

High-noise Expert整体构图、主体关系、镜头运动、低频结构
Low-noise Expert纹理、边缘、清晰度、细节修复

高噪阶段先决定 layout / motion;低噪阶段再强化 detail / texture。

VACE 版本边界

VACE 的关键思想是把 reference-to-video、video-to-video、masked video editing、multi-condition editing 等任务统一到同一个条件协议中。公开资料中更明确的版本包括 Wan2.1-VACE 与 VACE-LTX-Video-0.9。涉及 Wan2.2 的 VACE 工作流时,需要按具体模型卡、repo 或社区实现确认,不应默认视为官方核心模型。

社区扩展标注

DiffSynth-Studio、ComfyUI-WanVideoWrapper、LightX2V、TeaCache、Video-As-Prompt、Wan-Move、Helios、DriVerse、AniCrafter、HyperMotion、UniAnimate-DiT 等应标注为社区或研究扩展,不应描述成官方核心能力。

LTX 生态:从快速视频生成到音视频联合生成

LTX 更像一个面向生产效率的视频 / 音视频生成栈。它的关键词不是单一模型,而是高压缩 latent、快速推理、多尺度 pipeline、LoRA / IC-LoRA 工作流,以及后续的联合音视频生成。

LTX
LTXV高压缩 video-only latent diffusion
distilled / FP8少步采样与低显存部署
Upscalersspatial / temporal / detailer
IC-LoRAdepth / pose / canny / union / detailer
LTX-2 / 2.3joint audio-video foundation model
Creative LabVFX / restoration / editing LoRA

LTXV:高压缩 video-only latent diffusion

LTXV 可以理解为 LTX 生态中偏 video-only 的一代基础模型。它强调高压缩 Video-VAE、较少 latent tokens、快速生成和生产流组件。高压缩的优势是速度快、成本低;代价是重建细节和高频信息更依赖 decoder、upscaler 和后处理。

LTX-2 / LTX-2.3:joint audio-video foundation model

LTX-2 / LTX-2.3 不应被简单写成 LTXV 的小版本升级。它们面向 joint audio-video generation,把视频和音频作为更紧密的多模态生成问题处理。官方材料中,LTX-2.3 被描述为使用非对称双流 diffusion transformer:视频流、音频流分别建模,再通过双向 cross-attention 做同步。

LTX multiscale pipeline

低分辨率阶段负责全局构图、主体运动和镜头节奏;upscaler 提升分辨率和帧率;detail/refinement 补充纹理、边缘、局部运动和光照。

图注:base 阶段决定语义和运动,upscaler 更适合补细节;如果 base 阶段人物、动作或镜头已经错了,后处理通常很难彻底救回来。

Base generation全局构图、主体运动、镜头节奏
Spatial latent upscaling提升空间分辨率
Temporal upscaling提升帧率或时间分辨率
Tile refinement / detailer纹理、边缘、局部光照
Final video生产流输出

Audio-driven Video vs Joint Audio-Video

不能简单说“Wan 是音频驱动,LTX 是生成音频”。更准确的说法是:Wan-S2V 代表 audio / speech-conditioned video generation;LTX-2 / LTX-2.3 则把音频和视频作为更联合的生成对象。

类型输入输出代表方向容易误解的点
Audio / Speech-driven video图片 / 角色 + 音频 + prompt视频,音频通常是输入条件Wan-S2V不是“生成音频”,而是用音频驱动画面和口型
Text-to-audio-video文本 prompt视频 + 音频LTX-2 / LTX-2.3模型需要同时考虑视觉语义和声音事件
Audio-conditioned joint generation音频 + prompt / reference与音频节奏或语义一致的视频,可能保留或生成音频LTX-2.3 类工作流不同产品工作流的输入输出边界要看具体模型卡

Wan vs LTX:怎么选

选择模型生态时,不要只看模型名。分辨率、fps、steps、upscaler、control、后处理、显存和工作流成熟度都会影响最终结果。

需求更适合优先看原因
维度Wan 生态LTX 生态

失败案例诊断:问题、原因与修复方向

这一节把概念落到实战:先判断失败症状,再判断是条件、VAE、采样、时序、控制还是后处理的问题。

症状可能原因修复方向
人脸漂移reference 注入弱、长视频身份记忆不足使用 identity reference、角色 LoRA、分段一致性策略
动作僵硬motion prior 弱、I2V 过度保守增加 pose / flow / camera control,强化动作 prompt
细节发糊VAE 压缩高、base 分辨率低、采样步不足使用 spatial upscaler、detailer、tile refine,适当增加 steps
画面闪烁temporal consistency 弱、局部编辑过强降低局部编辑强度,使用 temporal-aware upscaler 或分段平滑
prompt 不听话文本条件弱、条件冲突、prompt 过长拆分 prompt,使用 reference / mask / pose 补强
音画不同步音频条件注入弱,视频和音频不是联合建模使用 S2V 专用模型或 joint audio-video 模型
显存爆炸token 数过高、full attention、VAE decode、upscaler 占用大降低分辨率 / 帧数,使用 FP8、offload、distilled 模型、多阶段生成
upscaler 救不回来base 阶段结构已经错了先修 base prompt / control,不要指望后处理修正语义错误

工程优化:显存、速度、长视频与多尺度 pipeline

视频生成的工程优化通常不是单点优化,而是减少 token、减少采样步、降低精度、分阶段生成和管理条件冲突的组合拳。

减少 token 数

降低帧数、分辨率、latent 网格或 patch 数。token 数下降通常比微调 prompt 更直接影响显存和延迟。

减少采样步数

使用 distillation、Rectified Flow、更好的 scheduler。代价是少步模型需要专门训练或蒸馏。

减少精度成本

FP8 / INT8 / mixed precision / quantization 可降显存,但质量退化和算子支持要实测。

分阶段生成

先低分辨率确定构图和运动,再 upscale / refine。base 阶段语义错了,后处理通常救不回来。

控制 decode 成本

VAE decode、temporal upscaler 和 tile refine 也会吃显存。不要只估算 DiT 主干。

避免条件冲突

text、image、pose、mask、audio 条件越多,冲突概率越高。强控制条件应按优先级组合。

常见误解与技术边界

保留不确定性比写绝对结论更重要。具体能力、license、速度、显存和商业使用边界应以官方模型卡、repo 或论文为准。

FAQ

  • 误解一:视频生成模型直接生成像素。 多数现代开放视频模型不是直接生成像素,而是在 latent space 中生成,再由 decoder 还原。
  • 误解二:token 数只和分辨率有关。 视频 token 数同时受帧数、空间分辨率、VAE 下采样率、latent patch size、fps、duration 和 attention 策略影响。
  • 误解三:Flow Matching 就是普通 diffusion 换名字。 二者都可以从噪声走向数据,但预测目标和采样解释不同。
  • 误解四:Wan2.2 MoE 和 LLM MoE 一样。 Wan2.2 的 MoE 更接近按生成阶段 / timestep 分专家,而不是每个 token 单独路由到专家。
  • 误解五:Wan-S2V 会生成音频。 Wan-S2V 更准确地说是 speech / audio-conditioned video generation。
  • 误解六:LTXV、LTX-2、LTX-2.3 是简单小版本升级。 LTXV 更偏 video-only 快速生成;LTX-2 / LTX-2.3 更偏联合音视频生成。
  • 误解七:upscaler 能解决一切质量问题。 upscaler 更擅长补细节,不擅长修正 base 阶段已经错误的人物、动作、空间关系和语义。

现代视频生成的核心矛盾是:视频的信息量极大,但我们希望模型既能理解长程时空关系,又能在有限显存和时间内生成稳定画面。Video VAE 通过压缩降低成本,DiT 通过 token 建模提升全局理解,Diffusion / Flow Matching 提供从噪声到视频的生成路径,各类 condition 则把 prompt 扩展成可控的生产工作流。

Wan 和 LTX 的差异,本质上不是谁简单替代谁,而是工程取舍不同:Wan 更像开放高质量视频生成与控制生态,适合角色、编辑、S2V 和复杂工作流;LTX 更像高效率视频 / 音视频生产栈,适合快速迭代、多尺度生成和 joint audio-video 方向。

理解这些底层取舍,比背模型名更重要。

参考资料与进一步阅读

这里列出可核验来源。具体模型能力、license、参数和部署细节应以官方仓库、论文、模型卡或项目页为准。

来源类型对应章节阅读价值
DiT: Scalable Diffusion Models with Transformers论文DiT理解为什么 Transformer 可作为扩散模型主干
Flow Matching for Generative Modeling论文Flow Matching理解速度场与分布运输视角
Wan2.2 GitHub官方资料Wan2.2 MoE核验高 / 低噪声专家、A14B、TI2V、VAE 描述
Wan2.2 T2V A14B Model Card模型卡Wan2.2核验 A14B 系列定位和模型边界
Wan2.2 S2V Model Card模型卡S2V核验 image + audio + prompt 到视频的任务边界
VACE repo / VACE paper论文 / 官方 repoVACE核验 VCU、Context Adapter、统一视频编辑任务
LTXV official page / LTX-Video paper官方资料 / 论文LTXV核验高压缩 Video-VAE、快速视频生成、生产组件
LTX official page官方资料Joint audio-video核验 LTX-2 / LTX-2.3、双流音视频 DiT 与同步音视频生成能力