FLUX / FLUX.2
工业闭源大模型路线:专有混合数据、flow matching、VLM 条件、多参考图、生产级编辑和多产品线蒸馏。
Latent Flow MatchingMulti-referencePrompt upsamplingImage generation systems
从 FLUX.2、Qwen-Image 到 Z-Image:为什么现代图像模型的竞争已经从单一架构,转向数据、VAE、caption、编辑样本、奖励模型和蒸馏工作流的系统竞争。
image + caption -> loss现代图像模型不再只是“会画图”。更准确的对象是一条由数据、caption、VAE、训练目标、后训练、蒸馏和产品工作流共同定义的视觉执行系统。
早期我们常把图像生成理解成:给模型看很多 image + caption,让它学会从文字生成图片。
但今天的生产级图像模型已经不是“会画图”这么简单。它要能写字、排版、保持人物和商品一致、根据参考图做局部编辑、理解长 prompt、避开安全风险,还要在 4 到 8 步内快速出图。
所以真正决定模型能力的,不只是 DiT 有多大,而是训练系统如何组织数据、caption、VAE、编辑样本、奖励模型和蒸馏过程。
现代图像生成模型的能力,不是某个 architecture 单独决定的,而是由数据分布、caption 表达、latent tokenizer、训练阶段、奖励信号、蒸馏目标和推理工作流共同塑造的。FLUX 展示了生产级工作流,Qwen 展示了文字与图文设计专项路线,Z-Image 展示了高效可复现训练范式。
| 能力 | 直观理解 | 训练系统里对应什么 |
|---|---|---|
| 画得像 | 图像真实、漂亮、细节稳定。 | 高质量图文数据、VAE fidelity、SFT、审美奖励。 |
| 听得懂 | 能遵守复杂 prompt。 | 多粒度 caption、instruction 数据、VLM 条件编码、prompt following reward。 |
| 写得对 | 中文、英文、小字、logo、排版不乱码。 | OCR-aware caption、text-rich 数据、synthetic rendering、OCR reward、VAE 小字保真。 |
| 改得稳 | 只改该改的地方,不全图漂移。 | editing pair、I2I reconstruction、多参考训练、identity / preservation reward。 |
| 生成快 | 几步内出高质量图。 | guidance distillation、few-step distillation、Turbo / Klein 模型族。 |
工业闭源大模型路线:专有混合数据、flow matching、VLM 条件、多参考图、生产级编辑和多产品线蒸馏。
Latent Flow MatchingMulti-referencePrompt upsampling文字与图文设计路线:OCR / text-rich 数据、中文和复杂排版、Qwen-VL 条件编码、I2I reconstruction、编辑一致性与 RLHF 后训练。
Text RenderingVLM + VAEGRPO / OPD高效开源路线:6B 单流 S3-DiT、数据 profile、知识图谱采样、双语多粒度 caption、8-step no-CFG Turbo。
S3-DiTZ-CaptionerDPO / GRPO图像模型正在从 prompt-to-image 模型,演化为多参考、多任务、可编辑、可排版、可蒸馏的视觉执行系统。
Data systemReward modelModel family| 阶段 | 做什么 | 解决的问题 | 如果做不好 |
|---|---|---|---|
| 原始数据池 | 收集 web 图文对、授权图库、合成图、编辑对、多参考样本。 | 提供世界知识、审美和任务覆盖。 | 模型概念窄、风格偏、长尾差。 |
| 清洗 / 去重 / 安全过滤 | 去重、低清过滤、压缩伪影过滤、安全和隐私处理。 | 降低噪声、重复、违法和高风险内容。 | 训练效率低,模型学到伪影和风险内容。 |
| 语义与质量打标 | aesthetic、technical quality、OCR、safety、subject、style、layout。 | 支持动态采样和课程学习。 | 只能随机喂数据,专项能力难形成。 |
| Caption 工程 | long / medium / short caption、tags、OCR、simulated prompt、difference caption。 | 把视觉内容变成可学习的条件信号。 | prompt following 弱,文字和属性绑定差。 |
| 数据再平衡 | 调整长尾、语言、文字密集图、人物、产品、UI、PPT 等比例。 | 防止模型只会高频概念。 | 中文、小众风格、复杂排版、特殊对象弱。 |
| 课程学习 | 从低分辨率到高分辨率,从简单文字到复杂图文混排。 | 让模型逐步学习难任务。 | 直接上复杂任务会不稳定、浪费 compute。 |
| 后训练数据 | 偏好对、OCR 可验证样本、编辑一致性、身份保持。 | 对齐人类偏好和生产约束。 | 图好看但不听话,或编辑不稳定。 |
| 蒸馏与部署数据 | teacher trajectory、few-step samples、reward-guided samples。 | 让模型变快、可部署。 | 速度快但质量、多样性或指令跟随下降。 |
为了避免后面变成术语清单,我们先看一张训练样本如何被加工。假设原始图片是一张中文咖啡店促销海报,包含标题“夏日拿铁”、价格“29 元”、品牌 logo、杯子、桌面、暖色灯光和小字号说明。
{
"raw_image": "coffee_poster.jpg",
"ocr_text": "夏日拿铁 29元 今日限定",
"long_caption": "一张暖色调咖啡店促销海报,画面中央是一杯冰拿铁,左上角有品牌 logo,主标题为中文‘夏日拿铁’,价格为‘29元’,底部有小字号活动说明。",
"short_caption": "中文咖啡促销海报,暖色调,含价格文字和品牌 logo",
"text_density": "medium",
"layout_type": "poster",
"edit_pair": {
"instruction": "把价格从 29 元改成 19 元,保持字体、logo、杯子、背景和布局不变",
"preserve": ["logo", "cup", "background", "lighting", "layout"]
},
"reward_check": {
"ocr_exact_match": true,
"layout_preserved": true,
"brand_color_preserved": true,
"product_shape_preserved": true
}
}
| 阶段 | 它提供什么信号 | 如果缺失会怎样 |
|---|---|---|
| OCR caption | 告诉模型图里到底写了什么字。 | 文字可能看起来像字,但内容错。 |
| long caption | 绑定物体、文字、布局和风格。 | prompt following 和属性绑定变弱。 |
| edit pair | 学会“只改价格,不改其他部分”。 | 编辑时容易全图漂移。 |
| I2I reconstruction | 学会保留 logo、字体、材质和背景。 | 人物、商品、字体一致性下降。 |
| reward check | 用 OCR / layout / identity 指标验证结果。 | 后训练容易只优化审美,不优化正确性。 |
| VAE reconstruction | 检查压缩后小字和 logo 是否还清楚。 | latent 已损坏,DiT 很难恢复。 |
调节文字密集、编辑和后训练权重,观察数据预算如何从通用图文对转向专项能力数据。这个 toy model 不代表真实比例,只用来说明训练目标如何改变数据需求。
allocation ready
专项能力不是靠一个 loss 自然出现,而是靠数据分布、任务组合和奖励信号持续施压。
| Slider | 调高后可能提升 | 可能副作用 | 应该看什么指标 |
|---|---|---|---|
| text-rich focus | OCR 正确率、小字可读性、海报 / PPT / UI 能力。 | 自然摄影分布变窄,审美多样性下降。 | OCR exact match、CER / WER、layout correctness、small-font readability。 |
| editing focus | 局部编辑、身份保持、多轮编辑、多参考一致性。 | T2I 审美或多样性下降,模型更保守。 | edit success、identity similarity、background preservation、LPIPS。 |
| post-training focus | prompt adherence、审美、人像保真、品牌一致性。 | reward hacking、过饱和、模式收缩。 | human preference、artifact rate、diversity、reward range stability。 |
下面这些术语不是缩写表,而是现代图像生成训练系统里的接口、信号和约束。
| 术语 | 直观解释 | 技术作用 |
|---|---|---|
| VAE / Autoencoder | 把图片压缩成模型容易处理的“草稿”,最后再还原成图片。 | latent tokenizer,决定 reconstruction fidelity、token cost、diffusability。 |
| Caption | 图片的训练说明书。 | conditional supervision,影响 semantic binding、prompt following、long-tail coverage。 |
| OCR-aware Caption | 把图里的文字也写进 caption。 | 对 text rendering、text editing、layout learning 至关重要。 |
| DiT | 用 Transformer 在图像 latent 上生成图片。 | diffusion / flow backbone,建模 noisy latent、text tokens、image condition tokens。 |
| MMDiT | 同时处理文本、图像、条件图等多模态 token 的 DiT。 | 用于 joint condition-target modeling 和编辑任务。 |
| Flow Matching | 学一条从噪声走向图片的路径。 | velocity field learning on interpolated latent states。 |
| SFT | 用精选数据把模型审美和指令跟随拉正。 | distribution narrowing toward high-fidelity sub-manifold。 |
| DPO / RLHF / GRPO | 用偏好或奖励信号让模型更符合人类和任务目标。 | reward-guided post-training,风险是 reward hacking 和模式收缩。 |
| OPD | 用 on-policy 样本继续蒸馏或对齐。 | 让 student 适配自己生成分布,减少 train-test mismatch。 |
| Distillation | 让慢但强的老师教快模型。 | teacher trajectory / distribution matching / few-step student。 |
| Prompt Upsampling | 把短 prompt 改写成结构化视觉说明。 | 推理时 condition compiler,不应直接写成训练数据配方。 |
FLUX.1 公开的数据细节有限,但训练策略清晰:大规模 latent rectified flow transformer、从头训练 autoencoder、双流到单流混合架构,以及 guidance distillation。
| 类型 | 可确认内容 | 不应写成确定事实的内容 |
|---|---|---|
| 公开事实 | FLUX family 使用专有文本和图像混合数据;FLUX.1-dev 是 12B rectified flow transformer;使用从头训练的 autoencoder 和 guidance distillation。 | 完整数据比例、captioner、OCR pipeline、动态采样策略。 |
| 合理推断 | 数据工程大概率包含去重、质量过滤、安全过滤、合成数据、偏好数据和数据再平衡。 | 具体采样权重、训练阶段配比、reward loss 权重。 |
| 作者观点 | FLUX 路线代表工业闭源生产流:数据治理、模型族分层和部署成本控制同等重要。 | 不要把这一判断当作 BFL 官方 recipe。 |
直观理解:可以把生成过程想成从一团噪声慢慢走向图片。Flow Matching 不是让模型只学“这一点噪声怎么擦掉”,而是让模型在任意中间位置都知道“下一步应该往真实图片方向怎么走”。
形式化:图像先进入从头训练的 autoencoder latent space。给定数据 latent \(z_1\)、噪声 latent \(z_0\)、条件 \(c\) 和时间 \(t\),rectified flow matching 学习从噪声到数据的 velocity field:
公开资料还指向 logit-normal shift schedule、随训练分辨率调整的 schedule、包含 adversarial objective 的 autoencoder、以及扩大到 16 latent channels 来提高重建能力。
技术边界:本文把 diffusion transformer 作为架构家族称呼,把 flow matching 作为训练目标称呼。严格说,FLUX 学的是 latent space 中从噪声到数据的 velocity field,不是传统 DDPM 里的 noise prediction。不同论文可能采用不同时间方向或符号约定;本文默认 \(t=0\) 是噪声,\(t=1\) 是数据。
Ablation 思考:如果只保留 DiT 主干、不优化 VAE 和数据会怎样?
- 去掉高质量 autoencoder:小字、logo、边缘和产品形状在 latent 中先损坏。
- 去掉高质量 caption:prompt following 和属性绑定下降。
- 去掉 guidance distillation:模型质量可能高,但部署成本和采样步数难以进入产品。
- 去掉安全和偏好数据:生成质量不等于可上线,风险样本会成为生产瓶颈。
Kontext 把任务从 pure text-to-image 扩展到 image editing / in-context generation:给定文本指令和上下文图像,生成目标图像。
Kontext 的核心不是“多喂一张图”,而是把图像生成从一次性 T2I 扩展成真实设计工作流:用户给一张上下文图,再用文本指令要求模型局部修改、全局重构、替换文字、引用风格或保持角色一致。
回到咖啡海报例子,Kontext 类任务关心的不是“重新生成一张海报”,而是“把 29 元改成 19 元,同时 logo、杯子、字体、背景和构图都不能乱”。
| 类型 | 可确认内容 | 不应写成确定事实的内容 |
|---|---|---|
| 公开事实 | Kontext 技术报告和官方材料披露其面向 image editing / in-context generation,任务覆盖局部编辑、全局编辑、文字编辑、风格参考和角色参考。 | 完整编辑数据来源、source-target pair 构造比例、内部 benchmark 权重。 |
| 合理推断 | 稳定编辑需要 source image、instruction、target image、difference caption 和 preservation 信号。 | 具体数据采样比例、LADD / guidance distillation 的内部超参。 |
| 作者观点 | Kontext 的价值应按真实工作流理解,而不是按“多一个参考图输入”理解。 | 不要把这个工作流定位写成官方术语。 |
工程上可以理解为:context image + instruction + noisy target latent 经过 sequence concatenation 进入 rectified flow transformer,输出目标图像 latent 的 velocity / denoising 方向。
image + caption,保留基础文本到图像能力。
source image + instruction + target image,学习局部和全局编辑。
reference style image + new scene prompt + target image。
reference character or product + new prompt + target image。
input image with text + instruction + corrected target。
| 任务 | 输入 | 输出 | 核心难点 |
|---|---|---|---|
| local editing | source image + 局部修改指令 | target image | 只改局部,不破坏背景和身份。 |
| global editing | source image + 全局风格 / 场景指令 | target image | 改整体,但保持语义和对象一致。 |
| text editing | 带文字图片 + 替换文字指令 | corrected target | OCR 正确、字体和布局保持。 |
| style reference | reference style + new prompt | 新图 | 风格迁移但不复制内容。 |
| character / object reference | reference character / product + new prompt | 一致角色 / 商品新图 | 身份、形状、材质稳定。 |
从 pure T2I checkpoint 出发,联合 fine-tune image-to-image 和 text-to-image。
使用简单 sequence concatenation 处理 context / instruction tokens,并保持 velocity prediction target。
Kontext pro 使用 flow objective 后接 LADD;Kontext dev 通过 guidance distillation 得到 12B diffusion transformer。
为了优化编辑,dev 版本专注 image-to-image,不再继续训练 pure T2I 任务。
benchmark 覆盖 local editing、global editing、text editing、style reference、character reference。它关注的是真实编辑工作流中的局部改写、全局重构、文字修改、风格引用和角色一致性,而不只是单张图的审美评分。
Kontext 还需要 classifier-based filtering 和 adversarial training 来约束编辑风险,尤其是防止 NCII / CSAM 等非同意或非法内容生成。
FLUX.2 不是 FLUX.1 的简单放大,而是从高质量生成模型升级为生产级视觉工作流模型:多参考图、一致性、品牌规范、复杂文字、结构化 prompt 和 4MP 编辑都进入训练目标。
同一个人、产品或风格,在不同输出中保持稳定。
海报、meme、UI mockup、infographic、小字和多行文字。
logo、色彩、字体、产品形态、包装和广告视觉规范。
4MP 级别下保持纹理、边缘和局部细节稳定。
多段约束、位置关系、颜色、数量、构图和空间逻辑。
公开披露FLUX.2 基于 latent flow matching architecture,在同一架构中统一 image generation 和 editing。Mistral-3 24B vision-language model 负责 real-world knowledge 与 contextual understanding,flow transformer 负责空间关系、材质属性、构图逻辑和图像 latent 生成。
FLUX.2-dev 是 32B flow matching transformer;支持 text-to-image、single-reference editing、multi-reference editing,官方文档披露多参考编辑最多 10 张参考图、最高 4MP 输出和 32K text input tokens。
FLUX.2 重新训练 latent space,用 learnability、quality 和 compression 的平衡来提升 text rendering、编辑和高分辨率细节。autoencoder 改进不是附属细节,而是生产质量的基础接口。
| 类型 | 可确认内容 | 不应写成确定事实的内容 |
|---|---|---|
| 公开事实 | FLUX.2 基于 latent flow matching architecture;统一 image generation 和 editing;FLUX.2-dev 是 32B flow matching transformer;支持 T2I、single-reference editing、multi-reference editing;官方披露多参考编辑最多 10 张参考图、最高 4MP 输出和 32K text input tokens。 | 完整训练数据比例、teacher/student 结构、reward 模型细节、step distillation loss。 |
| 合理推断 | 产品线很可能包含 size distillation、step distillation、多产品分层部署。 | 具体蒸馏阶段、训练样本占比、RL loss 权重。 |
| 作者观点 | FLUX.2 代表生产级视觉工作流路线:多参考、一致性、品牌约束、高分辨率编辑和复杂 prompt 是核心。 | 不要把“生产工作流路线”写成官方术语。 |
prompt upsampling 在生成前使用大型 VLM 扩展用户 prompt,把简短、含糊、缺少视觉细节的指令改写成结构化视觉说明。它更准确地说是推理时的 conditioning strategy,相当于在图像模型前接了一个 visual prompt compiler,尤其服务 reasoning-heavy、复杂结构、图中文字、代码 / 数学 / 流程图等长约束场景。不要把它写成已公开的训练数据配方。
做一张高级感生日海报,有算法研究员氛围。
温暖光线、极简高级构图、神经网络纹理、中文标题、细腻字体、低饱和色彩、主视觉层级、背景元素和排版约束。
| 模型层 | 定位 | 适用场景 | 证据边界 |
|---|---|---|---|
| Large / dev / pro / flex | 高质量、多参考、高控制、生产级输出。 | 专业编辑、品牌生产、API 工作流。 | 官方产品分层和模型页面披露。 |
| Klein Base | undistilled base,约 50-step,更灵活。 | fine-tuning / LoRA / research。 | 官方 Klein 页面披露。 |
| Klein Distilled | few-step distilled,面向快速迭代。 | 实时生成、消费级 GPU、交互式应用。 | 基于官方模型族描述。 |
合理归纳从产品分层看,FLUX.2 的训练链路很可能是 large base -> 高质量对齐 -> size distillation -> step distillation -> 多产品线部署。但官方没有公开完整 recipe,因此这不是可当作论文事实引用的训练配方。
放到咖啡海报样本里,FLUX.2 路线更关心“把这张海报、品牌 logo、杯子参考图、字体风格和长 prompt 一起作为生产约束”,而不是只从一句话重新画一张相似海报。
Qwen-Image 的关键不是“顺便会写字”,而是把文字渲染、中文、多语言排版、图文设计和编辑一致性作为核心训练目标。
| 类型 | 可确认内容 | 不应写成确定事实的内容 |
|---|---|---|
| 公开事实 | Qwen-Image 技术报告和官方材料强调 text rendering、复杂文字、编辑一致性、VLM semantic branch 与 VAE appearance branch。 | 完整数据比例、课程阶段比例、OCR 标注 pipeline 内部实现。 |
| 合理推断 | 稳定中文文字和图文设计能力需要大量 OCR-aware caption、合成文字、PPT / 海报 / 信息图 / UI 数据和编辑对。 | 每类数据的实际采样权重、内部 captioner 配方、奖励模型权重。 |
| 作者观点 | Qwen-Image 路线应按“图文设计执行系统”理解,而不是普通 T2I 模型附带文字能力。 | 不要把这个定位写成官方命名。 |
对这类模型来说,文字不是普通纹理,而是同时要求语义正确、字形正确、布局正确、局部清晰和跨语言稳定的结构化对象。咖啡海报样本里的“夏日拿铁 29 元”如果只被当作纹理,模型可以画出像中文字的笔画,却无法保证价格、品牌和版式正确。
自然场景文字、海报、文档、中文排版、英文排版、多语言混排、UI、商品包装、标牌、漫画对白和信息图。
过滤低质量、OCR 不可靠、压缩严重、文字不可读、安全风险高或图文不匹配的样本。
加入 OCR 文本、文字位置、语言、字体风格、版式结构、语义描述和图片内容 caption。
合成罕见汉字、长尾词、多语言混排、小字号、段落级文本、复杂海报和 PPT 布局。
平衡中文 / 英文、短文本 / 长文本、大标题 / 小字、自然场景 / 设计图、简单排版 / 复杂排版。
文字不是普通纹理。它同时要求语义正确、字形正确、布局正确、局部清晰和跨语言稳定。课程学习让模型先学基础字形和短文本,再学多行排版与段落级语义。
这条 curriculum 的直觉是:先让模型学会“字形像字”,再学会“短词正确”,最后才学“多行排版、段落语义和设计层级”。如果一开始就把复杂 PPT、海报、漫画、信息图全部混在一起,模型很容易学到表面纹理,却无法稳定生成可读文字。
prompt -> target image
text instruction + input image -> edited image
input image -> reconstructed image
VLM branch 理解人、物体、动作关系、空间关系和文字内容;VAE branch 保留颜色、纹理、字体、边缘、材质、人脸细节和产品形状。MMDiT 融合语义、外观、文本指令和目标 latent。
问题:普通编辑对只告诉模型“改后长什么样”,没有明确告诉它“哪里不能动”。因此模型可能把局部文字编辑变成全图重绘,出现身份漂移、字体漂移、产品形状漂移和背景变化。
做法:加入 input image -> reconstructed image 任务,让模型先学会原样保留,再学会按指令局部修改。
直觉:一个不会“保持不变”的编辑模型,很难稳定做到“只改指定区域”。
技术解释:reconstruction task 对齐 VLM semantic representation 与 VAE appearance representation,让模型同时学习语义保留和外观保留,减少编辑时的 latent drift。
可能副作用:reconstruction 比例过高会让模型变保守,编辑幅度不足;比例过低则无法形成稳定 preservation prior。
评估指标:identity similarity、background preservation、LPIPS、CLIP-I、OCR consistency、text edit success、product shape consistency。
Ablation 思考:文字渲染能力到底来自哪里?
- 去掉 OCR-inclusive caption:模型知道“这里有字”,但不知道“具体是什么字”。
- 去掉 synthetic rendered text:罕见汉字、小字号、长段落和复杂排版覆盖不足。
- 换低保真 VAE:文字在 latent 中已经损坏,DiT 再强也很难恢复。
- 去掉 OCR reward:后训练阶段文字正确性缺少可验证反馈。
推荐指标:OCR exact match、CER / WER、layout correctness、small-font readability、reconstruction OCR retention。
Ablation 思考:编辑稳定性来自哪里?
- 去掉 edit pair:模型缺少“指令 -> 改后图”的监督。
- 去掉 difference caption:模型不知道“改什么”和“保留什么”的边界。
- 去掉 I2I reconstruction:模型缺少 preservation prior,局部编辑容易全图漂移。
- 去掉 identity reward:人物、商品和品牌一致性没有后训练压力。
Qwen-Image 的能力集合必须按文字和编辑任务来理解,而不是只按“画面审美”评价。它覆盖中文文字渲染、English text rendering、多语言混排、多行文本、段落级文字、海报 / PPT / 信息图,以及精确图像编辑。
Qwen-Image-2.0 使用 Qwen3-VL 作为 condition encoder,并用 Multimodal Diffusion Transformer 做 joint condition-target modeling,目标是 slides、posters、infographics、comics 等 text-rich 视觉内容。
| 类型 | 可确认内容 | 不应写成确定事实的内容 |
|---|---|---|
| 公开事实 | Qwen-Image-2.0 使用 Qwen3-VL 作为 condition encoder;使用 Multimodal Diffusion Transformer 做 joint condition-target modeling;目标覆盖 slides、posters、infographics、comics 等 text-rich 视觉内容;支持约 1K token instruction。 | 具体数据比例、课程学习阶段比例、OCR pipeline 内部实现。 |
| 合理推断 | 训练数据需要大量 PPT、海报、信息图、漫画、UI、多语言图文混排和长 instruction 样本。 | 每类数据的占比、采样权重、自动标注模型细节。 |
| 作者观点 | Qwen-Image-2.0 更像图文设计执行系统,而不是普通文生图模型。 | 不要把这个定位写成官方命名。 |
Qwen-Image-2.0 的数据不只是普通自然图文对,而需要大量 PPT 页面、海报、信息图、漫画分镜、UI / mockup、图文混排、多语言排版和长 instruction -> image 配对样本。模型用 Qwen3-VL 作为 condition encoder,并以 MMDiT / Multimodal Diffusion Transformer 做 joint condition-target modeling;核心变化是从“生成一张图”升级为“按长指令生成图文复合视觉作品”。
支持最长约 1K token 指令,面向专业级排版和统一生成 / 编辑。训练依赖 large-scale data curation 与 customized multi-stage training pipeline。
文字、logo、UI、小字、细线、产品边缘失败,不一定只来自 DiT 主干,也可能来自 latent tokenizer / VAE 不够保真。
VAE metrics ready
高压缩降低 token 成本,但如果没有 text-rich 与 synthetic rendering 数据,OCR correctness 和小字可读性会先掉。
| Slider | 含义 | 调高后的收益 | 可能风险 | 验证指标 |
|---|---|---|---|---|
| compression | latent 压缩率 / token 成本。 | token 少、训练和推理更便宜。 | 小字、logo、边缘损坏。 | OCR retention、LPIPS、line preservation。 |
| text-rich data | VAE 训练中图文密集样本占比。 | 小字、文档、UI、海报重建更好。 | general natural image 分布受影响。 | small-font readability、document reconstruction score。 |
| semantic alignment | latent 与语义空间对齐强度。 | DiT 更容易学习条件到图像的映射。 | 过强可能损失低层纹理。 | diffusability、caption-image alignment、downstream T2I quality。 |
直观理解:VAE 像是图像模型的“压缩相机”。DiT 并不是直接在高清像素上画图,而是在 VAE 压缩后的 latent space 里工作。如果这台压缩相机把小字、logo、细线和产品边缘压坏了,后面的生成模型再强,也是在一张坏草稿上作画。
工程作用:VAE 不是可替换的小模块,而是整个图像生成系统的接口层。训练 text-rich 模型时,VAE 数据必须覆盖文档、海报、PPT、UI、小字号、logo、包装、图表和 synthetic rendered text。
技术边界:reconstruction fidelity 与 diffusability 不完全等价。一个 VAE 可以重建得很好,但 latent distribution 不一定适合 DiT 学习。Qwen-Image-VAE-2.0 强调 semantic alignment,目的就是让 latent space 更适合 diffusion / flow 模型建模。
扩展到 billions of images,并加入 synthetic rendering engine 来增强 text-rich 场景重建。
使用 semantic alignment strategy,让 latent space 更适合 diffusion modeling。
用 OCR-based evaluation metrics 评估文档和文字场景,关注 reconstruction fidelity 与 diffusability。
general images、text-rich documents、posters / PPT / UI、synthetic rendered text、small-font OCR、logos / packaging / diagrams。
奖励模型来自 fine-tuned VLM,采用 pointwise scoring 与 chain-of-thought reasoning。T2I 奖励覆盖 alignment、aesthetics、portrait fidelity;编辑任务覆盖 instruction-following accuracy 和 face identity preservation。
训练技巧包括 GRPO、hybrid CFG、prompt curation / prompt filtering、intra-group reward range filtering、per-category reward weight calibration 和 on-policy distillation。它说明图像模型训练正在 LLM 化:base model 之后需要 SFT、reward model、RL 和 distillation 才能可靠满足偏好、指令跟随和生产约束。
风险边界:图像 RL 的难点不只是找到一个 reward model,而是防止 reward hacking。OCR reward 可能鼓励模型生成过粗、过硬、过度居中的文字;审美 reward 可能导致过饱和、过度平滑或风格收缩;identity reward 可能让编辑模型过度保守。因此需要 reward ensemble、range filtering、per-category calibration 和人工抽检。
Ablation 思考:VAE 能力来自哪里?
- 提高 compression:token 成本下降,但小字、logo 和边缘更容易丢。
- 去掉 text-rich VAE data:自然图可能还行,文档、海报、UI 重建明显下降。
- 去掉 semantic alignment:reconstruction 可能好看,但 latent 不一定适合 DiT 学习。
- 不评估 diffusability:会把“重建好”误当成“生成好”。
Z-Image 的价值不是单点性能,而是公开展示了一套高效训练 recipe:6B 单流 S3-DiT、动态数据基础设施、双语多粒度 caption、SFT 分布收窄、model merging、few-step distillation、RLHF 和 prompt enhancer。
Z-Image 的核心不是“模型越小越好”,而是“每一单位 compute 学到的信息更多”。如果两个样本长得几乎一样、caption 又差,继续喂给模型只是在浪费 GPU-hour;如果一个样本覆盖长尾概念、文字清楚、caption 准确、和当前训练阶段匹配,它就有更高的信息增益。
| 类型 | 可确认内容 | 不应写成确定事实的内容 |
|---|---|---|
| 公开事实 | Z-Image 披露 6B 单流 S3-DiT、数据 profiling / vector / knowledge graph / active curation、双语多粒度 caption、多阶段训练、Turbo 8-step no-CFG、DPO / GRPO / distillation 等训练路线。 | 未公开数据集完整清单、全部采样权重、内部 reward model 细节。 |
| 合理推断 | 它的训练效率来自 profiling、rarity score、curriculum、caption 分层和 post-training 组合。 | 各 engine 对最终性能的独立贡献比例。 |
| 作者观点 | Z-Image 更适合当作开源训练 recipe 和 ablation 思维样板。 | 不要把“最优开源路线”写成确定结论。 |
提取低层物理属性和高层语义属性,包括分辨率、宽高比、文件大小、pHash、technical quality、compression artifacts、语义类别、语言、OCR / text richness 和复杂度。
为什么重要:没有 profiling,就不知道哪些样本是低质、重复、文字密集、长尾或 hard case;没有这些标签,就无法做动态采样和课程学习。
基于 billions of embeddings 做大规模语义去重、跨模态检索和相似样本发现。
为什么重要:跨模态向量检索不只是为了去重,也可以发现“图片相似但 caption 不一致”“caption 相似但视觉不同”的训练噪声和长尾空洞。
组织知识层级,发现概念空洞,重平衡概念分布,维护长尾概念覆盖。
为什么重要:知识图谱让采样不只按图片相似度走,而是按概念覆盖和长尾稀缺性走,避免模型只会高频物体和常见风格。
通过自动采样发现 hard cases,驱动闭环标注、补数据和下一阶段重采样。
为什么重要:active curation 让训练变成闭环:模型哪里失败,就把对应 hard case 找出来、补标注、重采样,再进入下一轮训练。
{
"image_path": "...",
"source": "...",
"width": 1024,
"height": 1024,
"aspect_ratio": "1:1",
"pHash": "...",
"quality_score": 0.92,
"compression_score": 0.07,
"aesthetic_score": 0.88,
"language": ["zh", "en"],
"has_text": true,
"ocr_text": "...",
"text_density": "medium",
"semantic_categories": ["poster", "portrait", "birthday"],
"style_tags": ["minimal", "warm lighting"],
"long_caption": "...",
"medium_caption": "...",
"short_caption": "...",
"simulated_user_prompt": "...",
"rarity_score": 0.73,
"curriculum_complexity_score": 0.61
}
Z-Captioner 生成 bilingual、multi-level synthetic captions:long descriptions、medium descriptions、short descriptions、tags 和 simulated user prompts。long caption 学完整视觉描述和细节绑定;medium / short caption 学真实用户 prompt;tags 学风格、类别和属性;simulated user prompt 学口语化、不完整、只关注局部的输入。原始 textual metadata 也会以小概率加入训练,以帮助模型吸收 world knowledge。
difference caption 是从 source image 到 target image 的简洁编辑指令。流程是:分别生成包含 OCR 的 source / target 详细 caption,做差异分析,最后合成明确“改什么、保留什么”的简洁编辑指令。
source: 白色杯子放在桌上,杯子上写着 “COFFEE”。
target: 黑色杯子放在桌上,杯子上写着 “QWEN”。
difference caption:
Change the cup color from white to black and replace the text "COFFEE" with "QWEN"; keep the table, lighting, and composition unchanged.
用低分辨率学习基础视觉语义对齐、构图、颜色、常见物体和基础中文文字能力。低分辨率 token 数少、batch 大、吞吐高,适合高效学习世界知识;公开报告称该阶段消耗超过一半 pretraining compute,很多 foundational visual knowledge 包括中文文字渲染是在这一阶段获得的。
任意分辨率训练,T2I / I2I 联合训练,双语多粒度 caption,初始化 image-conditioned generation / editing 能力。
curated images 与 super detailed grounded captions,把分布从 diversity-maximizing 收窄到 high-fidelity sub-manifold。SFT 如果只用高质量数据,可能导致概念覆盖变窄、长尾遗忘、风格变单一;需要 concept balancing with tagged resampling、BM25-based retrieval、rarity scores、target prior,并对 rare entities / specific artistic styles 上调采样权重。
训练多个偏向 instruction、aesthetic、realism、style diversity 的 SFT variants,再做参数空间线性插值。
从 50 / 100 NFE + CFG teacher 蒸馏到 8-step no-CFG Turbo student,包含 Decoupled DMD、DMDR、teacher denoising dynamics imitation 和 8-step real-time inference。
先 DPO offline alignment,再 GRPO online refinement,奖励关注 instruction-following、AI-content detection perception、realism、aesthetic quality、text rendering、object counting 和 layout correctness。DPO 适合从文字渲染、物体计数、颜色和空间关系等可验证客观维度冷启动,GRPO 再优化审美、真实感和更主观偏好。
在 base / turbo 能力基础上继续训练编辑任务,得到 Z-Image-Edit。
固定 VLM 与 system prompt 构造 PE,在 SFT 阶段让 DiT 适配 PE 输出的 structured reasoning chain。
| 模型 | 训练阶段 | 推理步数 | CFG | 特点 | 适用场景 |
|---|---|---|---|---|---|
| Z-Image Base | pretraining + SFT | 50 steps | 使用 CFG | 多样性更好,可 fine-tune | 研究、LoRA、通用基础模型 |
| Z-Image-Turbo | pretraining + SFT + RL + distillation | 8 steps | no CFG | 速度快,视觉质量高,多样性较低 | 实时交互、本地部署、产品原型 |
| Z-Image-Edit | continued editing training | 视实现而定 | 视实现而定 | 图像编辑能力 | 指令编辑、局部修改、参考图编辑 |
Z-Image 使用 FSDP2 shard optimizer states and gradients、gradient checkpointing、torch.compile、sequence length-aware batch construction、similar resolution / sequence length batching,并按 long sequence small batch、short sequence large batch 减少 padding 和 OOM。公开训练 compute 约 314K H800 GPU-hours:low-res pretraining 147.5K,omni-pretraining 142.5K,post-training 24K。
咖啡海报样本在 Z-Image 式数据系统里不会只是“poster”标签:它还会被标成中文、text-rich、中等文字密度、含 logo、可做价格编辑、需要 OCR reward 的 hard case。这些字段决定它在 curriculum、rarity resampling 和 editing continued training 中被如何使用。
Ablation 思考:Z-Image 的效率来自哪里?
- 去掉 data profiling:无法按质量、OCR、复杂度、长尾程度动态采样。
- 去掉多粒度 caption:模型只适配单一 caption 风格,真实用户短 prompt 效果下降。
- 去掉 rarity score / tagged resampling:SFT 后更容易长尾遗忘。
- 去掉 few-step distillation:质量可能保留,但实时部署能力下降。
- 去掉 RLHF:Turbo 模型可能快,但 instruction following、text rendering 和 layout correctness 难以继续提升。
当我们说模型看 prompt、看参考图、生成 1024×1024 图片时,模型内部真正处理的是 text tokens、latent image tokens、reference tokens、位置 ids、scheduler timesteps 和 guidance 信号。
用户看到的是 prompt、参考图和输出图;模型看到的是 token sequence。prompt 先经过 text encoder 或 VLM condition encoder,变成 text tokens;目标图从随机噪声 latent 开始,按 VAE 的 latent 空间组织成 image tokens;参考图如果存在,也会被编码成 latent tokens 或视觉语义 tokens。DiT / MMDiT / S3-DiT 真正做的是在这些 tokens 之间建模关系,并在每个采样步预测 velocity 或 denoising direction。
因此,“支持 2K 分辨率”“支持 10 张参考图”“支持复杂中文海报”这些能力,背后都对应具体的 token 组织成本:更高分辨率意味着更多 image tokens;更多参考图意味着更长 condition sequence;更长 prompt 意味着更多 text tokens;传统 CFG 还可能让每一步推理跑两条条件路径。现代图像模型的采样优化,本质上是在质量、token 数、步数、CFG、cache、attention kernel 和 VAE 压缩之间做系统权衡。
| 对象 | 进入模型前的形态 | 模型里对应什么 | 为什么影响能力 |
|---|---|---|---|
| 用户 prompt | 自然语言、短指令、结构化描述。 | text tokens 或 VLM condition tokens。 | 决定语义、布局、文字、风格和编辑目标。 |
| 目标图 | 随机噪声 latent 或待编辑图的 noisy latent。 | target image latent tokens。 | token 数决定 attention 成本和 scheduler 设计。 |
| 参考图 | 商品、人物、风格、版式或原图。 | reference latent tokens、VLM semantic tokens 或 KV cache。 | 决定一致性、局部编辑和多参考控制。 |
| 采样时间 | step index / sigma / timestep。 | timestep embedding、flow schedule、time shift。 | 决定每一步在噪声路径上的位置,和分辨率/token 数耦合。 |
| guidance | CFG scale、guidance embed、negative prompt。 | 双路预测、模型输入调制或蒸馏后的内化行为。 | 影响 prompt following、成本、过饱和和文字稳定性。 |
FLUX.2 可以看成 FLUX 系列从高质量文生图 / 编辑模型走向生产级视觉工作流模型的一代:它强调多参考图、一致性、复杂文字、品牌约束、图像编辑和最高约 4MP 输出。和 FLUX.1 相比,这里不能只讲 backbone,还要讲参考图和目标图如何作为 token sequence 进入模型、不同分辨率如何改变 time schedule,以及 Klein 系列如何通过 size / step / guidance distillation 与 KV cache 服务不同部署场景。
| 内容 | 可确认表述 | 证据边界 |
|---|---|---|
| FLUX.2 dev | 32B flow matching transformer,支持 text-to-image 与 single/multi-reference editing。 | 官方 repo / 官方博客。 |
| 多参考 | 官方披露最多支持 10 张参考图,并强调统一文生图、单参考编辑和多参考编辑。 | 可以写能力边界,不能推出训练数据比例。 |
| 条件编码 | 官方博客描述为 Mistral-3 24B VLM 与 rectified flow transformer 结合;公开 repo 提到 prompt upsampling 可用 Mistral-Small-3.2-24B-Instruct-2506。 | prompt upsampling 是推理时 condition rewriting,不等于已确认的训练数据 recipe。 |
| VAE | FLUX.2 VAE 重新训练,优化 learnability、quality、compression;repo 也说明 autoencoder 相比 FLUX.1 有改进。 | 可以讨论 latent space 变化,不能补写未公开的数据配方。 |
| Klein | Klein 是 size-distilled 系列;distilled 版本面向 4-step 生产,Base 版本面向 fine-tuning、LoRA 和 research。 | teacher/student 细节未完整公开。 |
| 模型 | in_channels | context_in_dim | hidden_size | heads | double depth | single depth | axes_dim | guidance embed |
|---|---|---|---|---|---|---|---|---|
| FLUX.2 dev | 128 | 15360 | 6144 | 48 | 8 | 48 | [32,32,32,32] | true |
| FLUX.2 Klein 9B | 128 | 12288 | 4096 | 32 | 8 | 24 | [32,32,32,32] | false |
| FLUX.2 Klein 4B | 128 | 7680 | 3072 | 24 | 5 | 20 | [32,32,32,32] | false |
这些是公开 repo 中可见的 open-weight / local inference 配置层信息,不等于闭源服务的全部内部 recipe。关键变化是 FLUX.2 使用 t,h,w,l 四轴 token 坐标:h,w 表示空间位置,l 表示文本 token 或局部顺序,t 用于区分不同时间、参考帧或条件图。axes_dim=[32,32,32,32] 把 RoPE 维度分配到四个坐标轴上。
| 数据 | 形状直觉 | 作用 |
|---|---|---|
| text tokens | [B, T_text, context_in_dim] | prompt、prompt upsampling 或 VLM condition encoder 输出。 |
| text ids | [B, T_text, 4] | text token 的 t,h,w,l 坐标,通常 h/w/t 是 dummy,l 是 token index。 |
| target noisy latent tokens | [B, T_img, 128] | 当前采样步需要去噪的目标图 latent tokens。 |
| target image ids | [B, T_img, 4] | 目标图 token 的 t,h,w,l 坐标。 |
| reference latent tokens | [B, T_ref, 128] | 参考图经过 FLUX.2 VAE 编码后的 tokens。 |
| reference ids | [B, T_ref, 4] | 参考图 token 的 t,h,w,l 坐标,用 t offset 区分不同参考图。 |
# 解释数据组织的伪代码
text, text_ids = encode_prompt(prompt) # [B, T_text, D_ctx], [B, T_text, 4]
img, img_ids = prepare_noisy_target(H, W) # [B, T_img, 128], [B, T_img, 4]
ref, ref_ids = encode_reference_images(refs) # [B, T_ref, 128], [B, T_ref, 4]
pred_all = model(
img=cat([img, ref], dim=1),
img_ids=cat([img_ids, ref_ids], dim=1),
txt=text,
txt_ids=text_ids,
timesteps=t,
)
pred_target = pred_all[:, :T_img]
img = img + (t_next - t) * pred_target
多参考不是把参考图简单贴进 prompt,而是把参考图编码成 latent tokens,并和目标图 token 一起参与 transformer 计算。这解释了多参考一致性的来源,也解释了参考图数量、参考图分辨率和输出分辨率都会提高 sequence length 与 attention 成本。
参考图在每个 denoising step 中基本不变,目标图 latent 会随时间更新。KV cache 路径会在第一步抽取 reference token 相关 cache,后续 step 复用它,只更新目标图 token 的去噪路径。它主要改善多参考编辑的 latency、throughput 和 VRAM-latency trade-off,不应写成质量提升机制。
flow matching / rectified flow 的采样 schedule 也和分辨率相关。FLUX.2 公开采样代码会根据 image_seq_len 计算经验 mu,再对 timestep schedule 做 SNR shift:
\( \text{shift}(t;\mu,\sigma)=\frac{e^\mu}{e^\mu + (1/t - 1)^\sigma} \)
mu 来自 image token sequence length,而不是直接来自原始像素面积。这里应解释为 resolution-aware schedule,不要写成固定论文公式或唯一训练 schedule。
4-step / 8-step 模型通常不是把 50-step 模型少跑几步,而是通过 step distillation 让 student 学会在更少时间点上逼近 teacher trajectory。no-CFG 模型也不是简单把 CFG scale 设成 0,而是通过 guidance distillation 或 reward post-training 把 prompt-following 行为内化进模型。
所以采样参数要和训练 recipe 一起理解:Base 模型适合高步数、CFG、fine-tuning 和多样性;distilled 模型适合低延迟生产;KV cache 适合多参考条件复用;prompt rewriting 适合把用户输入变成更接近训练 caption 分布的条件。
| 模型 | 推理定位 | 典型步数 | CFG / guidance | 适合场景 | 不适合场景 |
|---|---|---|---|---|---|
| Klein 4B | 最轻量、边缘 / 消费级 GPU。 | distilled 生产路径通常少步。 | guidance-distilled,不强调传统 CFG。 | 本地实时、快速原型、低 VRAM。 | 极限质量、多参考复杂工作流。 |
| Klein 9B | 质量更高的轻量模型。 | distilled 生产路径通常少步。 | guidance-distilled。 | 文生图、轻量编辑、质量/速度平衡。 | 重度定制训练。 |
| Klein 9B KV | 多参考编辑低延迟。 | distilled + KV cache。 | guidance-distilled。 | 多参考图编辑、产品工作流。 | 不需要参考图时收益有限。 |
| Klein 4B Base | undistilled foundation。 | 50-step 研究 / fine-tune 路径。 | 可保留更传统控制。 | LoRA、小团队定制、研究。 | 最低延迟生产。 |
| Klein 9B Base | undistilled foundation。 | 50-step 研究 / fine-tune 路径。 | 控制和多样性更完整。 | 高质量定制、research。 | 实时线上推理。 |
| FLUX.2 dev | 32B 高质量 open-weight。 | 非 step-distilled。 | guidance embed。 | 高质量、多参考、研究、LoRA。 | 低 VRAM、本地实时。 |
技术边界:Distilled 模型已经被训练成在少数采样步内逼近 teacher 输出分布,trajectory、分布多样性和 step behavior 都被压缩过。Base 模型虽然慢,但保留更完整的训练信号和更宽的分布,更适合定制微调、风格 LoRA、control adapter 或研究 ablation。传统 CFG 是 conditional / unconditional 双路预测;guidance embed 是模型输入调制;guidance distillation 是把 guidance 行为训练进 student。
Qwen-Image 的强项不是“又一个 DiT”,而是把图像生成问题重写成强视觉语言模型参与的多模态条件建模问题。复杂文字、中文、多语言排版、海报、PPT、UI 和编辑一致性,都依赖 text-rich 数据、OCR-aware caption、Qwen2.5-VL / Qwen3-VL condition encoder、VAE latent packing、true CFG 与 prompt rewriting 的组合。
| 项目 | 典型公开配置 | 解读 |
|---|---|---|
| Backbone | MMDiT / QwenImageTransformer2DModel | 多模态条件和图像 latent 联合建模。 |
| Transformer | 60 layers,24 heads,head dim 128 | 较深 transformer 主干。 |
joint_attention_dim | 3584 | 来自 Qwen2.5-VL 等条件编码器的 joint condition dim。 |
in_channels / out_channels | 64 / 16 | 输入通常来自 VAE latent channel × 2×2 packing,输出再 unpack 回 VAE latent channel。 |
| RoPE axes | (16,56,56) | text/time 或 multimodal 轴 + 空间 h/w 轴的 RoPE 分配。 |
| max sequence length | 1024 | 长 prompt / 图文设计 instruction 上限。 |
| scheduler | FlowMatchEulerDiscreteScheduler | flow matching / Euler 类采样路径。 |
Qwen-Image 不是直接在 1024×1024 像素上运行 transformer。图像先经过 VAE 压缩到 latent,再把相邻的 2×2 latent patch 打包成一个 transformer token。假设 VAE 空间压缩倍率是 8,那么 1024×1024 图像会变成约 (1024/16) × (1024/16) = 4096 个 image tokens。这里的 16 来自 VAE 的 8 倍空间压缩再乘以 2×2 packing。
vae_latent = vae.encode(image) # [B, 16, H/8, W/8]
packed = pack_2x2(vae_latent) # [B, (H/16)*(W/16), 64]
pred = transformer(packed, prompt_embeds, ids)
latent = unpack_2x2(pred) # [B, 16, H/8, W/8]
image = vae.decode(latent)
| 参数 | 直观含义 | 技术含义 | 常见误区 |
|---|---|---|---|
true_cfg_scale | 显式增强 prompt 约束。 | conditional / negative conditional 差分,更接近传统 classifier-free guidance。 | 越大不一定越好,可能过饱和或损坏文字。 |
guidance_scale | 模型内部 guidance 信号。 | 在部分 guidance-distilled 变体中作为模型输入调制,不一定触发双 batch CFG。 | 不能把它和传统 CFG 完全等同。 |
num_inference_steps | 采样步数。 | Euler / flow scheduler steps。 | 少步需要模型在训练或蒸馏阶段支持。 |
Qwen-Image 的公开 pipeline 中也有根据 image sequence length 计算 shift 的逻辑。典型实现会在 base sequence length 和 max sequence length 之间线性插值 mu,再交给 flow scheduler 设置 timesteps。它和 FLUX.2 的经验 time shift 思路相似:核心都是让 schedule 感知分辨率/token 数,而不是把所有画布大小都使用完全相同的时间网格。
编辑时,原图一方面进入 Qwen2.5-VL / Qwen3-VL 这样的视觉语言模型,提供语义理解;另一方面进入 VAE encoder,提供可重建的外观与细节。前者帮助模型理解“要改什么”,后者帮助模型保留“不能改什么”。
用户 prompt:把海报价格改成 19 元。
改写后 prompt:保持海报背景、咖啡杯、品牌 logo、暖色灯光和整体版式不变,仅将主标题下方价格文字从“29 元”改为“19 元”,字体风格、字号和位置保持一致。
这个改写不是为了把 prompt 写长,而是把局部编辑的 preserve / edit 边界显式化,降低模型把整张图一起漂移的概率。
| 维度 | Qwen-Image | Qwen-Image-2.0 | 应该强调的变化 |
|---|---|---|---|
| 条件编码 | Qwen2.5-VL 参与语义条件。 | Qwen3-VL condition encoder。 | 更强 multimodal understanding。 |
| 主干 | MMDiT。 | Multimodal Diffusion Transformer。 | condition-target joint modeling 更明确。 |
| 指令长度 | 长 prompt / text-rich 场景。 | up to 1K tokens。 | 更适合 PPT、海报、信息图、漫画。 |
| 分辨率 | 常见 1K-ish 多 aspect ratio。 | native 2K support。 | 更高分辨率图文设计。 |
| VAE | 强调文字与编辑。 | VAE-2.0 强调高压缩、重建、diffusability。 | VAE 成为文字与高分辨率能力的关键瓶颈。 |
| 训练 | 大规模数据、渐进训练、I2I reconstruction。 | large-scale curation + customized multi-stage training。 | 继续强化数据系统路线。 |
| VAE 指标 | 为什么重要 |
|---|---|
| reconstruction fidelity | 小字、logo、线条、UI 边缘不能在压缩阶段丢失。 |
| OCR retention | decode 后文字还得能被 OCR 正确识别。 |
| diffusability | latent distribution 要利于 DiT / flow 学习,而不只是人眼看起来能重建。 |
| semantic alignment | latent 与 VLM semantic representation 更一致,利于编辑和图文条件绑定。 |
| compression ratio | 决定 token 数、显存、速度和高分辨率上限。 |
Z-Image 代表的是另一条路线:在参数量和训练成本相对受控的前提下,通过数据工程、单流架构、prompt enhancement-aware SFT、few-step distillation 和 reward post-training 做出高效率图像生成模型。它的价值不只是 6B,而是展示了如何把 caption、分辨率、多任务训练、SFT、RL 和 distillation 组织成一个可复现程度更高的训练 pipeline。
| 内容 | 可确认表述 | 证据边界 |
|---|---|---|
| 参数规模 | 6B 级模型家族。 | 官方 repo / 论文。 |
| 架构 | S3-DiT:single-stream diffusion transformer;文本、视觉语义和图像 VAE tokens 序列级 concat。 | 论文 / 官方 repo。 |
| text encoder / VAE | 使用 Qwen3-4B 作为 text encoder,使用 Flux VAE 做图像 tokenization。 | 论文。 |
| 位置编码 | 3D Unified RoPE;编辑中 reference / target 使用空间对齐和 temporal offset。 | 论文。 |
| Turbo / Base | Turbo 走 8 NFE / no CFG 快速推理;Base 走 50-step CFG,适合质量、多样性和 fine-tuning。 | 官方 repo / 论文。 |
| 训练成本 | 报告披露约 314K H800 GPU-hours。 | 只能作为该报告的预算尺度,不应泛化到所有类似模型。 |
| 未公开 | 全量数据源、过滤器细节、reward model 完整定义、真实线上部署优化。 | 必须保留未知。 |
| 项目 | 配置 | 解读 |
|---|---|---|
| transformer dim | 3840 | 6B 模型主干宽度。 |
| layers / refiner layers | 30 / 2 | 主干层数与输入 token refinement。 |
| heads / qk norm | 30 / true | attention heads 与训练稳定性设计。 |
| image latent channels | 16 | Flux VAE latent channel。 |
| patch size | 2 | latent patchify 后进入 transformer。 |
| text feature dim | 2560 | Qwen3-4B text encoder 输出维度。 |
| RoPE axes | [32,48,48] | 3D Unified RoPE 维度分配。 |
| max text length | 512 | 典型 pipeline 参数。 |
reference image tokens 和 target noisy image tokens 不是简单拼图,而是在 token sequence 中一起建模。reference 与 target 使用对齐的空间 RoPE 坐标,以便模型知道它们对应同一个画面区域;同时用 temporal offset 和不同 time-conditioning 区分“干净参考图”和“正在去噪的目标图”。这解释了编辑一致性为什么和 token 组织强相关。
Turbo 的 8-step / no-CFG 能力不是把 50-step base 强行少跑几步,而是通过 few-step distillation 和 reward post-training 重新训练得到的。D-DMD、DMDR 等机制用于让少步 student 更接近 teacher 分布,同时抑制 reward hacking 和蒸馏带来的质量 / 多样性损失。
| 对象 | 公开成本 / 设置 | 目标 | 解释 |
|---|---|---|---|
| Low-res pretraining | 147.5K H800 GPU-hours | 跨模态对齐、基础视觉知识、中文文字等基础能力。 | 先学世界和语言-图像绑定。 |
| Omni-pretraining | 142.5K H800 GPU-hours | 任意分辨率、多任务、T2I/I2I 联合训练。 | 学习多分辨率、多条件、多任务。 |
| Post-training | 24K H800 GPU-hours | SFT、distillation、reward post-training。 | 把 base 模型拉向可用产品行为。 |
| Z-Image-Omni-Base | 50 steps + CFG | pretraining only。 | 原始多任务 base,不是最终产品最优。 |
| Z-Image | 50 steps + CFG | pretraining + SFT。 | 高质量、可控、多样性。 |
| Z-Image-Turbo | 8 steps / no CFG | pretraining + SFT + RL / distillation。 | 快速生成、低延迟、本地部署;不适合继续 fine-tune。 |
| Z-Image-Edit | 50 steps + CFG | edit fine-tuning。 | 指令编辑,速度慢于 Turbo。 |
| 模型 | 图像 latent token | 文本/条件 token | 参考图注入方式 | 位置编码 / ids | 关键启发 |
|---|---|---|---|---|---|
| FLUX.1 | VAE latent 2×2 packing,常见 token dim 64。 | T5 / CLIP 文本条件。 | Kontext 为 sequence-wise image tokens;Control/Fill 有 channel-wise 变体。 | 3 轴 RoPE / image ids。 | 图片进入 DiT 是 latent token sequence,不是像素。 |
| FLUX.2 | FLUX.2 VAE latent tokens,公开代码 in_channels=128。 | Mistral/VLM-style condition,context dim 取决于模型。 | 多参考图 latent tokens sequence-wise concat;KV 版本缓存 reference K/V。 | t,h,w,l 四轴 ids,axes_dim=[32,32,32,32]。 | 多参考生产工作流依赖条件组织和缓存。 |
| Qwen-Image | VAE latent + 2×2 packing,常见 16 -> 64。 | Qwen2.5-VL condition / prompt embeds。 | 编辑中原图走 VLM semantic + VAE appearance 双路径。 | RoPE axes 典型 (16,56,56)。 | 文字与编辑能力来自 VLM condition + text-rich data + VAE。 |
| Qwen-Image-2.0 | VAE-2.0,高压缩与 diffusability 优化。 | Qwen3-VL condition encoder。 | generation/editing unified joint modeling。 | 多模态 DiT。 | 长指令、2K、图文设计能力更强。 |
| Z-Image | Flux VAE latent tokens,patch size 2。 | Qwen3-4B text tokens,可选视觉语义 tokens。 | reference/target sequence 统一建模,空间对齐 + temporal offset。 | 3D Unified RoPE。 | 小模型高效路线依赖 single-stream + 数据/蒸馏 pipeline。 |
| 模型 | 分辨率影响 | schedule / shift | 速度关键 |
|---|---|---|---|
| FLUX.1 | ceil(H/16)*ceil(W/16) image tokens。 | resolution-dependent time shift。 | packing、RoPE、few-step Schnell / distillation。 |
| FLUX.2 | image_seq_len 影响 empirical mu。 | generalized time SNR shift。 | KV cache、Klein distilled、prompt upsampling。 |
| Qwen-Image | VAE scale × 2×2 packing 决定 token 数。 | calculate_shift 根据 image_seq_len 插值。 | true CFG 成本、FlowMatchEuler、prompt rewrite。 |
| Qwen-Image-2.0 | native 2K 带来更大 token 数和 VAE 压力。 | 未公开完整细节,应按公开 pipeline 谨慎写。 | VAE-2.0、轻量架构、condition encoder。 |
| Z-Image | Flux VAE + patchify 决定 image tokens。 | Turbo 通过蒸馏支持少步。 | 8 NFE、no CFG、single stream、推理优化。 |
| 输出分辨率 | 有效 token 网格 | image tokens | attention cost proxy T^2 | 说明 |
|---|---|---|---|---|
| 1024×1024 | 64×64 | 4096 | 16.8M | 常见 1K 方图。 |
| 1536×1024 | 96×64 | 6144 | 37.7M | 横图 token 增加 50%。 |
| 2048×2048 | 128×128 | 16384 | 268M | 2K 方图 attention 压力显著增加。 |
| 4096×1024 | 256×64 | 16384 | 268M | 宽幅图 token 数也可能等同 2K 方图。 |
这张表只用于建立直觉。不同模型的 VAE scale、patch size、token pruning、KV cache、attention kernel、batching 策略都会改变真实延迟,但它能说明高分辨率不仅是多几个像素,而是直接改变 transformer 处理的 sequence length。
| 注入方式 | 代表场景 | 直观含义 | 技术机制 | 优点 | 风险 |
|---|---|---|---|---|---|
| Text-only | 纯文生图。 | 只靠文字描述。 | text encoder condition。 | 简单、快。 | 细节不可控。 |
| Channel-wise concat | Control / Fill / Inpaint。 | 把额外图像信息叠到 latent channel 上。 | noisy latent 与 condition latent 在 channel 维拼接。 | 局部控制直接。 | 输入格式固定,任务专用。 |
| Sequence-wise concat | Kontext / FLUX.2 多参考 / Z-Image Edit。 | 参考图变成另一串 tokens。 | reference tokens 与 target tokens 同进 transformer。 | 多参考、一致性强。 | token 数增加,attention 成本高。 |
| VLM semantic + VAE appearance | Qwen-Image Edit。 | 一路理解图,一路保留图。 | 原图进 VLM 和 VAE 双路径。 | 编辑语义清楚、保留细节。 | prompt rewrite 依赖强。 |
| KV cached references | FLUX.2 Klein 9B KV。 | 参考图看一次,后面复用。 | reference K/V cache across denoising steps。 | 多参考低延迟。 | 实现复杂,存在缓存精度/内存权衡。 |
| 模型 | 后训练关键词 | 直观含义 | 技术关注点 |
|---|---|---|---|
| FLUX.2 dev | guidance embed、prompt upsampling。 | 更听 prompt,更适合复杂描述。 | guidance embed 与 true CFG 的边界。 |
| FLUX.2-Klein distilled | size / step / guidance distillation。 | 小而快,适合生产。 | 多样性、fine-tuning 可塑性、teacher trajectory。 |
| Qwen-Image | SFT、editing data、I2I reconstruction。 | 更会写字、更会稳改图。 | text-rich 数据比例、OCR reward、VAE OCR retention。 |
| Qwen-Image-2.0 | multi-stage training、VAE-2.0、condition-target joint modeling。 | 更长指令、更高分辨率、更强图文设计。 | 2K 下 token cost、VAE diffusability、OCR benchmark。 |
| Z-Image-Turbo | PE-aware SFT、D-DMD、DMDR、reward post-training。 | 少步也能生成好图。 | reward hacking、diversity collapse、teacher-student mismatch。 |
in_channels=64、3 轴 ids、packing 规则直接外推成 FLUX.2。true_cfg_scale 和 guidance_scale 要区分;2×2 latent packing 要和 VAE scale 一起解释。真正的差异不只在模型大小,而在数据公开度、caption 形态、编辑数据、VAE、条件编码、后训练和速度策略。
| 维度 | FLUX / FLUX.1 | FLUX.2 | Qwen-Image / 2.0 | Z-Image |
|---|---|---|---|---|
| 路线 | 工业级 latent rectified flow transformer | 生产级多参考 flow matching transformer | 文字 / 中文 / 图文设计 MMDiT | 高效开源 6B 单流 S3-DiT |
| 数据公开度 | 低,官方高层披露 | 低,产品能力导向披露 | 中,强调 text rendering pipeline | 高,公开数据基础设施和多阶段训练 |
| 数据核心 | 专有混合图文、合成、标注、使用数据 | 多参考、品牌、4MP 编辑、结构化 prompt | OCR、text-rich、中文、多语言、编辑对、图文排版 | profile、vector engine、知识图谱、active curation、双语 caption |
| Caption | 未公开细节 | prompt upsampling 强 | OCR-inclusive、复杂文字、段落级 | long / medium / short / tags / simulated prompt |
| 编辑数据 | Kontext 公开 source + instruction + target 路线 | single / multi-reference editing | T2I + TI2I + I2I reconstruction | difference caption + continued editing training |
| VAE | 从头训练 autoencoder,16-channel latent | 改进 autoencoder,重训 latent space | Qwen-Image-VAE / VAE-2.0 专项 text-rich | VAE tokens 作为统一序列输入 |
| 条件编码 | text/image token 混合,细节有限 | Mistral VLM + flow transformer | Qwen2.5-VL / Qwen3-VL + VAE 双编码 | prompt enhancer + semantic / VAE tokens |
| 后训练 | guidance distillation | size / step distillation,Klein | RLHF、GRPO、OPD | DPO、GRPO、D-DMD、DMDR、model merging |
| 速度策略 | dev / schnell | Klein 4-step / 9B variants | distillation / RL / unified student | Turbo 8-step no-CFG |
| 核心优势 | 高质量、prompt following、开放生态 | 生产级多参考控制和长上下文 | 中文文字、排版、精确编辑 | 低成本、高效率、开源可复现 |
工业闭源数据 + 大模型 + flow matching + 安全过滤 + 多产品线蒸馏。重点是高质量、多参考图、一致性和生产级工作流。
production workflowmulti-referencedistillation专项文字/OCR/中文/排版数据 + VLM 条件编码 + I2I reconstruction + RLHF。重点是模型真正会写字、懂图、会改图。
OCR dataQwen-VLRLHF数据效率最大化 + 单流小模型 + 动态采样 + 多粒度 caption + prompt enhancer + RL/蒸馏。重点是在 6B 和低成本条件下逼近大模型体验。
data efficiencyprompt enhancer8-step Turbo| 你的目标 | 应该重点学习 | 原因 |
|---|---|---|
| 做中文海报 / PPT / UI / 信息图生成 | Qwen-Image 路线 | text-rich、OCR、中文、多语言排版是核心。 |
| 做电商商品图、多参考一致性、品牌视觉 | FLUX.2 路线 | 多参考、品牌约束、产品一致性和生产工作流更关键。 |
| 做可复现开源训练 / 小模型部署 | Z-Image 路线 | 数据效率、6B 单流架构、8-step Turbo、公开 recipe 更适合学习。 |
| 做本地图像编辑模型 | Qwen + Z-Image 结合 | I2I reconstruction、difference caption、continued editing training 都重要。 |
| 做极速生成产品 | FLUX Klein / Z-Image-Turbo 思路 | few-step distillation、no/low CFG、推理延迟优化是核心。 |
| 做研究型 ablation | Z-Image + Qwen-VAE 思路 | 一个提供训练 recipe,一个提供 text-rich VAE / OCR 评估方向。 |
自训练路线的第一步不是选最大 DiT,而是把数据 schema、VAE 数据、caption 数据、编辑数据、SFT、RL 和蒸馏边界定义清楚。
{
"image_path": "...",
"source": "...",
"license_type": "...",
"width": 1024,
"height": 1024,
"aspect_ratio": "1:1",
"pHash": "...",
"quality_score": 0.92,
"aesthetic_score": 0.88,
"compression_score": 0.05,
"safety_labels": ["safe"],
"language": ["zh", "en"],
"has_text": true,
"ocr_text": "...",
"text_density": "medium",
"semantic_categories": ["poster", "product", "portrait"],
"style_tags": ["minimal", "cinematic"],
"long_caption": "...",
"medium_caption": "...",
"short_caption": "...",
"simulated_user_prompt": "...",
"rarity_score": 0.73,
"curriculum_complexity_score": 0.61
}
schema 的目的不是“字段越多越好”,而是让后续采样、课程学习、ablation、评估和错误诊断都能落到可查询字段上。
{
"source_image": "...",
"target_image": "...",
"instruction": "...",
"source_caption_with_ocr": "...",
"target_caption_with_ocr": "...",
"difference_caption": "...",
"edit_type": "text_edit | local_edit | global_edit | style_reference | character_reference",
"preserve_regions": ["face", "background", "lighting"],
"identity_similarity_score": 0.94,
"text_edit_correctness": 0.98
}
编辑 schema 要显式记录改动目标和保留目标。没有 preserve_regions、identity score 和 OCR consistency,后面就很难判断编辑模型为什么漂移。
目标不是从零训练通用 foundation model,而是验证机制。
不应承诺:从零训练通用 T2I foundation model,或在低预算下同时追求通用能力、文字能力、编辑能力和极速推理。
关键取舍:不追求全世界知识覆盖,优先做垂直场景高可靠性;不追求一个 checkpoint 解决所有问题,区分 base、edit、turbo。
关键风险:数据治理、版权、安全和隐私成为核心瓶颈;reward hacking 和分布收缩会在后训练中放大;few-step distillation 会带来质量、速度和多样性的 Pareto trade-off。
不要低估 VAE。文字、logo、UI、小字、细线、产品边缘,很多失败不是 DiT 单独造成的,而是 latent tokenizer 不保真。
pretraining 学 world knowledge 和 mode coverage;SFT 把分布收窄到 high-fidelity sub-manifold,但需要 balancing 防止长尾遗忘。
无文字图 -> 单词 / logo -> 短句 -> 多行文字 -> 中英混排 -> 小字 -> 长段落 -> PPT / 海报 / 信息图。
Base 保留质量和多样性;Turbo / Klein 做 4-8 steps 和 no/low CFG。不要用一个 checkpoint 同时追求所有 Pareto 端点。
低预算自训时,可以先把这类中文咖啡海报扩成一个可控小数据集:原图、OCR caption、long caption、价格替换 edit pair、I2I reconstruction pair、OCR exact match 和 layout preservation 指标。它不代表通用能力,但能快速验证 caption、VAE、编辑保持和 reward check 是否形成闭环。
只看“图片好不好看”是不够的。现代图像模型要按能力拆开评估,并且评估维度要能回连到训练数据 schema。
| 能力 | 推荐指标 | 说明 |
|---|---|---|
| Prompt following | DPG-Bench、GenEval、object counting、attribute binding、human preference。 | 看模型是否遵守对象、数量、属性、空间关系和复杂 prompt。 |
| 文字渲染 | OCR exact match、CER、WER、LongText-Bench、small-font readability、layout correctness。 | 看文字内容、字形、排版和小字是否正确。 |
| 编辑一致性 | edit success、identity similarity、background preservation、LPIPS、CLIP-I、OCR consistency。 | 看模型是否只改该改的地方。 |
| 多参考一致性 | character consistency、product shape consistency、style consistency、reference adherence。 | 看人物、商品、风格能否跨图稳定。 |
| VAE | reconstruction FID、LPIPS、PSNR / SSIM、OCR retention、logo fidelity、line preservation、diffusability。 | 看 latent tokenizer 是否保留生成所需信息。 |
| 安全 | unsafe generation rate、policy violation rate、NCII / CSAM classifier trigger rate、red-team pass rate。 | 看模型是否能上线,而不是只看能力强不强。 |
| 推理效率 | NFE、latency、VRAM、throughput、quality-latency Pareto。 | 看部署成本和交互体验。 |
评估边界:评估应该和训练数据 schema 对齐。训练时记录了ocr_text、text_density、edit_type、preserve_regions、rarity_score,评估时才能按这些维度切片,定位到底是中文失败、小字失败、长尾概念失败,还是编辑保持失败。
训练系统的价值在于能把失败现象映射回数据、VAE、caption、reward 或蒸馏,而不是只说“模型不够大”。
| 失败现象 | 可能原因 | 对应修复 |
|---|---|---|
| 中文乱码 | OCR caption 不足、text-rich 数据少、VAE 小字不保真。 | OCR-aware caption、synthetic text rendering、OCR reward、VAE OCR retention 评估。 |
| 图好看但不听话 | SFT 审美过强、instruction 数据弱、reward 权重偏审美。 | 增加 prompt-following 数据、属性绑定评估、per-category reward calibration。 |
| 一编辑全图漂移 | 缺 I2I reconstruction、preserve signal 弱、edit pair 差异太大。 | 加 reconstruction、preserve region、identity / background preservation reward。 |
| 人物不像本人 | reference 数据不足、identity reward 弱、VAE 人脸细节损失。 | identity similarity reward、多参考训练、人脸 / 身份切片评估。 |
| 商品形状变了 | product reference 数据少、VAE 边缘和材质保真差。 | product shape consistency 数据、logo / edge preservation 指标。 |
| 小字和 logo 糊 | VAE compression 过强、text-rich VAE 数据不足。 | text-rich VAE training、synthetic rendering、OCR reconstruction metric。 |
| 8 步模型变单调 | distillation pressure 过强、多样性保留不足。 | diversity reserve、teacher trajectory mix、质量-速度 Pareto 评估。 |
| reward hacking | 奖励模型漏洞、单一 reward 过强。 | reward ensemble、range filtering、人工抽检、adversarial prompts。 |
| 长尾遗忘 | SFT 数据过窄、rarity resampling 不足。 | tagged resampling、rarity score、target prior、长尾 benchmark。 |
| 复杂排版乱 | layout 数据不足、caption 没有结构化描述。 | layout-aware caption、PPT / poster / infographic 数据、layout correctness reward。 |
过去 prompt 像许愿;现在 prompt 更像程序。未来最强的图像模型,不一定只是最会画图的模型,而是最会把人类意图编译成稳定视觉结果的系统。
调节奖励强度、蒸馏步数和保留多样性的权重,观察 alignment、speed、diversity 和 artifact risk 的相互牵制。
trade-off ready
| Slider | 调高后可能提升 | 可能副作用 | 应该看什么指标 |
|---|---|---|---|
| reward strength | prompt adherence、审美、人像保真、文字正确性。 | reward hacking、过饱和、模式收缩。 | human preference、artifact rate、reward disagreement、diversity。 |
| distillation pressure | 推理速度、低 NFE 质量。 | 多样性下降、复杂 prompt 遵守下降、细节损失。 | quality-latency Pareto、NFE、diversity、hard prompt success。 |
| diversity reserve | 风格多样性、长尾覆盖。 | 平均审美或一致性可能下降。 | CLIP diversity、style coverage、long-tail success、human preference。 |
后训练的关键不是把所有 slider 拉满,而是在 alignment、speed、diversity 和 artifact risk 之间找到产品所需的 Pareto 点。
Ablation 思考:few-step distillation 为什么会伤多样性?
- teacher steps 太少:老师轨迹本身不够稳定,student 学到的是捷径和伪影。
- student steps 太少:复杂 prompt、局部文字和细节修正缺少迭代空间。
- 强依赖 CFG teacher 但 student no-CFG:条件引导分布可能不匹配。
- 不保留多样性样本:student 更容易学到高平均分但单调的模式。
验证方式:quality-latency Pareto、NFE、hard prompt success、CLIP diversity、style coverage 和人工偏好切片。
Z-Image 式动态数据基础设施 + Qwen-Image 式文字/OCR/编辑专项数据 + FLUX.2 式多参考图和生产工作流 + Qwen/Z-Image 式 RLHF、GRPO、OPD、few-step distillation。
工业闭源数据 + 大模型 + flow matching + 多参考图 + 生产级工作流。
文字/OCR/中文/排版专项数据 + VLM 条件编码 + I2I reconstruction + RLHF。
数据效率最大化 + 单流小模型 + 动态采样 + 多粒度 caption + prompt enhancer + RL/蒸馏。
如果只看架构,它们都属于 latent DiT / flow / MMDiT 这条大路线;真正拉开差距的是数据工程、后训练和生产工作流。
后续最值得系统研究的问题包括 VAE 的文字与细节保真、OCR reward 的鲁棒性、多参考一致性、few-step distillation 的多样性损失、以及图像 RL reward hacking 的诊断与约束。
现代图像生成的主线,已经不是简单的“prompt 变 image”,而是:
用户意图
-> 结构化视觉规格
-> 多模态生成模型
-> VLM / reward 评估
-> 自动修正
-> 可交付视觉资产
如果只看架构,FLUX、Qwen-Image 和 Z-Image 都属于 latent DiT / flow / MMDiT 这条大路线;真正拉开差距的是数据工程、caption 表达、VAE 接口、后训练奖励、蒸馏目标和生产工作流。
FLUX 告诉我们,生产级模型要服务多参考、一致性、品牌和部署分层;Qwen-Image 告诉我们,文字、中文和图文设计必须被当成核心任务,而不是附加能力;Z-Image 告诉我们,公开、高效、可复现的训练 recipe 可以用数据效率逼近更大模型的体验。
未来最值得研究的,不只是更大的 backbone,而是更可控的数据系统、更可靠的 VAE、更抗 reward hacking 的图像 RL、更少步但不塌缩的蒸馏,以及能把人类意图稳定编译成视觉资产的工作流。
本页优先使用官方页面、模型卡、技术报告和基础论文;对未公开训练配方保留未知。