先用纯图片建立视觉先验,再用图文对补语言理解:这条“先学会画,再学会听话”的路线,可能改写开源图像模型的数据逻辑。
先说预测:下一轮开源文生图竞争,决定上限的未必是谁拥有更多图文对,而是谁能把海量“只有图片、没有好标题”的视觉数据真正训练起来。LLaDA-Image最值得关注的地方,正是它把图文配对从预训练的“入场券”,变成后期语言对齐工具。
这听起来像一句口号:先学会画,再学会听话。但背后是一套完整工程路线。Inclusion AI从零训练了6B参数DiT,在预训练和中期训练阶段主要让图片自己提供条件信号;累计约2.2亿次生成训练样本处理中,超过90%为纯图片监督。图文对被集中放到后续SFT,用于把自然语言接入已经形成的视觉空间。

成绩确实醒目,但先把口径说清楚
按照团队技术报告,LLaDA-Image在Qwen-Image-Bench上的英文、中文总分分别达到53.53和53.38,在报告列出的开源模型中位居第一;4步Turbo版则为50.98和50.27。

把开源与闭源模型放在同一表格时,Base版成绩位于GPT Image 1与Imagen 4 Ultra之间;相比报告中的第二名开源模型Z-Image-Turbo,英文领先1.87分、中文领先0.67分。
需要强调:这些数字来自模型团队技术报告,并非第三方独立盲测。它们能说明模型具有竞争力,但不能直接等同于“所有提示词、所有工作流都领先”。

从定性样例看,真实人物、动物、食物、街景和风景的质感已经相当成熟;切换到海报、艺术字和中英文排版时,它也能覆盖更偏商业设计的任务。

九成样本没有文字,它到底怎样学习?
传统文生图通常从训练早期就要求图片配文字描述。问题是,高质量caption并不便宜:需要补全物体、属性、关系、风格和图中文字,还要过滤幻觉与错配。LLaDA-Image选择把视觉学习和语言学习拆开。

整个路线分为六步:先做256像素纯图片预训练,再用约512像素和多宽高比图片中期训练;随后引入图文对做语言对齐与分辨率迁移;再进行定向增强、生成与编辑1:1联合训练,最后蒸馏得到2至4步Turbo。

纯图像阶段的关键叫图像自条件。冻结的SigLIP-VQ先把训练图变成视觉token,随机遮掉一部分;保留下来的线索经过冻结的多模态理解骨干,再交给生成器恢复完整VAE潜变量。也就是说,同一张图片同时提供“题目”和“答案”。
- 条件天然对齐:局部线索和目标来自同一裁剪区域。
- 必须理解上下文:随机遮挡迫使模型推断物体结构和关系。
- 视觉信息损失更少:材质、光影和小物体不必先被文字概括。
- 昂贵配对数据后置:高质量caption集中用于语言对齐,而不是消耗在最大规模阶段。

进入SFT后,报告称团队使用Qwen3.6-35B-A3B和Qwen3-VL-235B-A22B-Instruct生成描述,并检查物体、属性、关系与OCR内容。这里的约2.2亿是各生成阶段的累计样本处理量,不代表2.2亿张完全不同的图片。
全扩散架构:理解和生成都走Diffusion

生成侧是从零训练的6B单流DiT;理解侧使用LLaDA2.0-mini,它是16B总参数、约1B激活参数的MoE扩散语言模型。两者之间由两层桥梁连接:
- RQA:用可学习查询提取与生成最相关的信息。
- Transformer Connector:把理解模型隐藏状态转换为DiT可使用的条件。
- 单流DiT:让文本条件、时间信息和图像token在同一Transformer里直接交互,并预测Flow Matching速度场。
编辑任务则让参考图绕过语言模型:SigLIP-VQ提供“图里是什么”的高层语义,干净的FLUX2-VAE潜变量保留身份、结构、纹理和背景。编辑指令仍走语言理解路径,最后共同进入同一DiT,因此一套权重可以同时做开放生成和参考图修改。
四组编辑对照,看看它能不能真正“听话”
第一组是风格转换:把真实照片改成动画插画,同时尽量保留人物姿态和手中的鱼形装饰。


第二组是海报文字替换:将“Stay fresh”改成“Keep fresh”,画面构图和字体层级基本保持。


第三组是物体移除:删除人物背后的红色包,尽量不破坏衣服、湖面和树枝。


第四组是线稿上色:按照指令赋予人物肤色、黑发与棕色小熊。


这些样例说明统一模型路线具有实用潜力,但视觉从业者仍应检查边缘重建、人物身份、排版拼写和局部纹理。展示图是精心选择的案例,不能替代自己的批量测试。
从50步压到4步,Turbo不是简单“少跑几次”

长程训练中,团队采用无可学习仿射参数的RMSNorm,试图控制深层网络的尺度漂移和后期梯度范数上升;生成阶段使用Muon优化器,临近收敛还会平均相邻检查点,以减少不同mini-batch带来的指标波动。

Turbo使用Twin-DMD蒸馏。它让同一个DiT共享主干,分别承担生成器和跟踪学生分布的fake-score角色,并用不同输出头训练;推理时只留下生成头,因此能把Base推荐的50步压缩到2至4步,官方当前推荐4步。
除了综合分,它还有哪些强项和短板?

| 项目 | 技术报告结果 | 怎么理解 |
|---|---|---|
| LongText-Bench | 英文0.923,中文0.913 | 双语长文字生成是明显卖点 |
| CVTG-2K | 单词准确率0.875,NED 0.945 | 适合海报测试,但成片仍要校字 |
| GEdit-Bench | 英文7.336,中文7.294 | 统一编辑能力具有竞争力 |
| GenEval | 总分0.85;计数0.53 | 单、双物体较强,数量控制仍是短板 |
| DPG-Bench | 87.48 | 复杂提示词遵循表现较好 |
开放到什么程度?原文最需要纠正的一点

截至2026年9月8日,官方仓库并没有发布训练代码。目前已经开放的是Base、Turbo以及对应FP8模型权重,还有基于Diffusers的推理代码;仓库的Open Source Plan仍把Training code标记为“coming soon”。模型页面当前标注Apache-2.0许可。
因此,更准确的说法是:论文公开了较完整的训练配方,权重和推理代码已经可用,但训练代码尚待发布。“Fully Open Training Recipes”不能直接翻译成“训练代码已经全开”。
怎么在本地跑?Base和Turbo这样选
- 准备环境:官方仓库说明使用Python 3.11、PyTorch 2.8、Transformers 4.57.6和Diffusers 0.39.0。
- 选择版本:做最终画质、文字和编辑测试选Base;快速构图、批量预览优先Turbo;显存紧张再考虑FP8。
- 文生图:设置generation_mode为text,Base推荐50步、guidance scale 5.0;Turbo推荐4步、guidance scale 1.0。
- 参考图编辑:加入输入图片并切换editing模式;图像尺寸需能被32整除,纯文生图与VQ模式尺寸需能被16整除。
- 固定复现:保留提示词、负面提示词、种子、画幅、步数和权重版本,方便后期团队复盘。
硬件提醒:6B DiT只是核心生成主干,完整管线还含理解模型、视觉编码器和VAE。官方没有给出适用于所有显卡的单一显存数字,不建议只凭“6B”估算。BF16权重文件体积较大,普通消费级显卡可优先测试FP8、Turbo、CPU卸载或云GPU。
从CG与视觉生产角度,真正值得试的三个场景
- 海报草图与双语版式:先让模型给出构图、字区和风格方向,文字内容再由设计师在PS、AE或排版软件中精修。
- 参考图的轻量修改:物体增删、风格变化、线稿上色适合前期提案,涉及人物身份和商业交付时必须逐图检查。
- 本地可控工作流:开放权重允许团队做私有部署、接口封装与批量生产,比只能使用网页端的闭源模型更容易进入管线。
我的判断:LLaDA-Image现在还不足以仅凭一张榜单就“杀穿”所有开源文生图,但它确实提出了一条有冲击力的数据路线。只要后续训练代码如约开放、第三方复现成立,纯图片预训练就可能让大量没有优质caption的视觉数据重新获得价值。
项目、模型与论文地址
LLaDA-Image站内导航:
https://www.zuoshipin.com/link/34027.html
GitHub:
https://github.com/inclusionAI/LLaDA-Image
Hugging Face模型合集:
https://huggingface.co/collections/inclusionAI/llada-image
ModelScope模型合集:
https://modelscope.cn/collections/inclusionAI/LLaDA-Image












