暂无菜单项

九成训练样本没有文字,LLaDA-Image却冲上开源文生图第一:AI作画要先学会看?

发布于
17

先用纯图片建立视觉先验,再用图文对补语言理解:这条“先学会画,再学会听话”的路线,可能改写开源图像模型的数据逻辑。

先说预测:下一轮开源文生图竞争,决定上限的未必是谁拥有更多图文对,而是谁能把海量“只有图片、没有好标题”的视觉数据真正训练起来。LLaDA-Image最值得关注的地方,正是它把图文配对从预训练的“入场券”,变成后期语言对齐工具。

这听起来像一句口号:先学会画,再学会听话。但背后是一套完整工程路线。Inclusion AI从零训练了6B参数DiT,在预训练和中期训练阶段主要让图片自己提供条件信号;累计约2.2亿次生成训练样本处理中,超过90%为纯图片监督。图文对被集中放到后续SFT,用于把自然语言接入已经形成的视觉空间。

LLaDA-Image技术报告首页
LLaDA-Image技术报告首页。点击查看大图。

成绩确实醒目,但先把口径说清楚

按照团队技术报告,LLaDA-Image在Qwen-Image-Bench上的英文、中文总分分别达到53.53和53.38,在报告列出的开源模型中位居第一;4步Turbo版则为50.98和50.27。

Qwen-Image-Bench中英文综合成绩,数据来自模型团队技术报告
Qwen-Image-Bench中英文综合成绩,数据来自模型团队技术报告。点击查看大图。

把开源与闭源模型放在同一表格时,Base版成绩位于GPT Image 1与Imagen 4 Ultra之间;相比报告中的第二名开源模型Z-Image-Turbo,英文领先1.87分、中文领先0.67分。

需要强调:这些数字来自模型团队技术报告,并非第三方独立盲测。它们能说明模型具有竞争力,但不能直接等同于“所有提示词、所有工作流都领先”。

人物、动物、食物与风景等LLaDA-Image生成样例
人物、动物、食物与风景等LLaDA-Image生成样例。点击查看大图。

从定性样例看,真实人物、动物、食物、街景和风景的质感已经相当成熟;切换到海报、艺术字和中英文排版时,它也能覆盖更偏商业设计的任务。

海报、中英文文字渲染与设计类生成样例
海报、中英文文字渲染与设计类生成样例。点击查看大图。

九成样本没有文字,它到底怎样学习?

传统文生图通常从训练早期就要求图片配文字描述。问题是,高质量caption并不便宜:需要补全物体、属性、关系、风格和图中文字,还要过滤幻觉与错配。LLaDA-Image选择把视觉学习和语言学习拆开。

从纯图像预训练到Turbo蒸馏的六阶段训练流程
从纯图像预训练到Turbo蒸馏的六阶段训练流程。点击查看大图。

整个路线分为六步:先做256像素纯图片预训练,再用约512像素和多宽高比图片中期训练;随后引入图文对做语言对齐与分辨率迁移;再进行定向增强、生成与编辑1:1联合训练,最后蒸馏得到2至4步Turbo。

纯图像预训练与中期训练阶段的分辨率和裁剪策略说明
纯图像预训练与中期训练阶段的分辨率和裁剪策略说明。点击查看大图。

纯图像阶段的关键叫图像自条件。冻结的SigLIP-VQ先把训练图变成视觉token,随机遮掉一部分;保留下来的线索经过冻结的多模态理解骨干,再交给生成器恢复完整VAE潜变量。也就是说,同一张图片同时提供“题目”和“答案”。

  • 条件天然对齐:局部线索和目标来自同一裁剪区域。
  • 必须理解上下文:随机遮挡迫使模型推断物体结构和关系。
  • 视觉信息损失更少:材质、光影和小物体不必先被文字概括。
  • 昂贵配对数据后置:高质量caption集中用于语言对齐,而不是消耗在最大规模阶段。
技术报告给出的SFT加权数据分布估计
技术报告给出的SFT加权数据分布估计。点击查看大图。

进入SFT后,报告称团队使用Qwen3.6-35B-A3B和Qwen3-VL-235B-A22B-Instruct生成描述,并检查物体、属性、关系与OCR内容。这里的约2.2亿是各生成阶段的累计样本处理量,不代表2.2亿张完全不同的图片。

全扩散架构:理解和生成都走Diffusion

LLaDA-Image统一生成与编辑架构
LLaDA-Image统一生成与编辑架构。点击查看大图。

生成侧是从零训练的6B单流DiT;理解侧使用LLaDA2.0-mini,它是16B总参数、约1B激活参数的MoE扩散语言模型。两者之间由两层桥梁连接:

  • RQA:用可学习查询提取与生成最相关的信息。
  • Transformer Connector:把理解模型隐藏状态转换为DiT可使用的条件。
  • 单流DiT:让文本条件、时间信息和图像token在同一Transformer里直接交互,并预测Flow Matching速度场。

编辑任务则让参考图绕过语言模型:SigLIP-VQ提供“图里是什么”的高层语义,干净的FLUX2-VAE潜变量保留身份、结构、纹理和背景。编辑指令仍走语言理解路径,最后共同进入同一DiT,因此一套权重可以同时做开放生成和参考图修改。

四组编辑对照,看看它能不能真正“听话”

第一组是风格转换:把真实照片改成动画插画,同时尽量保留人物姿态和手中的鱼形装饰。

风格编辑输入图:女孩手持鱼形装饰
风格编辑输入图:女孩手持鱼形装饰。点击查看大图。
风格编辑结果:转换为动画插画风格
风格编辑结果:转换为动画插画风格。点击查看大图。

第二组是海报文字替换:将“Stay fresh”改成“Keep fresh”,画面构图和字体层级基本保持。

文字编辑输入图:Stay fresh饮品海报
文字编辑输入图:Stay fresh饮品海报。点击查看大图。
文字编辑结果:将Stay改为Keep并保留版式
文字编辑结果:将Stay改为Keep并保留版式。点击查看大图。

第三组是物体移除:删除人物背后的红色包,尽量不破坏衣服、湖面和树枝。

物体移除输入图:湖边人物背有红色包
物体移除输入图:湖边人物背有红色包。点击查看大图。
物体移除结果:红色包被删除,主体和背景基本保留
物体移除结果:红色包被删除,主体和背景基本保留。点击查看大图。

第四组是线稿上色:按照指令赋予人物肤色、黑发与棕色小熊。

上色任务输入图:女孩与小熊的黑白线稿
上色任务输入图:女孩与小熊的黑白线稿。点击查看大图。
上色结果:按指令为人物、头发和小熊着色
上色结果:按指令为人物、头发和小熊着色。点击查看大图。

这些样例说明统一模型路线具有实用潜力,但视觉从业者仍应检查边缘重建、人物身份、排版拼写和局部纹理。展示图是精心选择的案例,不能替代自己的批量测试。

从50步压到4步,Turbo不是简单“少跑几次”

渐进式训练计划与后期时间步采样调整
渐进式训练计划与后期时间步采样调整。点击查看大图。

长程训练中,团队采用无可学习仿射参数的RMSNorm,试图控制深层网络的尺度漂移和后期梯度范数上升;生成阶段使用Muon优化器,临近收敛还会平均相邻检查点,以减少不同mini-batch带来的指标波动。

TwinFlow用共享DiT承担生成器与fake-score估计角色
TwinFlow用共享DiT承担生成器与fake-score估计角色。点击查看大图。

Turbo使用Twin-DMD蒸馏。它让同一个DiT共享主干,分别承担生成器和跟踪学生分布的fake-score角色,并用不同输出头训练;推理时只留下生成头,因此能把Base推荐的50步压缩到2至4步,官方当前推荐4步。

除了综合分,它还有哪些强项和短板?

Qwen-Image-Bench部分模型对比,数据来自团队技术报告
Qwen-Image-Bench部分模型对比,数据来自团队技术报告。点击查看大图。
项目 技术报告结果 怎么理解
LongText-Bench 英文0.923,中文0.913 双语长文字生成是明显卖点
CVTG-2K 单词准确率0.875,NED 0.945 适合海报测试,但成片仍要校字
GEdit-Bench 英文7.336,中文7.294 统一编辑能力具有竞争力
GenEval 总分0.85;计数0.53 单、双物体较强,数量控制仍是短板
DPG-Bench 87.48 复杂提示词遵循表现较好

开放到什么程度?原文最需要纠正的一点

原资料对开放范围的概括;训练代码目前仍未在官方仓库发布
原资料对开放范围的概括;训练代码目前仍未在官方仓库发布。点击查看大图。

截至2026年9月8日,官方仓库并没有发布训练代码。目前已经开放的是Base、Turbo以及对应FP8模型权重,还有基于Diffusers的推理代码;仓库的Open Source Plan仍把Training code标记为“coming soon”。模型页面当前标注Apache-2.0许可。

因此,更准确的说法是:论文公开了较完整的训练配方,权重和推理代码已经可用,但训练代码尚待发布。“Fully Open Training Recipes”不能直接翻译成“训练代码已经全开”。

怎么在本地跑?Base和Turbo这样选

  1. 准备环境:官方仓库说明使用Python 3.11、PyTorch 2.8、Transformers 4.57.6和Diffusers 0.39.0。
  2. 选择版本:做最终画质、文字和编辑测试选Base;快速构图、批量预览优先Turbo;显存紧张再考虑FP8。
  3. 文生图:设置generation_mode为text,Base推荐50步、guidance scale 5.0;Turbo推荐4步、guidance scale 1.0。
  4. 参考图编辑:加入输入图片并切换editing模式;图像尺寸需能被32整除,纯文生图与VQ模式尺寸需能被16整除。
  5. 固定复现:保留提示词、负面提示词、种子、画幅、步数和权重版本,方便后期团队复盘。

硬件提醒:6B DiT只是核心生成主干,完整管线还含理解模型、视觉编码器和VAE。官方没有给出适用于所有显卡的单一显存数字,不建议只凭“6B”估算。BF16权重文件体积较大,普通消费级显卡可优先测试FP8、Turbo、CPU卸载或云GPU。

从CG与视觉生产角度,真正值得试的三个场景

  • 海报草图与双语版式:先让模型给出构图、字区和风格方向,文字内容再由设计师在PS、AE或排版软件中精修。
  • 参考图的轻量修改:物体增删、风格变化、线稿上色适合前期提案,涉及人物身份和商业交付时必须逐图检查。
  • 本地可控工作流:开放权重允许团队做私有部署、接口封装与批量生产,比只能使用网页端的闭源模型更容易进入管线。

我的判断:LLaDA-Image现在还不足以仅凭一张榜单就“杀穿”所有开源文生图,但它确实提出了一条有冲击力的数据路线。只要后续训练代码如约开放、第三方复现成立,纯图片预训练就可能让大量没有优质caption的视觉数据重新获得价值。

项目、模型与论文地址

LLaDA-Image站内导航:
https://www.zuoshipin.com/link/34027.html

GitHub:
https://github.com/inclusionAI/LLaDA-Image

Hugging Face模型合集:
https://huggingface.co/collections/inclusionAI/llada-image

ModelScope模型合集:
https://modelscope.cn/collections/inclusionAI/LLaDA-Image

技术报告:
https://arxiv.org/abs/2609.03796

常见问题(FAQ)

LLaDA-Image最大的创新是什么?
它在预训练和中期训练阶段主要通过图像自条件学习视觉先验,超过90%的累计生成训练样本不依赖文字配对,后续再用图文对完成语言对齐。
LLaDA-Image真的超过所有开源文生图模型了吗?
技术报告显示它在Qwen-Image-Bench列出的开源模型中取得中英文第一,但这是团队报告口径,仍需更多第三方盲测验证不同场景下的表现。
LLaDA-Image Base和Turbo该怎么选?
Base推荐50步,适合最终画质与编辑质量;Turbo推荐4步,适合快速预览和批量生成。显存有限还可测试对应FP8权重。
LLaDA-Image训练代码已经开源了吗?
截至2026年9月8日,权重和推理代码已发布,论文提供训练配方,但官方仓库仍将训练代码标记为即将开放。
LLaDA-Image适合直接制作商业海报吗?
它适合生成构图、视觉风格与文字区域草案,但中文长文本、拼写、人物细节和版权仍需人工复核,正式成片建议在专业软件中精修。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材