### [九成训练样本没有文字,LLaDA-Image却冲上开源文生图第一:AI作画要先学会看?](https://www.zuoshipin.com/article/34028) **Published:** 2026-09-08T03:55:47 **Author:** 天才交易员 **Excerpt:** LLaDA-Image以6B DiT统一文生图与指令编辑,超过90%的累计生成训练样本采用纯图片监督,Base… **先用纯图片建立视觉先验,再用图文对补语言理解:这条“先学会画,再学会听话”的路线,可能改写开源图像模型的数据逻辑。** **先说预测:**下一轮开源文生图竞争,决定上限的未必是谁拥有更多图文对,而是谁能**把海量“只有图片、没有好标题”的视觉数据真正训练起来**。LLaDA-Image最值得关注的地方,正是它把图文配对从预训练的“入场券”,变成后期语言对齐工具。 这听起来像一句口号:**先学会画,再学会听话。**但背后是一套完整工程路线。Inclusion AI从零训练了6B参数DiT,在预训练和中期训练阶段主要让图片自己提供条件信号;累计约2.2亿次生成训练样本处理中,超过90%为纯图片监督。图文对被集中放到后续SFT,用于把自然语言接入已经形成的视觉空间。 [![LLaDA-Image技术报告首页](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-01.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-01.webp) LLaDA-Image技术报告首页。点击查看大图。 ## 成绩确实醒目,但先把口径说清楚 按照团队技术报告,LLaDA-Image在Qwen-Image-Bench上的英文、中文总分分别达到**53.53和53.38**,在报告列出的开源模型中位居第一;4步Turbo版则为50.98和50.27。 [![Qwen-Image-Bench中英文综合成绩,数据来自模型团队技术报告](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-02.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-02.webp) Qwen-Image-Bench中英文综合成绩,数据来自模型团队技术报告。点击查看大图。 把开源与闭源模型放在同一表格时,Base版成绩位于GPT Image 1与Imagen 4 Ultra之间;相比报告中的第二名开源模型Z-Image-Turbo,英文领先1.87分、中文领先0.67分。 **需要强调:**这些数字来自模型团队技术报告,并非第三方独立盲测。它们能说明模型具有竞争力,但不能直接等同于“所有提示词、所有工作流都领先”。 [![人物、动物、食物与风景等LLaDA-Image生成样例](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-03.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-03.webp) 人物、动物、食物与风景等LLaDA-Image生成样例。点击查看大图。 从定性样例看,真实人物、动物、食物、街景和风景的质感已经相当成熟;切换到海报、艺术字和中英文排版时,它也能覆盖更偏商业设计的任务。 [![海报、中英文文字渲染与设计类生成样例](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-04.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-04.webp) 海报、中英文文字渲染与设计类生成样例。点击查看大图。 ## 九成样本没有文字,它到底怎样学习? 传统文生图通常从训练早期就要求图片配文字描述。问题是,高质量caption并不便宜:需要补全物体、属性、关系、风格和图中文字,还要过滤幻觉与错配。LLaDA-Image选择把视觉学习和语言学习拆开。 [![从纯图像预训练到Turbo蒸馏的六阶段训练流程](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-05.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-05.webp) 从纯图像预训练到Turbo蒸馏的六阶段训练流程。点击查看大图。 整个路线分为六步:先做256像素纯图片预训练,再用约512像素和多宽高比图片中期训练;随后引入图文对做语言对齐与分辨率迁移;再进行定向增强、生成与编辑1:1联合训练,最后蒸馏得到2至4步Turbo。 [![纯图像预训练与中期训练阶段的分辨率和裁剪策略说明](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-06.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-06.webp) 纯图像预训练与中期训练阶段的分辨率和裁剪策略说明。点击查看大图。 纯图像阶段的关键叫**图像自条件**。冻结的SigLIP-VQ先把训练图变成视觉token,随机遮掉一部分;保留下来的线索经过冻结的多模态理解骨干,再交给生成器恢复完整VAE潜变量。也就是说,同一张图片同时提供“题目”和“答案”。 - **条件天然对齐:**局部线索和目标来自同一裁剪区域。 - **必须理解上下文:**随机遮挡迫使模型推断物体结构和关系。 - **视觉信息损失更少:**材质、光影和小物体不必先被文字概括。 - **昂贵配对数据后置:**高质量caption集中用于语言对齐,而不是消耗在最大规模阶段。 [![技术报告给出的SFT加权数据分布估计](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-07.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-07.webp) 技术报告给出的SFT加权数据分布估计。点击查看大图。 进入SFT后,报告称团队使用Qwen3.6-35B-A3B和Qwen3-VL-235B-A22B-Instruct生成描述,并检查物体、属性、关系与OCR内容。这里的约2.2亿是各生成阶段的**累计样本处理量**,不代表2.2亿张完全不同的图片。 ## 全扩散架构:理解和生成都走Diffusion [![LLaDA-Image统一生成与编辑架构](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-08.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-08.webp) LLaDA-Image统一生成与编辑架构。点击查看大图。 生成侧是从零训练的6B单流DiT;理解侧使用LLaDA2.0-mini,它是16B总参数、约1B激活参数的MoE扩散语言模型。两者之间由两层桥梁连接: - **RQA:**用可学习查询提取与生成最相关的信息。 - **Transformer Connector:**把理解模型隐藏状态转换为DiT可使用的条件。 - **单流DiT:**让文本条件、时间信息和图像token在同一Transformer里直接交互,并预测Flow Matching速度场。 编辑任务则让参考图绕过语言模型:SigLIP-VQ提供“图里是什么”的高层语义,干净的FLUX2-VAE潜变量保留身份、结构、纹理和背景。编辑指令仍走语言理解路径,最后共同进入同一DiT,因此一套权重可以同时做开放生成和参考图修改。 ## 四组编辑对照,看看它能不能真正“听话” **第一组是风格转换:**把真实照片改成动画插画,同时尽量保留人物姿态和手中的鱼形装饰。 [![风格编辑输入图:女孩手持鱼形装饰](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-09.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-09.webp) 风格编辑输入图:女孩手持鱼形装饰。点击查看大图。 [![风格编辑结果:转换为动画插画风格](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-10.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-10.webp) 风格编辑结果:转换为动画插画风格。点击查看大图。 **第二组是海报文字替换:**将“Stay fresh”改成“Keep fresh”,画面构图和字体层级基本保持。 [![文字编辑输入图:Stay fresh饮品海报](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-11.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-11.webp) 文字编辑输入图:Stay fresh饮品海报。点击查看大图。 [![文字编辑结果:将Stay改为Keep并保留版式](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-12.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-12.webp) 文字编辑结果:将Stay改为Keep并保留版式。点击查看大图。 **第三组是物体移除:**删除人物背后的红色包,尽量不破坏衣服、湖面和树枝。 [![物体移除输入图:湖边人物背有红色包](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-13.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-13.webp) 物体移除输入图:湖边人物背有红色包。点击查看大图。 [![物体移除结果:红色包被删除,主体和背景基本保留](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-14.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-14.webp) 物体移除结果:红色包被删除,主体和背景基本保留。点击查看大图。 **第四组是线稿上色:**按照指令赋予人物肤色、黑发与棕色小熊。 [![上色任务输入图:女孩与小熊的黑白线稿](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-15.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-15.webp) 上色任务输入图:女孩与小熊的黑白线稿。点击查看大图。 [![上色结果:按指令为人物、头发和小熊着色](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-16.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-16.webp) 上色结果:按指令为人物、头发和小熊着色。点击查看大图。 这些样例说明统一模型路线具有实用潜力,但视觉从业者仍应检查边缘重建、人物身份、排版拼写和局部纹理。展示图是精心选择的案例,不能替代自己的批量测试。 ## 从50步压到4步,Turbo不是简单“少跑几次” [![渐进式训练计划与后期时间步采样调整](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-17.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-17.webp) 渐进式训练计划与后期时间步采样调整。点击查看大图。 长程训练中,团队采用无可学习仿射参数的RMSNorm,试图控制深层网络的尺度漂移和后期梯度范数上升;生成阶段使用Muon优化器,临近收敛还会平均相邻检查点,以减少不同mini-batch带来的指标波动。 [![TwinFlow用共享DiT承担生成器与fake-score估计角色](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-18.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-18.webp) TwinFlow用共享DiT承担生成器与fake-score估计角色。点击查看大图。 Turbo使用Twin-DMD蒸馏。它让同一个DiT共享主干,分别承担生成器和跟踪学生分布的fake-score角色,并用不同输出头训练;推理时只留下生成头,因此能把Base推荐的50步压缩到2至4步,官方当前推荐4步。 ## 除了综合分,它还有哪些强项和短板? [![Qwen-Image-Bench部分模型对比,数据来自团队技术报告](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-19.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-19.webp) Qwen-Image-Bench部分模型对比,数据来自团队技术报告。点击查看大图。 | 项目 | 技术报告结果 | 怎么理解 | | --- | --- | --- | | LongText-Bench | 英文0.923,中文0.913 | 双语长文字生成是明显卖点 | | CVTG-2K | 单词准确率0.875,NED 0.945 | 适合海报测试,但成片仍要校字 | | GEdit-Bench | 英文7.336,中文7.294 | 统一编辑能力具有竞争力 | | GenEval | 总分0.85;计数0.53 | 单、双物体较强,数量控制仍是短板 | | DPG-Bench | 87.48 | 复杂提示词遵循表现较好 | ## 开放到什么程度?原文最需要纠正的一点 [![原资料对开放范围的概括;训练代码目前仍未在官方仓库发布](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-20.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/llada-image-29079-image-20.webp) 原资料对开放范围的概括;训练代码目前仍未在官方仓库发布。点击查看大图。 **截至2026年9月8日,官方仓库并没有发布训练代码。**目前已经开放的是Base、Turbo以及对应FP8模型权重,还有基于Diffusers的推理代码;仓库的Open Source Plan仍把Training code标记为“coming soon”。模型页面当前标注Apache-2.0许可。 因此,更准确的说法是:**论文公开了较完整的训练配方,权重和推理代码已经可用,但训练代码尚待发布。**“Fully Open Training Recipes”不能直接翻译成“训练代码已经全开”。 ## 怎么在本地跑?Base和Turbo这样选 1. **准备环境:**官方仓库说明使用Python 3.11、PyTorch 2.8、Transformers 4.57.6和Diffusers 0.39.0。 2. **选择版本:**做最终画质、文字和编辑测试选Base;快速构图、批量预览优先Turbo;显存紧张再考虑FP8。 3. **文生图:**设置generation\_mode为text,Base推荐50步、guidance scale 5.0;Turbo推荐4步、guidance scale 1.0。 4. **参考图编辑:**加入输入图片并切换editing模式;图像尺寸需能被32整除,纯文生图与VQ模式尺寸需能被16整除。 5. **固定复现:**保留提示词、负面提示词、种子、画幅、步数和权重版本,方便后期团队复盘。 **硬件提醒:**6B DiT只是核心生成主干,完整管线还含理解模型、视觉编码器和VAE。官方没有给出适用于所有显卡的单一显存数字,不建议只凭“6B”估算。BF16权重文件体积较大,普通消费级显卡可优先测试FP8、Turbo、CPU卸载或云GPU。 ## 从CG与视觉生产角度,真正值得试的三个场景 - **海报草图与双语版式:**先让模型给出构图、字区和风格方向,文字内容再由设计师在PS、AE或排版软件中精修。 - **参考图的轻量修改:**物体增删、风格变化、线稿上色适合前期提案,涉及人物身份和商业交付时必须逐图检查。 - **本地可控工作流:**开放权重允许团队做私有部署、接口封装与批量生产,比只能使用网页端的闭源模型更容易进入管线。 **我的判断:**LLaDA-Image现在还不足以仅凭一张榜单就“杀穿”所有开源文生图,但它确实提出了一条有冲击力的数据路线。只要后续训练代码如约开放、第三方复现成立,纯图片预训练就可能让大量没有优质caption的视觉数据重新获得价值。 ## 项目、模型与论文地址 **LLaDA-Image站内导航:** [https://www.zuoshipin.com/link/34027.html](https://www.zuoshipin.com/link/34027.html) **GitHub:** [https://github.com/inclusionAI/LLaDA-Image](https://github.com/inclusionAI/LLaDA-Image) **Hugging Face模型合集:** [https://huggingface.co/collections/inclusionAI/llada-image](https://huggingface.co/collections/inclusionAI/llada-image) **ModelScope模型合集:** [https://modelscope.cn/collections/inclusionAI/LLaDA-Image](https://modelscope.cn/collections/inclusionAI/LLaDA-Image) **技术报告:** [https://arxiv.org/abs/2609.03796](https://arxiv.org/abs/2609.03796) **Tags:** AI图像编辑, AI模型训练, LLaDA-Image, 开源文生图, 扩散模型 **Categories:** AI资讯 ---