产品定位
LLaDA-Image是Inclusion AI推出的开源图像生成与编辑模型家族。核心为从零训练的6B参数Diffusion Transformer,同一套模型权重可完成文生图、VQ条件生成和参考图指令编辑,并针对中文、英文文字渲染进行了训练。
主要版本
- Base:推荐50步采样,侧重完整画质、提示词遵循和编辑质量。
- Turbo:经Twin-DMD路线蒸馏,推荐4步,也支持2至4步推理,适合更快预览和批量生成。
- FP8版本:Base与Turbo均提供FP8权重,面向降低模型加载和推理资源占用的场景;实际速度和画质取决于硬件与推理框架。
核心能力
- 统一生成与编辑:无需为文生图和参考图编辑维护两套独立主干。
- 双语文字渲染:支持中文和英文海报、标题及多文字区域生成,但复杂长文本仍需人工校对。
- 图像优先训练:预训练与中期训练主要使用纯图像自条件学习视觉先验,后续再引入图文对完成语言对齐。
- 快速推理:Turbo版将基础模型的50步压缩到少步生成,适合交互式工作流。
安装与使用
- 准备Python 3.11及支持CUDA的PyTorch环境。
- 下载项目并安装依赖,首次加载时从模型平台取得对应权重。
- 高质量成片选择Base;快速构图和批量预览优先选择Turbo或FP8版本。
- 文生图设置文本提示词、画幅、步数与随机种子;编辑模式再提供参考图片和修改指令。
- 输出后检查文字、手部、物体数量、身份一致性与版权风险,再进入后期流程。
硬件与部署提醒
6B生成主干之外,完整管线还包含扩散语言理解模块、视觉编码器和VAE,模型文件体积较大。官方示例默认使用CUDA和BF16,但没有把单一显存门槛写成所有设备通用结论。显存有限时可优先尝试FP8权重、Turbo版、CPU卸载或云端GPU,并以官方最新说明为准。
开放范围
官方仓库当前已发布Base、Turbo及FP8权重和基于Diffusers的推理代码,模型页标注Apache-2.0许可。技术报告公开了训练阶段、数据配方、统一编辑与蒸馏方法,但训练代码仍在官方开源计划中标注为即将开放,并非已经发布。
适合人群
适合研究开源图像模型、搭建本地文生图服务、开发海报与电商视觉工具、测试中文文字生成,以及需要把图像生成和编辑统一到一条工作流中的开发者与视觉团队。
局限与注意事项
技术报告中的榜单由模型团队提供,不能替代独立盲测。模型在计数、复杂空间关系、长文本稳定性和原生2K输出方面仍有提升空间。商用前还应确认模型许可、训练数据风险、人物肖像和生成内容的版权合规。



