做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

LLaDA-Image - 纯图片预训练的开源文生图与指令编辑模型

14
6B DiT统一文生图与指令编辑,Base追求质量,Turbo只需2至4步
评分
产品类型:开源文生图与指令图像编辑模型核心架构:6B DiT配合LLaDA2.0-mini扩散语言理解模块模型版本:Base、Turbo、Base FP8、Turbo FP8推荐步数:Base 50步;Turbo 4步主要能力:文生图、VQ条件生成、参考图编辑、中英文文字渲染开放状态:权重与推理代码已开放;训练代码尚未发布适合人群:AI绘画开发者、研究者、视觉设计与内容生产团队
LLaDA-Image是Inclusion AI推出的6B开源图像模型,同一套权重支持文生图、VQ条件生成和指…
AI图片|LLaDA-Image·图像编辑·开源AI绘画·文生图

产品定位

LLaDA-Image是Inclusion AI推出的开源图像生成与编辑模型家族。核心为从零训练的6B参数Diffusion Transformer,同一套模型权重可完成文生图、VQ条件生成和参考图指令编辑,并针对中文、英文文字渲染进行了训练。

主要版本

  • Base:推荐50步采样,侧重完整画质、提示词遵循和编辑质量。
  • Turbo:经Twin-DMD路线蒸馏,推荐4步,也支持2至4步推理,适合更快预览和批量生成。
  • FP8版本:Base与Turbo均提供FP8权重,面向降低模型加载和推理资源占用的场景;实际速度和画质取决于硬件与推理框架。

核心能力

  • 统一生成与编辑:无需为文生图和参考图编辑维护两套独立主干。
  • 双语文字渲染:支持中文和英文海报、标题及多文字区域生成,但复杂长文本仍需人工校对。
  • 图像优先训练:预训练与中期训练主要使用纯图像自条件学习视觉先验,后续再引入图文对完成语言对齐。
  • 快速推理:Turbo版将基础模型的50步压缩到少步生成,适合交互式工作流。

安装与使用

  1. 准备Python 3.11及支持CUDA的PyTorch环境。
  2. 下载项目并安装依赖,首次加载时从模型平台取得对应权重。
  3. 高质量成片选择Base;快速构图和批量预览优先选择Turbo或FP8版本。
  4. 文生图设置文本提示词、画幅、步数与随机种子;编辑模式再提供参考图片和修改指令。
  5. 输出后检查文字、手部、物体数量、身份一致性与版权风险,再进入后期流程。

硬件与部署提醒

6B生成主干之外,完整管线还包含扩散语言理解模块、视觉编码器和VAE,模型文件体积较大。官方示例默认使用CUDA和BF16,但没有把单一显存门槛写成所有设备通用结论。显存有限时可优先尝试FP8权重、Turbo版、CPU卸载或云端GPU,并以官方最新说明为准。

开放范围

官方仓库当前已发布Base、Turbo及FP8权重和基于Diffusers的推理代码,模型页标注Apache-2.0许可。技术报告公开了训练阶段、数据配方、统一编辑与蒸馏方法,但训练代码仍在官方开源计划中标注为即将开放,并非已经发布。

适合人群

适合研究开源图像模型、搭建本地文生图服务、开发海报与电商视觉工具、测试中文文字生成,以及需要把图像生成和编辑统一到一条工作流中的开发者与视觉团队。

局限与注意事项

技术报告中的榜单由模型团队提供,不能替代独立盲测。模型在计数、复杂空间关系、长文本稳定性和原生2K输出方面仍有提升空间。商用前还应确认模型许可、训练数据风险、人物肖像和生成内容的版权合规。

常见问题(FAQ)

LLaDA-Image是什么?
它是Inclusion AI推出的开源图像生成与编辑模型家族,核心为6B DiT,同一套权重支持文生图、VQ条件生成和参考图指令编辑。
Base和Turbo有什么区别?
Base推荐50步,更重视完整质量;Turbo经蒸馏后推荐4步,适合快速预览和批量生成。两者都提供BF16和FP8版本。
LLaDA-Image能生成中文吗?
可以,模型针对中英文文字渲染进行了训练,能生成海报和多文字区域,但复杂长文本仍应人工校对。
LLaDA-Image训练代码已经开源了吗?
截至2026年9月8日,官方仓库已开放权重和推理代码,训练代码仍在开源计划中标注为即将开放。
本地运行需要多少显存?
官方示例使用CUDA和BF16,但未给出适用于所有配置的单一显存数字。显存有限时可尝试FP8、Turbo、CPU卸载或云端GPU。
0 讨论
热门最新
总结
暂无总结
0 / 600
细中粗

相关网站

热门最新

Seedream 5.0 Pro – 字节跳动多模态AI图像生成与精准编辑模型

从整图生成走向区域级修改,让AI更接近真实设计工作流

推荐!面向设计生产的多模态AI图像模型,支持高密度信息图、圈选与箭头精准改图、图层分离、多图融合、真实摄影质感…

0

Boogu – 开源图像生成与编辑基础模型

开源统一图像生成与编辑基础模型,适合关注多模态生成能力的开发者。

面向图像生成与编辑场景的开源基础模型,适合关注多模态生成能力的开发者和研究者。

0

LiblibAI – 模型下载训练和在线创作都方便的 AI 绘画平台

推荐给做 AI 绘画和视觉探索的创作者:LiblibAI 把模型下载、WebUI、ComfyUI、LoRA 训练和灵感作品放在一个中文平台里,新手也更容易上手。

LiblibAI(哩布哩布AI)是面向中文创作者的 AI 绘画与模型社区,提供模型资源下载、在线 WebUI/…

0

Tripo AI – 从文字或图片快速生成可编辑3D模型

先生成角色与生物资产,再导入Blender细修、绑定和制作动画

Tripo AI是一款文字与图片生成3D模型平台,支持高细节模型、AI贴图、智能分割和自动绑定,可把生成结果导…

0

ModLens – 给纯文本 DeepSeek 补上一双眼睛,截图、OCR、布局和语义一次解析

推荐!给纯文本 DeepSeek 补上一双眼睛,截图、OCR、布局和语义一次解析

为纯文本模型接入外部视觉模型,把截图解析为包含 OCR、布局和语义的结构化信息,让 DeepSeek Harn…

0

GLM-5.3-Flash – 智谱原生多模态开源大模型

以18B激活参数提供前沿级编程、Agent与视觉能力

推荐!GLM-5系列首个原生多模态模型,320B总参数、18B激活参数,支持视觉编码、Agent、专业办公与长…

0

Photography Scene Design Skill – 给AI生图装上真实相机与镜头语言的摄影参数专家

推荐!把真实器材参数和53套摄影配方交给AI,让人像、产品与场景图更有镜头依据

推荐!把相机、镜头、焦距、光圈、色温与布光角度变成可复用的生图提示词,让AI画面从泛泛的风格词进阶到更有依据的…

0

SenseNova U1.5 – 开源4K图像生成、编辑与复杂排版模型

一个模型统一完成理解、生成、编辑与复杂视觉排版

SenseNova U1.5 是商汤开源的原生统一多模态模型,支持图像生成、编辑、视觉理解、复杂中英文排版、多…

0

DeepSeek-V4-Flash-Vision-Exp – 开源多模态视觉Agent模型

让V4-Flash真正看懂图片、截图与图表

DeepSeek实验性多模态模型,支持图文混合输入、截图与图表理解、工具调用和视觉Agent任务,并开放Hug…

0

coll_ai-video-generation – 图片、视频与音乐热门Agent Skill

来自prime-skills/runcomfy-agent-skills,附可直接复制的安装命令与使用提醒

它可以调用多类模型生成 AI 视频,更偏创意镜头和视觉短片。想根据不同画面需求切换模型路线时,会更灵活。

0
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1