做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
搜索
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

SenseNova U1.5 - 开源4K图像生成、编辑与复杂排版模型

6
一个模型统一完成理解、生成、编辑与复杂视觉排版
评分
工具类型:AI图像生成与编辑模型规模:8B理解 + 8B生成,托管页约18B总规模输出能力:原生4K控制方式:框选、标记、单图与多图参考开源入口:GitHub / Hugging Face
SenseNova U1.5 是商汤开源的原生统一多模态模型,支持图像生成、编辑、视觉理解、复杂中英文排版、多…
AI图片·Github神器

SenseNova U1.5 是商汤开源的原生统一多模态模型,可在同一模型中完成视觉理解、图像生成、原生图像编辑与交错图文生成。正式版重点提升复杂指令遵循、中英文文字、信息图布局、原生 4K、局部保持和多参考图控制。

核心能力

  • 文字生图与原生 4K 高分辨率输出;
  • 单图、多图参考和局部图像编辑;
  • 通过框选、视觉标记和参考图精确指定修改区域;
  • 海报、信息图、品牌素材和中英文密集排版;
  • 视觉问答、图文交错教程和内容理解。

“8B”参数怎么理解?

官方说明,名称中的 8B-MoT 指约 8B 理解参数与约 8B 生成参数;模型托管页显示完整权重规模约 18B。部署前应以模型卡、权重精度和实际显存测试为准,不能简单按“总参数只有 8B”估算。

适合谁使用?

适合需要中文海报、信息图、多参考图合成、局部改字、结构保持和可私有化部署的设计团队与开发者。在线体验方便快速验证,GitHub 与 Hugging Face 权重适合本地测试和二次开发。

使用提醒

不同任务的文字准确率、人物一致性和局部保持仍可能波动。商业使用前应检查开源许可证、第三方素材版权、显存需求和输出内容合规性,并用自己的真实素材做批量测试。

常见问题(FAQ)

SenseNova U1.5 是什么?
它是商汤开源的原生统一多模态模型,可在同一模型中完成视觉理解、图像生成、图像编辑和交错图文生成。
SenseNova U1.5 总参数只有8B吗?
不宜这样理解。官方称8B-MoT包含约8B理解参数与约8B生成参数,模型托管页显示完整权重约18B。
SenseNova U1.5 支持哪些编辑方式?
支持自然语言编辑、框选、视觉标记、单图和多图参考,并强调保持主体身份、结构和未编辑区域。
0 讨论
热门最新
总结
暂无总结
0 / 600
细中粗

相关网站

热门最新

Boogu – 开源图像生成与编辑基础模型

开源统一图像生成与编辑基础模型,适合关注多模态生成能力的开发者。

面向图像生成与编辑场景的开源基础模型,适合关注多模态生成能力的开发者和研究者。

0

ModLens – 给纯文本 DeepSeek 补上一双眼睛,截图、OCR、布局和语义一次解析

推荐!给纯文本 DeepSeek 补上一双眼睛,截图、OCR、布局和语义一次解析

为纯文本模型接入外部视觉模型,把截图解析为包含 OCR、布局和语义的结构化信息,让 DeepSeek Harn…

0

Qwen3.8-27B – 24GB显存可尝试的开源多模态Agent模型

推荐!把前沿Coding与Agent能力压缩到27B尺寸,本地部署和强能力第一次真正靠近

Qwen3.8-27B是27B Dense开源多模态模型,强化Coding、工具调用与长程Agent,4bit…

0

dsh-genui – 让DeepSeek回答直接变成图表、表单和3D界面

推荐!文本答案还在,交互式界面已经同步生成,按钮点击还能继续驱动模型

推荐!让模型在回答中输出dsh-ui描述,浏览器随即渲染卡片、表格、图表、测验、Mermaid和3D场景,并把…

0

dsh-vision-toolkit – 给DeepSeek装上看图、OCR与UI还原工具箱

推荐!一条命令获得免费视觉服务、十类视觉工具与可验证的UI还原工作流

推荐!让DSH中的纯文本模型直接处理图片问答、多图比较、长截图OCR、元素定位、UI还原和像素差异验证。

0

Flova AI – 一站式 AI 视频生成平台,支持多模型与一致性角色

集多模型、一致性角色、AI 配音与剪辑于一体的全栈 AI 视频创作平台

Flova 是一个全栈 AI 视频生成平台,集成 Sora 2、Veo 3.1、Gemini 等多种模型,支持…

0

FrameX Rise – 500ms实时交互的全域沉浸式视频模型

让摄像头中的自然动作直接进入并改变生成世界

Rise 是 FrameX 推出的全域沉浸式视频生成模型,把摄像头动作理解与视频生成统一建模,官方赛车演示端到…

0

ScienceOne 磐石 – 中科院推出的「人工智能+科学」操作系统

中科院「人工智能+科学」开源操作系统,覆盖文献理解、自动推理与 Agent 协议

ScienceOne(磐石)是中国科学院依托科学基础大模型研发的「人工智能+科学」操作系统,面向跨领域前沿科学…

0

Orca – 值得关注的世界模型研究页,适合看 AI 往哪儿走的人

北京智源团队的世界模型研究页面,围绕观察、推理、认知和行动展开。

Orca 是北京智源人工智能研究院团队发布的世界模型研究页,重点讨论 next state predictio…

0

可灵 AI – 一句话生成电影感视频和图像创意

推荐给想快速做 AI 短片、广告分镜和视觉概念片的创作者:可灵 AI 更像一个面向视频叙事的生成工具,把画面、镜头和声音创作放到同一条流程里。

可灵 AI(Kling AI)是面向 AI 视频和图像创作的生成式平台,提供文生视频、图生视频、图像生成、多模…

0
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1