### [TaoMate-H3 – 淘宝开源三步流式音视频生成模型](https://www.zuoshipin.com/link/47118.html) **Published:** 2026-10-02T15:10:44 **Author:** 天才交易员 **Excerpt:** 基于MiniMax H3的开源低延迟音视频生成运行时,以三步LoRA实现分块流式生成、原生音频和分钟级连续续写… ## TaoMate-H3是什么? **TaoMate-H3是阿里巴巴淘宝TaoLive AIGC团队开源的低延迟流式音视频生成运行时。**它建立在MiniMax H3之上,通过三步LoRA把连续视频拆成小片段生成,在同一时间线上同步处理画面、对白、歌声、环境音与动作音效。 [![TaoMate-H3三步流式音视频联合生成模型及官方性能摘要](https://admin.zuoshipin.com/wp-content/uploads/2026/10/taomate-h3-image01.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/taomate-h3-image01.webp) TaoMate-H3三步流式音视频联合生成模型及官方性能摘要。图片来自项目公开演示,已压缩为WebP,点击查看大图。 ## 核心能力 - **三步流式生成:**每个小片段只执行三个去噪区间,不必等待整段视频全部完成。 - **音视频联合:**声音与画面共同生成,适合口播、演唱、角色对白和带环境音的场景。 - **连续续写:**利用音视频KV缓存、起始视觉参照和近期上下文,在提示词切换后继续保持人物、声音与动作。 - **多种规格:**支持480p、768p和对齐1080p的横竖屏输出,时长以5秒为单位组织。 - **开放代码与权重:**GitHub提供推理代码,Hugging Face提供T2AV三步LoRA权重。 ## 硬件与环境要求 官方仓库要求Linux、Python 3.10或3.11、CUDA 12.8、PyTorch 2.8、支持H.264与AAC的FFmpeg,以及NVIDIA Hopper/SM90 GPU。支持单机4卡或8卡推理,官方验证配置是**8张H20 96GB**,因此它目前并不是普通消费级显卡的一键工具。 ## 性能口径 在8张H20 96GB、480×864、10秒视频的官方测试中,纯DiT计算耗时由MiniMax H3的169.572秒降至14.810秒,约11.45倍加速;首个最终latent就绪时间由170.052秒缩短到6.148秒,约27.66倍加速。上述数据来自项目方特定环境,不代表所有分辨率和部署配置。 ## 适合谁 适合研究流式视频生成、数字人口播、电商讲解、虚拟角色、长视频续写与交互式视听应用的算法团队、AI视频开发者和具备多卡服务器的工作室。普通创作者可先查看公开演示与代码结构,再评估云端算力成本。 ## 官方入口 [访问TaoMate-H3官方GitHub仓库](https://github.com/TaoLiveAIGC/TaoMate-H3) [访问TaoMate-H3官方Hugging Face模型页](https://huggingface.co/TaoLiveAIGC/TaoMate-H3) ---