### [腾讯混元Hy4 Preview实测:770B开源模型能否进入国产大模型第一梯队?](https://www.zuoshipin.com/article/27453) **Published:** 2026-08-28T16:30:25 **Author:** 天才交易员 **Excerpt:** 腾讯混元Hy4 Preview拥有770B总参数、49B激活参数和1M长上下文。本文结合代码、3D游戏、办公、… 副标题:770B总参数、1M长上下文与真实生产力Agent,腾讯混元Hy4 Preview到底进步在哪? 腾讯混元 Hy4 Preview 已正式发布并开源。与只强调排行榜成绩的模型更新不同,这一代产品把重点放在**长程软件工程、复杂办公、游戏原型和科研推理**等真实任务上,并继续与 WorkBuddy、CodeBuddy 等产品协同迭代。 ![腾讯混元Hy4 Preview正式发布,重点强化真实生产力任务](https://admin.zuoshipin.com/wp-content/uploads/2026/08/580400f8-a2b2-11f1-bedd-fa163e47d677.webp) 腾讯混元Hy4 Preview正式发布,重点强化真实生产力任务 官方资料显示,Hy4 Preview 采用混合专家(MoE)架构,总参数达到770B,每个Token激活49B参数,原生上下文长度超过100万Token。模型权重、FP8版本、推理与微调文档均已公开。 想查看官方模型权重、部署命令和最新限制,可通过站内整理的 [**Hy4 Preview 项目导航**](https://www.zuoshipin.com/link/27446.html) 进入,链接指向公开前台页面。 ![Hy4 Preview延续混元面向真实场景而非单纯刷榜的路线](https://admin.zuoshipin.com/wp-content/uploads/2026/08/58876156-a2b2-11f1-a520-fa163e47d677.webp) Hy4 Preview延续混元面向真实场景而非单纯刷榜的路线 ![腾讯混元Hy4 Preview面向代码、办公、游戏开发与科研任务](https://admin.zuoshipin.com/wp-content/uploads/2026/08/593b13ad-a2b2-11f1-89ff-fa163e47d677.webp) 腾讯混元Hy4 Preview面向代码、办公、游戏开发与科研任务 ## 一、从Hy3到Hy4:模型规模与产品路线同时升级 Hy4 Preview 的变化首先体现在规模。上一代 Hy3 Preview 为295B总参数、21B激活参数;Hy4扩大到770B总参数与49B激活参数。更大的模型、训练数据和后训练规模,为长链路规划、复杂上下文理解与多步验证提供了更高上限。 但参数并不是唯一主线。腾讯混元更值得观察的是“模型—产品—真实任务”共同设计:模型在 CodeBuddy 和 WorkBuddy 中接触软件开发、文档、表格、演示和研究任务,产品中的失败案例又反过来进入训练和评测。换句话说,模型能力要通过完整交付来验证,而不是只回答一道题。 ![Hy4 Preview官方规格显示770B总参数与49B激活参数](https://admin.zuoshipin.com/wp-content/uploads/2026/08/a3f9449e-a2b2-11f1-a516-fa163e47d677.webp) Hy4 Preview官方规格显示770B总参数与49B激活参数 ## 二、Coding Agent实测:能否从需求走到可玩的完整产品? 第一组测试不是生成一段静态页面,而是让模型构建可实时操作的3D月球运输游戏。任务同时要求地形、基地、月球车、货物、碰撞、低重力、任务流程、多个镜头、地图和电量系统,并要求模型自行试玩、定位问题和重新验证。 ![Hy4 Preview根据复杂需求规划3D月球运输游戏](https://admin.zuoshipin.com/wp-content/uploads/2026/08/59bc893f-a2b2-11f1-95e7-fa163e47d677.webp) Hy4 Preview根据复杂需求规划3D月球运输游戏 ![生成的月球车场景包含任务、驾驶、电量与视角切换](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5a393255-a2b2-11f1-9e02-fa163e47d677.webp) 生成的月球车场景包含任务、驾驶、电量与视角切换 从交付表现看,模型能够把自然语言要求拆成场景搭建、车辆控制、状态管理和任务触发等多个模块。WASD驾驶、自动驾驶、充电站和镜头切换等功能均能运行,说明它不只会“画一个像游戏的页面”,而是在尝试维护完整交互状态。 需要注意,单次演示不能代表所有工程任务都稳定成功。真正的Agent能力还要看仓库理解、依赖处理、测试覆盖、异常恢复和多轮修改后的代码质量。不过,这类复杂原型比传统代码补全更接近真实开发流程。 ![月球基地游戏支持不同驾驶视角与实时交互](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5ab2260d-a2b2-11f1-a2a5-fa163e47d677.webp) 月球基地游戏支持不同驾驶视角与实时交互 ![模型能够把复杂提示词转化为可运行的多模块网页应用](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5b2a655f-a2b2-11f1-9179-fa163e47d677.webp) 模型能够把复杂提示词转化为可运行的多模块网页应用 ## 三、接手“烂项目”:修Bug比从零生成更能检验工程能力 第二组测试把带有缺陷的差旅报销系统交给 Coding Agent,要求它在不能查看评测脚本和参考答案的限制下定位问题,并新增“异常报销审核”功能。 这类任务更接近企业软件开发:模型必须先理解现有代码、权限角色和统计口径,再修复权限错乱、数据计算不一致等问题。新增功能还需要满足员工、经理和财务之间的可见性边界,而不能只让页面出现一个按钮。 ![Hy4 Preview分析并修复差旅报销系统中的权限与统计问题](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5b9b77d9-a2b2-11f1-b8d9-fa163e47d677.webp) Hy4 Preview分析并修复差旅报销系统中的权限与统计问题 ![新增异常报销审核功能并遵守不同角色的访问权限](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5c172f3b-a2b2-11f1-9090-fa163e47d677.webp) 新增异常报销审核功能并遵守不同角色的访问权限 工程Agent是否可靠,关键看它能否遵守限制、验证结果并避免破坏原功能。Hy4 Preview在该案例中体现出的价值,是将问题定位、代码修改、权限校验和交付验证串成较完整的链路。 ## 四、游戏与创意开发:从搜索资料到持续扩展世界 为了测试模型处理模糊创意需求的能力,测试者还让它自行搜索热门文化素材,并制作真正可以玩的3D网页小游戏。最终结果不仅包含角色和场景,还加入传送门、任务区域、存档点、NPC互动与收集目标。 ![Hy4 Preview根据开放式创意生成可玩的3D网页小游戏](https://admin.zuoshipin.com/wp-content/uploads/2026/08/b21cf6c0-a2b2-11f1-9947-fa163e47d677.webp) Hy4 Preview根据开放式创意生成可玩的3D网页小游戏 ![不同场景、传送门、NPC与存档点构成完整任务流程](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5c98d3b7-a2b2-11f1-8dad-fa163e47d677.webp) 不同场景、传送门、NPC与存档点构成完整任务流程 创意开发对模型的要求并不比企业软件低。它需要把风格、剧情、玩法、资源和交互统一起来,并在多轮修改中保持状态一致。Hy4 Preview在这类任务中的提升,反映出其训练不只覆盖代码语法,还包含游戏开发者和真实产品团队的数据。 ## 五、办公Agent:不是“写几段话”,而是交付可继续编辑的成果 办公能力测试从品牌海报开始。模型需要在线理解目标媒体的视觉风格,再制作招聘海报,并根据反馈调整版式。交付结果可以在工作台中继续手动编辑,也可以框选局部后要求Agent修改。 ![Hy4 Preview调研品牌风格后生成招聘海报](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5d242aaf-a2b2-11f1-96ae-fa163e47d677.webp) Hy4 Preview调研品牌风格后生成招聘海报 这类体验的重点是“可编辑交付物”。用户真正需要的通常不是一张不可修改的截图,而是可以继续调整文字、颜色和布局的工作成果。模型与编辑器结合后,AI才更像协作伙伴,而不是一次性生成器。 ## 六、深度研究:多Agent能否找到可靠资料并守住事实边界? 在“AI Coding Agent近三个月企业部署情况”的研究任务中,Hy4 Preview会组织多个Agent分工检索、核对和写作,最终生成结构化报告。测试者称其使用的资料来自权威机构,引用数据也经过核查。 ![Hy4 Preview组织多个Agent组成调研团队](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5dc92996-a2b2-11f1-8fa8-fa163e47d677.webp) Hy4 Preview组织多个Agent组成调研团队 ![多Agent协作完成企业AI Coding部署研究](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5e461a99-a2b2-11f1-bcaf-fa163e47d677.gif) 多Agent协作完成企业AI Coding部署研究 ![研究Agent对资料来源、引用与事实边界进行整理](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5eba82de-a2b2-11f1-b298-fa163e47d677.gif) 研究Agent对资料来源、引用与事实边界进行整理 多Agent并不自动等于高质量研究。可靠流程至少应包括查询拆解、来源优先级、交叉核对、引用定位和不确定性标注。Hy4 Preview的长上下文与复杂规划能力,为这一流程提供了基础,但用户仍应保留人工复核,尤其涉及财务、法律、医疗或商业决策时。 ## 七、数据分析:从官方数据到图表、结论和个人建议 另一项测试围绕“中国博士生是否正在变多”展开。模型需要寻找教育部门公开数据、统一统计口径、完成可视化并解释趋势,最后还要把宏观数据转化为针对个人的学业建议。 ![Hy4 Preview基于公开教育数据开展博士生趋势分析](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5f3f7220-a2b2-11f1-88c5-fa163e47d677.webp) Hy4 Preview基于公开教育数据开展博士生趋势分析 ![模型将检索、数据清洗、可视化与报告写作串联起来](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5fbbc502-a2b2-11f1-a3ab-fa163e47d677.webp) 模型将检索、数据清洗、可视化与报告写作串联起来 ![数据分析报告呈现趋势、口径与关键结论](https://admin.zuoshipin.com/wp-content/uploads/2026/08/60315175-a2b2-11f1-a3c8-fa163e47d677.webp) 数据分析报告呈现趋势、口径与关键结论 ![Hy4 Preview结合分析结果给出面向个人的学业建议](https://admin.zuoshipin.com/wp-content/uploads/2026/08/60b09f89-a2b2-11f1-b906-fa163e47d677.webp) Hy4 Preview结合分析结果给出面向个人的学业建议 这类任务同时考验资料检索、表格处理、图表表达和自然语言解释。模型生成的建议仍不能替代个人对专业、学校、就业环境和机会成本的判断,但它能显著降低从“找到数据”到“形成可读报告”的操作门槛。 ## 八、官方架构与部署:770B模型意味着什么? Hy4 Preview的骨干网络包含78层:首层采用标准Dense FFN,其余77层为MoE结构,每层包含256个路由专家和1个共享专家,每个Token激活Top-8路由专家与共享专家。注意力模块使用Gated DeepSeek Sparse Attention,并通过IndexCache复用跨层稀疏索引;残差路径采用iHC扩展层间信息流。 官方同时内置原生MTP层用于投机解码,并提供vLLM、SGLang、FP8权重、量化与微调资料。虽然模型开源,但完整模型不属于普通消费级显卡可以轻松部署的范围。官方部署示例采用8卡张量并行;微调的资源要求更高。多数个人用户更适合通过WorkBuddy、CodeBuddy、元宝、ima、API或托管推理服务体验。 ## 九、它进入第一梯队了吗?先看官方盲测,也要看到局限 腾讯公布的内部盲测由163名专家评估203项工程任务。Hy4 Preview平均得分2.99/4,略高于GLM-5.3的2.92和Kimi K3的2.94。这个结果说明它在腾讯定义的真实工程任务上具有竞争力,但不能直接外推到所有场景,也不应替代独立第三方评测。 官方也明确承认,Hy4 Preview是早期版本,在复杂任务上可能思考时间过长,并存在过度验证倾向。因此更准确的判断是:它已经具备开源旗舰模型应有的规模、长上下文、部署生态和Agent能力,但距离“所有任务稳定SOTA”仍有迭代空间。 ## 结语:腾讯真正踩下油门的是“模型×产品×真实数据” Hy4 Preview的意义不仅是参数从295B扩大到770B,更在于腾讯开始把基础模型、真实生产力工具和内部专家数据连接起来。模型在产品里完成任务,产品收集失败案例,新的数据再回到训练与评测,这个循环比一次榜单排名更有长期价值。 如果这套协同能够持续,混元的优势将不仅来自模型结构,还来自代码、办公、游戏、研究等场景形成的真实反馈。对用户而言,最值得关注的也不是一句“第一梯队”,而是它能否在日常工作中更稳定地理解复杂目标、完成长程执行,并交付可继续使用的成果。 **Tags:** AI编程, CodeBuddy, Hy4 Preview, MoE, WorkBuddy, 开源大模型, 腾讯混元 **Categories:** AI资讯 ---