副标题:770B总参数、1M长上下文与真实生产力Agent,腾讯混元Hy4 Preview到底进步在哪?
腾讯混元 Hy4 Preview 已正式发布并开源。与只强调排行榜成绩的模型更新不同,这一代产品把重点放在长程软件工程、复杂办公、游戏原型和科研推理等真实任务上,并继续与 WorkBuddy、CodeBuddy 等产品协同迭代。

官方资料显示,Hy4 Preview 采用混合专家(MoE)架构,总参数达到770B,每个Token激活49B参数,原生上下文长度超过100万Token。模型权重、FP8版本、推理与微调文档均已公开。
想查看官方模型权重、部署命令和最新限制,可通过站内整理的 Hy4 Preview 项目导航 进入,链接指向公开前台页面。


一、从Hy3到Hy4:模型规模与产品路线同时升级
Hy4 Preview 的变化首先体现在规模。上一代 Hy3 Preview 为295B总参数、21B激活参数;Hy4扩大到770B总参数与49B激活参数。更大的模型、训练数据和后训练规模,为长链路规划、复杂上下文理解与多步验证提供了更高上限。
但参数并不是唯一主线。腾讯混元更值得观察的是“模型—产品—真实任务”共同设计:模型在 CodeBuddy 和 WorkBuddy 中接触软件开发、文档、表格、演示和研究任务,产品中的失败案例又反过来进入训练和评测。换句话说,模型能力要通过完整交付来验证,而不是只回答一道题。

二、Coding Agent实测:能否从需求走到可玩的完整产品?
第一组测试不是生成一段静态页面,而是让模型构建可实时操作的3D月球运输游戏。任务同时要求地形、基地、月球车、货物、碰撞、低重力、任务流程、多个镜头、地图和电量系统,并要求模型自行试玩、定位问题和重新验证。


从交付表现看,模型能够把自然语言要求拆成场景搭建、车辆控制、状态管理和任务触发等多个模块。WASD驾驶、自动驾驶、充电站和镜头切换等功能均能运行,说明它不只会“画一个像游戏的页面”,而是在尝试维护完整交互状态。
需要注意,单次演示不能代表所有工程任务都稳定成功。真正的Agent能力还要看仓库理解、依赖处理、测试覆盖、异常恢复和多轮修改后的代码质量。不过,这类复杂原型比传统代码补全更接近真实开发流程。


三、接手“烂项目”:修Bug比从零生成更能检验工程能力
第二组测试把带有缺陷的差旅报销系统交给 Coding Agent,要求它在不能查看评测脚本和参考答案的限制下定位问题,并新增“异常报销审核”功能。
这类任务更接近企业软件开发:模型必须先理解现有代码、权限角色和统计口径,再修复权限错乱、数据计算不一致等问题。新增功能还需要满足员工、经理和财务之间的可见性边界,而不能只让页面出现一个按钮。


工程Agent是否可靠,关键看它能否遵守限制、验证结果并避免破坏原功能。Hy4 Preview在该案例中体现出的价值,是将问题定位、代码修改、权限校验和交付验证串成较完整的链路。
四、游戏与创意开发:从搜索资料到持续扩展世界
为了测试模型处理模糊创意需求的能力,测试者还让它自行搜索热门文化素材,并制作真正可以玩的3D网页小游戏。最终结果不仅包含角色和场景,还加入传送门、任务区域、存档点、NPC互动与收集目标。


创意开发对模型的要求并不比企业软件低。它需要把风格、剧情、玩法、资源和交互统一起来,并在多轮修改中保持状态一致。Hy4 Preview在这类任务中的提升,反映出其训练不只覆盖代码语法,还包含游戏开发者和真实产品团队的数据。
五、办公Agent:不是“写几段话”,而是交付可继续编辑的成果
办公能力测试从品牌海报开始。模型需要在线理解目标媒体的视觉风格,再制作招聘海报,并根据反馈调整版式。交付结果可以在工作台中继续手动编辑,也可以框选局部后要求Agent修改。

这类体验的重点是“可编辑交付物”。用户真正需要的通常不是一张不可修改的截图,而是可以继续调整文字、颜色和布局的工作成果。模型与编辑器结合后,AI才更像协作伙伴,而不是一次性生成器。
六、深度研究:多Agent能否找到可靠资料并守住事实边界?
在“AI Coding Agent近三个月企业部署情况”的研究任务中,Hy4 Preview会组织多个Agent分工检索、核对和写作,最终生成结构化报告。测试者称其使用的资料来自权威机构,引用数据也经过核查。



多Agent并不自动等于高质量研究。可靠流程至少应包括查询拆解、来源优先级、交叉核对、引用定位和不确定性标注。Hy4 Preview的长上下文与复杂规划能力,为这一流程提供了基础,但用户仍应保留人工复核,尤其涉及财务、法律、医疗或商业决策时。
七、数据分析:从官方数据到图表、结论和个人建议
另一项测试围绕“中国博士生是否正在变多”展开。模型需要寻找教育部门公开数据、统一统计口径、完成可视化并解释趋势,最后还要把宏观数据转化为针对个人的学业建议。




这类任务同时考验资料检索、表格处理、图表表达和自然语言解释。模型生成的建议仍不能替代个人对专业、学校、就业环境和机会成本的判断,但它能显著降低从“找到数据”到“形成可读报告”的操作门槛。
八、官方架构与部署:770B模型意味着什么?
Hy4 Preview的骨干网络包含78层:首层采用标准Dense FFN,其余77层为MoE结构,每层包含256个路由专家和1个共享专家,每个Token激活Top-8路由专家与共享专家。注意力模块使用Gated DeepSeek Sparse Attention,并通过IndexCache复用跨层稀疏索引;残差路径采用iHC扩展层间信息流。
官方同时内置原生MTP层用于投机解码,并提供vLLM、SGLang、FP8权重、量化与微调资料。虽然模型开源,但完整模型不属于普通消费级显卡可以轻松部署的范围。官方部署示例采用8卡张量并行;微调的资源要求更高。多数个人用户更适合通过WorkBuddy、CodeBuddy、元宝、ima、API或托管推理服务体验。
九、它进入第一梯队了吗?先看官方盲测,也要看到局限
腾讯公布的内部盲测由163名专家评估203项工程任务。Hy4 Preview平均得分2.99/4,略高于GLM-5.3的2.92和Kimi K3的2.94。这个结果说明它在腾讯定义的真实工程任务上具有竞争力,但不能直接外推到所有场景,也不应替代独立第三方评测。
官方也明确承认,Hy4 Preview是早期版本,在复杂任务上可能思考时间过长,并存在过度验证倾向。因此更准确的判断是:它已经具备开源旗舰模型应有的规模、长上下文、部署生态和Agent能力,但距离“所有任务稳定SOTA”仍有迭代空间。
结语:腾讯真正踩下油门的是“模型×产品×真实数据”
Hy4 Preview的意义不仅是参数从295B扩大到770B,更在于腾讯开始把基础模型、真实生产力工具和内部专家数据连接起来。模型在产品里完成任务,产品收集失败案例,新的数据再回到训练与评测,这个循环比一次榜单排名更有长期价值。
如果这套协同能够持续,混元的优势将不仅来自模型结构,还来自代码、办公、游戏、研究等场景形成的真实反馈。对用户而言,最值得关注的也不是一句“第一梯队”,而是它能否在日常工作中更稳定地理解复杂目标、完成长程执行,并交付可继续使用的成果。










