暂无菜单项

腾讯混元Hy4 Preview实测:770B开源模型能否进入国产大模型第一梯队?

发布于
25

副标题:770B总参数、1M长上下文与真实生产力Agent,腾讯混元Hy4 Preview到底进步在哪?

腾讯混元 Hy4 Preview 已正式发布并开源。与只强调排行榜成绩的模型更新不同,这一代产品把重点放在长程软件工程、复杂办公、游戏原型和科研推理等真实任务上,并继续与 WorkBuddy、CodeBuddy 等产品协同迭代。

腾讯混元Hy4 Preview正式发布,重点强化真实生产力任务
腾讯混元Hy4 Preview正式发布,重点强化真实生产力任务

官方资料显示,Hy4 Preview 采用混合专家(MoE)架构,总参数达到770B,每个Token激活49B参数,原生上下文长度超过100万Token。模型权重、FP8版本、推理与微调文档均已公开。

想查看官方模型权重、部署命令和最新限制,可通过站内整理的 Hy4 Preview 项目导航 进入,链接指向公开前台页面。

Hy4 Preview延续混元面向真实场景而非单纯刷榜的路线
Hy4 Preview延续混元面向真实场景而非单纯刷榜的路线
腾讯混元Hy4 Preview面向代码、办公、游戏开发与科研任务
腾讯混元Hy4 Preview面向代码、办公、游戏开发与科研任务

一、从Hy3到Hy4:模型规模与产品路线同时升级

Hy4 Preview 的变化首先体现在规模。上一代 Hy3 Preview 为295B总参数、21B激活参数;Hy4扩大到770B总参数与49B激活参数。更大的模型、训练数据和后训练规模,为长链路规划、复杂上下文理解与多步验证提供了更高上限。

但参数并不是唯一主线。腾讯混元更值得观察的是“模型—产品—真实任务”共同设计:模型在 CodeBuddy 和 WorkBuddy 中接触软件开发、文档、表格、演示和研究任务,产品中的失败案例又反过来进入训练和评测。换句话说,模型能力要通过完整交付来验证,而不是只回答一道题。

Hy4 Preview官方规格显示770B总参数与49B激活参数
Hy4 Preview官方规格显示770B总参数与49B激活参数

二、Coding Agent实测:能否从需求走到可玩的完整产品?

第一组测试不是生成一段静态页面,而是让模型构建可实时操作的3D月球运输游戏。任务同时要求地形、基地、月球车、货物、碰撞、低重力、任务流程、多个镜头、地图和电量系统,并要求模型自行试玩、定位问题和重新验证。

Hy4 Preview根据复杂需求规划3D月球运输游戏
Hy4 Preview根据复杂需求规划3D月球运输游戏
生成的月球车场景包含任务、驾驶、电量与视角切换
生成的月球车场景包含任务、驾驶、电量与视角切换

从交付表现看,模型能够把自然语言要求拆成场景搭建、车辆控制、状态管理和任务触发等多个模块。WASD驾驶、自动驾驶、充电站和镜头切换等功能均能运行,说明它不只会“画一个像游戏的页面”,而是在尝试维护完整交互状态。

需要注意,单次演示不能代表所有工程任务都稳定成功。真正的Agent能力还要看仓库理解、依赖处理、测试覆盖、异常恢复和多轮修改后的代码质量。不过,这类复杂原型比传统代码补全更接近真实开发流程。

月球基地游戏支持不同驾驶视角与实时交互
月球基地游戏支持不同驾驶视角与实时交互
模型能够把复杂提示词转化为可运行的多模块网页应用
模型能够把复杂提示词转化为可运行的多模块网页应用

三、接手“烂项目”:修Bug比从零生成更能检验工程能力

第二组测试把带有缺陷的差旅报销系统交给 Coding Agent,要求它在不能查看评测脚本和参考答案的限制下定位问题,并新增“异常报销审核”功能。

这类任务更接近企业软件开发:模型必须先理解现有代码、权限角色和统计口径,再修复权限错乱、数据计算不一致等问题。新增功能还需要满足员工、经理和财务之间的可见性边界,而不能只让页面出现一个按钮。

Hy4 Preview分析并修复差旅报销系统中的权限与统计问题
Hy4 Preview分析并修复差旅报销系统中的权限与统计问题
新增异常报销审核功能并遵守不同角色的访问权限
新增异常报销审核功能并遵守不同角色的访问权限

工程Agent是否可靠,关键看它能否遵守限制、验证结果并避免破坏原功能。Hy4 Preview在该案例中体现出的价值,是将问题定位、代码修改、权限校验和交付验证串成较完整的链路。

四、游戏与创意开发:从搜索资料到持续扩展世界

为了测试模型处理模糊创意需求的能力,测试者还让它自行搜索热门文化素材,并制作真正可以玩的3D网页小游戏。最终结果不仅包含角色和场景,还加入传送门、任务区域、存档点、NPC互动与收集目标。

Hy4 Preview根据开放式创意生成可玩的3D网页小游戏
Hy4 Preview根据开放式创意生成可玩的3D网页小游戏
不同场景、传送门、NPC与存档点构成完整任务流程
不同场景、传送门、NPC与存档点构成完整任务流程

创意开发对模型的要求并不比企业软件低。它需要把风格、剧情、玩法、资源和交互统一起来,并在多轮修改中保持状态一致。Hy4 Preview在这类任务中的提升,反映出其训练不只覆盖代码语法,还包含游戏开发者和真实产品团队的数据。

五、办公Agent:不是“写几段话”,而是交付可继续编辑的成果

办公能力测试从品牌海报开始。模型需要在线理解目标媒体的视觉风格,再制作招聘海报,并根据反馈调整版式。交付结果可以在工作台中继续手动编辑,也可以框选局部后要求Agent修改。

Hy4 Preview调研品牌风格后生成招聘海报
Hy4 Preview调研品牌风格后生成招聘海报

这类体验的重点是“可编辑交付物”。用户真正需要的通常不是一张不可修改的截图,而是可以继续调整文字、颜色和布局的工作成果。模型与编辑器结合后,AI才更像协作伙伴,而不是一次性生成器。

六、深度研究:多Agent能否找到可靠资料并守住事实边界?

在“AI Coding Agent近三个月企业部署情况”的研究任务中,Hy4 Preview会组织多个Agent分工检索、核对和写作,最终生成结构化报告。测试者称其使用的资料来自权威机构,引用数据也经过核查。

Hy4 Preview组织多个Agent组成调研团队
Hy4 Preview组织多个Agent组成调研团队
多Agent协作完成企业AI Coding部署研究
多Agent协作完成企业AI Coding部署研究
研究Agent对资料来源、引用与事实边界进行整理
研究Agent对资料来源、引用与事实边界进行整理

多Agent并不自动等于高质量研究。可靠流程至少应包括查询拆解、来源优先级、交叉核对、引用定位和不确定性标注。Hy4 Preview的长上下文与复杂规划能力,为这一流程提供了基础,但用户仍应保留人工复核,尤其涉及财务、法律、医疗或商业决策时。

七、数据分析:从官方数据到图表、结论和个人建议

另一项测试围绕“中国博士生是否正在变多”展开。模型需要寻找教育部门公开数据、统一统计口径、完成可视化并解释趋势,最后还要把宏观数据转化为针对个人的学业建议。

Hy4 Preview基于公开教育数据开展博士生趋势分析
Hy4 Preview基于公开教育数据开展博士生趋势分析
模型将检索、数据清洗、可视化与报告写作串联起来
模型将检索、数据清洗、可视化与报告写作串联起来
数据分析报告呈现趋势、口径与关键结论
数据分析报告呈现趋势、口径与关键结论
Hy4 Preview结合分析结果给出面向个人的学业建议
Hy4 Preview结合分析结果给出面向个人的学业建议

这类任务同时考验资料检索、表格处理、图表表达和自然语言解释。模型生成的建议仍不能替代个人对专业、学校、就业环境和机会成本的判断,但它能显著降低从“找到数据”到“形成可读报告”的操作门槛。

八、官方架构与部署:770B模型意味着什么?

Hy4 Preview的骨干网络包含78层:首层采用标准Dense FFN,其余77层为MoE结构,每层包含256个路由专家和1个共享专家,每个Token激活Top-8路由专家与共享专家。注意力模块使用Gated DeepSeek Sparse Attention,并通过IndexCache复用跨层稀疏索引;残差路径采用iHC扩展层间信息流。

官方同时内置原生MTP层用于投机解码,并提供vLLM、SGLang、FP8权重、量化与微调资料。虽然模型开源,但完整模型不属于普通消费级显卡可以轻松部署的范围。官方部署示例采用8卡张量并行;微调的资源要求更高。多数个人用户更适合通过WorkBuddy、CodeBuddy、元宝、ima、API或托管推理服务体验。

九、它进入第一梯队了吗?先看官方盲测,也要看到局限

腾讯公布的内部盲测由163名专家评估203项工程任务。Hy4 Preview平均得分2.99/4,略高于GLM-5.3的2.92和Kimi K3的2.94。这个结果说明它在腾讯定义的真实工程任务上具有竞争力,但不能直接外推到所有场景,也不应替代独立第三方评测。

官方也明确承认,Hy4 Preview是早期版本,在复杂任务上可能思考时间过长,并存在过度验证倾向。因此更准确的判断是:它已经具备开源旗舰模型应有的规模、长上下文、部署生态和Agent能力,但距离“所有任务稳定SOTA”仍有迭代空间。

结语:腾讯真正踩下油门的是“模型×产品×真实数据”

Hy4 Preview的意义不仅是参数从295B扩大到770B,更在于腾讯开始把基础模型、真实生产力工具和内部专家数据连接起来。模型在产品里完成任务,产品收集失败案例,新的数据再回到训练与评测,这个循环比一次榜单排名更有长期价值。

如果这套协同能够持续,混元的优势将不仅来自模型结构,还来自代码、办公、游戏、研究等场景形成的真实反馈。对用户而言,最值得关注的也不是一句“第一梯队”,而是它能否在日常工作中更稳定地理解复杂目标、完成长程执行,并交付可继续使用的成果。

常见问题(FAQ)

Hy4 Preview是什么?
Hy4 Preview是腾讯混元团队研发并开源的MoE旗舰大语言模型,重点面向编程、办公分析、游戏开发和科学研究等真实生产力任务。
Hy4 Preview参数规模多大?
官方规格为770B总参数、49B激活参数,骨干网络78层,并内置一层用于投机解码的MTP模块。
Hy4 Preview支持多长上下文?
官方资料显示原生上下文长度超过100万Token,适合跨文件、长代码库和复杂研究资料处理。
普通电脑可以本地部署Hy4 Preview吗?
完整模型规模很大,官方示例使用8卡张量并行,普通个人电脑不适合完整部署,可考虑托管服务、API或官方产品。
Hy4 Preview是否开源?
是。腾讯混元已公开模型权重、FP8版本、vLLM和SGLang部署文档,并采用Apache License 2.0。
Hy4 Preview有哪些已知局限?
官方说明其仍为早期预览版本,复杂任务可能思考时间偏长,并存在过度自我验证倾向,仍会持续迭代。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材