腾讯混元Hy4 preview实测:回归国产大模型第一梯队
腾讯混元最新模型Hy4 preview实测:770B总参数、49B激活,支持1M上下文。在Coding、Agent和工具调用上表现突出,代码生成、马里奥复刻和SwiftUI重构三项测试中均优于GLM 5.2,盲测分数领先同代旗舰,回到国产大模型第一梯队。
近期,腾讯混元正式发布最新模型 Hy4 preview。在多日实测后,我的结论是:这款总参数 770B、激活参数 49B、支持 1M 上下文的模型,已经让混元回到国产大模型第一梯队,尤其在 Coding、Agent 与工具调用场景下表现突出。目前 Hy4 preview 已上线 WorkBuddy,并在 Code Arena WebDev 榜单中位居第 5、开源模型第 3。
官方成绩与定价
根据官方公布的成绩,Hy4 preview 在 Coding、Agent 和工具使用等维度均进入前列。腾讯内部 163 名专家、203 个工程任务的盲测中,Hy4 preview 均分 2.99/4.00,略胜 GLM 5.3(2.92)与 Kimi K3(2.94)。与国内旗舰模型相比,Hy4 preview 的调用价格也处于最低档。


实测一:3D 射击游戏
为了验证代码生成与可玩性,我用同一提示词让 Hy4 preview 和 GLM 5.2 分别开发一款浏览器内 3D 第一人称射击游戏。提示词要求包含移动、跳跃、视角控制、打击反馈、敌人 AI、武器系统、场景设计与 UI。
开发一款可通过浏览器直接打开游玩的3D第一人称射击游戏:玩家用键盘鼠标自由移动、跳跃与视角控制;需实现真实打击反馈(命中特效、受击抖动、伤害飘字)、敌人与玩家血条、枪械弹药消耗与换弹机制。请补充设计:场景布局(室内外、掩体、可交互物件)、敌人AI(巡逻、追击、攻击)、武器种类与切换、拾取补给(弹药包、医疗包)、UI(准星、血量、弹药数、小地图)、胜负条件与关卡流程。给出整体技术方案、模块划分、开发步骤与注意事项,覆盖从原型到可玩版本的完整规划。
Hy4 preview 版本

Hy4 preview 的版本完成度很高。除了射击、换弹、枪械切换等基础机制,还额外提供了设置界面,可调节音效、鼠标灵敏度,甚至能控制人物移动时的画面抖动效果。场景内还有开门、关门等交互细节,玩起来沉浸感不错。不过敌人攻击力偏高,血量消耗较快。
GLM 5.2 版本

GLM 5.2 走的是简约界面风格,整体运行没有明显问题。但冲锋枪射击时子弹散布较大,连续射击命中率受影响。击败敌人后有概率掉落恢复道具,算是个加分项。
从实际体验来看,Hy4 preview 在游戏完整度、交互细节和视觉效果上均优于 GLM 5.2。
实测二:马里奥复原
第二项任务是用 HTML/CSS/JavaScript 在浏览器中实现高度还原经典《超级马里奥》玩法的平台跳跃游戏,包含角色动作、道具、敌人 AI、卷轴地图、音效等机制。
开发一款高度还原经典《超级马里奥》玩法的网页平台跳跃游戏,采用 1:1 仿照的关卡布局、角色动作与操作手感。需包含完整的道具系统逻辑:蘑菇(变大)、火焰花(发射火球)、无敌星(短暂无敌)、金币(计分)、隐藏砖块与问号方块(顶出道具或金币)、以及踩敌人、顶砖块、旗杆通关等核心机制。要求实现重力、碰撞检测、卷轴地图、敌人 AI(如栗子小子、乌龟)与音效反馈,使用 HTML/CSS/JavaScript 在浏览器中运行,保证操作流畅与画面像素风格还原。
Hy4 preview 版本

Hy4 preview 生成的版本对原作还原度很高,角色造型、移动跳跃动作、背景音乐和音效都基本到位,顶砖块、踩敌人、吃道具等反馈也符合预期,可以称得上一次完整复刻。
GLM 5.2 版本

GLM 5.2 的版本在画风上出现明显偏差,与原作差异较大。更关键的是跳跃机制存在缺陷,尝试长按跳跃也无法越过下水道,导致关卡无法正常推进。这一轮 Hy4 preview 完胜。
实测三:接手我的 Rubriq 项目
第三个任务更考验长任务能力。我把自己开发的桌面文章质量检测工具 Rubriq 的仓库交给两个模型,要求它们先阅读理解现有项目,再使用 SwiftUI 原生重构,同时保留原有功能。整个过程中需要多轮对话确认与调整,比单次生成更难。
Hy4 preview 重构结果

Hy4 preview 重做后的页面整体清爽,排版与信息层级合理,标签编辑等交互也符合预期,基本到“稍微调整即可使用”的程度。
GLM 5.2 重构结果

GLM 5.2 的界面第一眼就显得别扭,并且没有正确理解标签库的设计逻辑,把标签库做成了另一个存放标签的库,偏离了原产品结构。两者差距明显。

总结
从 2 月重建基础设施到 Hy3、Hy4 系列陆续发布,混元的迭代速度明显加快。在三轮实测中,Hy4 preview 已经能够较完整地完成理解、拆解、调用工具、执行和持续迭代这一整套流程,而非只靠单一单项能力。与 GLM 5.2 对比,Hy4 preview 在 Coding 和 Agent 这两个关键方向上的竞争力已经非常明显。而且这还只是 preview 版本,正式版的表现令人期待。





暂无评论,期待您的发言...