腾讯混元Hy4preview首发实测:姚顺雨的“新作业”能打多少分?
撰文 | 骁 云
编辑 | 郝 鑫
8 月 28 日下午,没有发布会,没有预热海报,腾讯混元新一代大模型 Hy4 preview 悄无声息地上线了。官方定位很直接—— " 为生产力而生 "。
我们第一时间上手,在 WorkBuddy 中做了一系列实测。把结论放在最前面:Hy4 preview 不完美,价格不是最能打的,也出现了长思考延迟、preview 版本天生不稳定性等问题。
但在我们在测试了,长文档处理、代码生成、数据分析、游戏原型、科研阅读等功能过程中,它都呈现出经得起检验的实战表现。
腾讯没有选择做一个 " 全能但平庸 " 的通用模型,而是押注 " 生产力 " 这个垂直场景,这条路走得还算扎实。
Hy4 preview 还只是早期版本,如果正式版能补齐多模态、优化稳定性并保持价格竞争力,它有望成为 2026 年下半年开源大模型领域最能干活的选项之一。
模型不在大,能干活就行。Hy4 preview 正在用实测结果证明,它不是来凑热闹的。
一、参数与价格:账面数据漂亮,实测能不能打?
先看账面参数。770B 总参数、49B 激活参数(MoE 架构)、1M 上下文窗口。放在 2026 年 8 月的大模型市场,这个配置算不上 " 惊为天人 ",但绝对够看。尤其是上下文从 Hy3 的 200K 直接拉到 1M,翻了 5 倍。
定价方面,输入 6 元 / 百万 tokens,输出 18 元 / 百万 tokens,缓存命中只要 0.3 元 / 百万 tokens。价格比 DeepSeek V4 Pro 贵,但比 Kimi K3 和 Claude Opus 5 便宜,处在中游位置。
账面数据终究是数字。1M 上下文到底有没有注水?我们直接 " 暴力填塞 " 做了一轮实测。
下载《三体》三部曲完整 PDF 文件,再加上一份某科技公司 2025 年年报 PDF,约 93 万 token 的超长输入,一次性扔给 Hy4 preview。
提问很刁钻:" 罗辑在哪些章节提到过‘黑暗森林’?请列出至少 5 处具体段落,并对比年报中‘投资策略’部分是否有类似‘谨慎观察’的表述。"
结果有点意外。总生成时间约九分钟,这比我想象中快,原本以为这种量级要等二十分钟以上。更意外的是回答质量:它准确罗列了 8 处 " 黑暗森林 " 相关段落,而且精确到章节。
同时指出年报中没有 " 黑暗森林 " 这个词,而年报确实有与 " 谨慎观察 " 相近的措辞,逻辑上做了类比但没硬扯关系。最后还补了一句:" 年报更接近章北海式的‘前进’,而非罗辑式的‘藏好’ "。
总体来说 1M 上下文没有虚标,跨文档联合检索能力在线,缓存策略有效。不足的是,在实时交互场景下,生成时间仍有优化空间。
二、代码能力:从 28 分到 64 分,一次 " 暴力 " 跃迁
代码能力是 Hy4 preview 升级的重点,没有之一。官方数据显示:Terminal Bench 2.1 拿下 85.4 分,追平 Claude Opus 5;DeepSWE 从 Hy3 的 28.0 分直接翻倍到 64.3 分;163 名腾讯内部专家盲测,均分 2.99/4.00,压过 GLM 5.3(2.92)和 Kimi K3(2.94)。
数据好看,但我们更关心一件事:实际写出来的代码能不能用?
实测任务:生成一个带交互的待办事项 App
提示词很具体:" 用 HTML+CSS+JavaScript 生成一个完整的待办事项应用,支持添加、删除、标记完成;数据保存在 localStorage 中;Material Design 风格;有深色模式切换;代码要完整可运行。"
Hy4 preview 返回了三个文件(整合在一个 HTML 中),总计约 650 行代码。双击打开,添加待办、点击复选框标记、删除按钮移除条目、刷新页面数据、右上角一键切换深色模式,所有功能均跑得通。
有两个细节让我印象很深。第一是深色模式的配色方案,该方案不是简单的黑底白字反转,而是用了、、 这套灰蓝过渡,视觉舒适度很高,明显不是模板套用。第二是代码注释,每个函数都有中文说明和变量命名规范,这对后续维护很友好。
当然也有小问题。删除按钮没有二次确认,误触就直接删了;移动端适配略粗糙,在手机屏幕上按钮间距偏小。整体水平大约相当于一个中级前端工程师 30-40 分钟的工作量。
从 Hy3 到 Hy4 preview,代码生成能力的提升不是渐进式的,是肉眼可见的 " 跃迁 "。尤其是处理 " 完整可运行 " 这类复杂约束时,Hy3 经常丢三落四,要么忘了 localStorage,要么深色模式只改了一半,Hy4 preview 基本一次性给全。
三、办公与数据分析:一分半干完人工两小时的工作
办公场景是 Hy4 preview 定位的 " 生产力 " 核心。我们直接上真实工作流,不搞花架子。
实测任务:销售数据分析并生成 HTML 报告
提供一份模拟的 2026 年 Q2 销售数据 CSV(2800 行,字段:日期、地区、产品类别、销售额、订单量),同时上传一份 2026 年 Q1 的 PDF 版季度总结报告。任务有三条:分析 Q2 各地区的销售趋势;找出增长最快的产品类别;与 Q1 对比,生成带图表的 HTML 报告。
Hy4 preview 的处理流程很清晰:先用 Python 在 WorkBuddy 沙盒中读取 CSV,按地区汇总季度销售额、计算环比增长率。然后从 PDF 中提取 Q2 的关键数据:七地区 4 到 6 月全部正增长,618 红利全域共享。季内斜率最陡的是西北(+50.5%),最平缓的是华东(+32.8%)。最后生成一份完整的 HTML 报告,内嵌 Chart.js 绘制了柱状图和折线图。
报告质量在及格线以上。结论部分明确写道:"Q2 华东地区销售额环比增长 23.4%,主要驱动力来自智能家居品类,相比 Q1 该品类增长提速明显。" 图表配色专业、数据标注清晰,不是那种 " 丢一堆数字让你自己看 " 的半成品。
整个任务从上传文件到产出报告,总耗时约 1 分 13 秒。
抛开人工核验在不考虑异常值分析的因素下,但单论 " 数据清洗→汇总→可视化→报告生成 " 这个链条,Hy4 preview 的效率优势是碾压级的。
Hy4 preview 跨文档能力也比预期强。它能把 CSV 里的数字和 PDF 里的文字描述准确对应起来做对比,而不是各说各话。缺点是报告没有对异常值的深入分析,属于 " 能做初稿,但别指望直接交付 " 的水平。
四、游戏开发:一句话生成可玩原型,480 行代码直接跑
官方宣称 Hy4 preview 支持通过 MCP 接入 Unreal 与团结引擎,以纯对话从零生成可玩 Demo。我们手边没有 Unreal 环境,于是换了个更轻量的方式测试,让它在网页端生成 HTML5 小游戏,看看 " 一句话出原型 " 的极限在哪里。
实测任务:生成 3D 射击游戏
提示词:" 用 HTML 和 Three.js 生成一个 3D 第一人称射击游戏。鼠标控制视角旋转,WASD 控制移动,左键射击。场景中有随机移动的红色敌人,击中得 10 分,敌人碰到玩家扣一条命。共 3 条命,显示在屏幕左上角。所有代码在一个 HTML 中。"
Hy4 preview 生成了约 480 行代码,打开后在浏览器中直接运行。鼠标拖拽视角顺滑无卡顿,WASD 移动响应灵敏。射击命中判定用了 Three.js 的 Raycaster,点击左键时从相机中心发射射线,击中敌人后敌人分数加 8,同时新敌人在随机位置重生。敌人的移动逻辑是 " 随机游走 + 轻微趋向玩家 ",这个混合行为比纯随机更有挑战性,且代码中通过权重系数控制两种行为的比例,说明模型理解的是 " 行为设计 " 而非 " 背固定逻辑 "。
当然,上面测试效果离商业游戏还差得很远。尽管没有关卡设,没有复杂粒子特效,没有多角色支持,但作为一个原型验证工具,效果已经足够。
Hy4 preview 的价值不在于帮你做完整个游戏,而在于让非专业开发者(或者独立游戏开发者)能在 5 分钟内验证一个玩法创意是否 " 好玩 "。如果原型阶段都觉得没意思,那就不用往下做了。这种快速试错的能力,才是游戏开发场景下大模型最实在的用处。
五、科研能力:百年难题推进 2%?我们实测了论文阅读和公式推导
Hy4 preview 最令人意外的宣传点是:配合 Hyra 模型,在三维 Blaschke – Lebesgue 几何难题上将体积下界从 0.380799 推进至 0.41104,距离 Meissner 四面体猜想最终证明只剩约 2% 的差距。同时在分子动力学模拟中,对 32,512 原子体系实现了 2.0 倍提速。
这些我们无法复现,但可以测试它在日常科研辅助上的真实表现。
实测任务:阅读 arXiv 论文并解释创新点
选取一篇 2026 年 8 月刚发表的 " 图神经网络分子性质预测 " 论文。
将 PDF 全文输入(约 4 万 token),直接提问:" 这篇论文的核心创新是什么?与之前的 GNN 方法如 MPNN 相比改进在哪?实验用了哪些数据集?结果如何?"
Hy4 preview 在五分钟内给出了清晰回答:核心创新是 " 首个面向‘科研诚信’的 LLM 基准 ";三维解耦评测中,Q1 为不端行为分类、Q2 为伦理行动推理、Q3 是基于 JSON 研究工件的决策;总分范围 60.9 – 72.8,均值 68.7,模型间仅差 11.9 分,说明各家族的对齐方式收敛到了同一批失败模式。关键是它自动引用了论文中的表中的数据,而不是编造数字。我们后面用人工核对了一遍,准确无误。
追加一个数学题:∫₀ ^ ∞ e^ ( -x ² ) cos ( 2x ) dx,要求推导过程。Hy4 preview 给出了完整的复变函数法推导,步骤清晰,最终结果√ π /2 * e^ ( -1 ) ,完全正确。
还提供了结论总结以及相对应的图表。
整体来说,虽然离 " 证明百年猜想 " 还有十万八千里,但作为科研助手,处理日常论文摘要、公式推导、文献对比已经足够实用。尤其是不需要额外训练就能直接理解 arXiv PDF 的格式,省去了手动复制粘贴的麻烦。
六、不足与争议:实测中遇到的 " 翻车 " 时刻
夸了这么多,说点实在的不足,都是实测中亲眼见到的。
第一," 过度思考 " 问题。 让它分析快速排序在特定数据分布下的时间复杂度变体,它反复 " 思考 " 了约半个小时,中间输出 3 次 " 让我再确认一下 " 的中间状态,最终答案正确但等待体验很差。在需要快速交互的场景下,这种 " 自我验证 " 倾向会打断思路。
第二,稳定性有待加强。在 Workbuddy 并发调用多个任务,有两次返回超时,一次次生成中断(只输出了前半段代码)。作为生产力工具,这种不稳定在关键生产环境可能会造成事故。
(本文基于 Hy4 preview 发布首日的独立实测,数据截至 2026 年 8 月 28 日。模型持续迭代中,实测结果仅供参考。)
微信号|TMTweb
公众号|光子星球
别忘了扫码关注我们!
