★ 设为星标 | 只讲人话,带你玩转AIGC。
这两周国产模型圈有点疯狂,智谱、 DeepSeek、阿里齐发。
今天全网都在吃孙割的瓜,腾讯 Hy4 preview 开源的事几乎完全被淹没了。(话说咱就不能另挑一个时间?)
我研究了一下官方给的 Benchmark,发现 Hy4 还是挺能打的。
相比上一代 Hy3,各类指标都有明显提升,综合表现进入国内第一梯队,部分代码和办公 Agent 能力甚至还超过了 GPT 5.6 Sol。
不过跑分不是我最在意的,真正能干活才是王道,所以跑分这部分我放到最后说。
我最先看的是那个财务报销的 Demo。
在官方演示里,Hy4 要审核 24 份报销申请。它要翻政策文件(多个)、花名册、预算表、发票台账和邮件往来,再逐份给出处理意见。
财务应该很熟悉这种活。
这个我深有体会,就拿我以前公司来说,一张报销单提交后需要直属领导审批,部门复核,财务再审。
如果是出差报销,发票日期和行程单差一天或者差旅超标,材料就得全部退回来,补完再交。有时候钱不多,流程一点没少。
Hy4 一次翻几十份文件,至少在演示里,它能把散落在不同文件里的规定和数字对起来。快速的查出异常线索,最后让财务确认。
这样的活之前都是财务小姐姐一张张发票、一个个文件去对,真的非常繁琐又枯燥,我挺同情她们的。
但对报销的人来说也很不爽,因为流程太慢,打款也就更慢。
这样的活,确实应该让 AI 来干了!
顺手还做了网站和游戏
Hy4 用 Three.js 做了一个中国古建筑数字卷宗网站。
宣纸背景、宋体字、靛蓝点缀,细线分割。整体非常符合中式审美,感觉放在文旅行业挺适合。
现在让很多模型写一个网页,它很容易给你黑色背景、要么就是科技蓝、赛博朋克,看了真的反胃。
Hy4 这个官方案例看起来好很多,提示词用对了,遵循也到位。
审美有时候挺玄学的。代码能不能跑,有测试可以验;页面好不好看,很多时候连人都说不清楚。
Hy4 给的几个 Demo 当然还不能证明它以后做什么都好看,但至少发布团队已经开始拿视觉质量当模型能力讲了,而且放在首要位置,看来他们蛮有信心的。
游戏 Demo 里面有一个 FPS 射击游戏,感觉效果非常逼真。
Hy4 通过 MCP 接入 Unreal Engine 5,只靠对话从零开始做了场景、玩法和关卡。
单看演示,完成度已经很像一款成熟的射击游戏了,画面、战斗和关卡都有模有样,我看完甚至想进去玩两把。
当然,Demo 距离正式游戏还有多远,光靠一段视频看不出来。但能把 AI 生成的游戏做到让人产生“想玩”的冲动,已经挺难得了。
不得不说,腾讯的游戏基因还是强。
我觉得有趣的是 Codex 那段
腾讯还放了一段科研实验。
Hy4 同时管理多个 Codex session。它看实验结果,决定下一轮往哪走,再把任务分给不同的 Codex。跑完以后继续看,再改。
在那项小模型后训练任务里,腾讯说这种做法在 8 项评测上都超过了 Codex 独立探索。
![]()
测试是腾讯做的,实验细节也没有完全公开,这里当然不能就说 Hy4 比 Codex 还强。
我在意的是分工。
Codex 负责写代码、跑实验。Hy4 负责看结果,决定接下来试什么。
以前我把 AI 当执行工具看。人下命令,AI 去做。现在中间多出了一层,AI 开始指派 AI 了?
看上去很像项目里常见的场景:负责人自己不写每一行代码,他盯结果,发现一个方案不行,就让几个人分头试。
只不过现在负责干活的是 Codex,负责分活的也是模型。
其实这个实现我没看明白他们想表达什么?
腾讯还让 Hy4 参与优化自己的推理系统。它检查性能瓶颈,试算子融合和通信优化,最后把端到端吞吐量提高了 31.8%。
“AI 自我进化”这个词最近很流行,感觉在每家大模型公司都在这么用。
跑分超级能打
回到跑分。
Hy4 相比 Hy3 提升很明显,综合表现已经进入国内第一梯队。
代码能力是 Hy4 提升最明显的部分。
SWE-bench Pro 和 DeepSWE 都是用来测试真实代码库里的长期开发任的。前一项比 Hy3 提升约 13%,国内最强不说,它甚至略高于 GPT 5.6 Sol。
DeepSWE 提升约 130%,直接翻了一倍多,不过它还是把 GLM 5.3 和 Kimi K3 差一点。
CyberGym 测漏洞分析和 PoC 生成,提升约 51%,单这一项 GLM 5.3 大爆发,处于遥遥领先的地位。
![]()
办公方面,OfficeQA Pro 测多份财务文件的查找、计算和问答。Hy4 提升约 22%,并列国内最高,接近 Claude Opus 5。
GDPval-AA 测 44 种职业里的真实工作成果,Hy4 已经追到 GPT 5.6 Sol 附近。
AutomationBench 测跨 CRM、邮箱、日历等软件的自动化流程,Hy4 接近翻倍,不过仍然落后于几款头部模型。
现在大家都在疯狂卷办公智能体,所以这几个指标还是非常关键的。
推理部分,CritPt 测研究级物理问题,Hy4 提升约 245%,涨得很猛,但距离 GPT 和 Claude 仍然不小。
GPQA Diamond 测研究生水平的科学问题,Hy4 只提高约 2%,但已经和 GPT、Claude 处在同一档。
综合来说,Hy4 的代码和办公能力已经很强。复杂自动化和研究级物理,暂时还追不上最前面的模型。
这周模型有点多
周三(8 月 26 日),智谱开放 GLM-5.3-Flash,320B 总参数,18B 激活。
阿里同一天开放 Qwen3.8-Flash-Next 的权重。
今天(8 月 28 日),腾讯发 Hy4 preview。
智谱和阿里的重点很明确,少激活一些参数,把推理价格打下去。特别是 GLM-5.3-Flash,以 GLM-5.2 十分之一的价格,做到了接近 Claude Opus 4.8 的编程和 Agent 能力。
新的斩杀线又来了。
![]()
腾讯可能主打一个生产力,所以把办公、游戏和科研 Demo 都放了出来。
价格上,Hy4 并没有什么优势。
国内 API 输入 6 元每百万 tokens,输出 18 元,缓存命中 0.3 元。按国际价格对比,Hy4 的输入输出大概是同期两款 Flash 模型的 5 倍。
这个差价只能靠任务效果补,但不知道实际的效果会怎么样。
Hy4 preview 已经同步上线 WorkBuddy、CodeBuddy 等。现在还提供两周限时免费体验,可以去试试看如何。
![]()
腾讯内部也做了一轮盲评。163 名专家、203 个工程任务,Hy4 preview 平均 2.99 分,略高于 GLM-5.3 的 2.92 和 Kimi K3 的 2.94。
不过这是腾讯自己的测试,Artificial Analysis 等第三方结果还没出来,先当参考看。
最后我想说
写到这里,我回顾了一下最近发布的那些国产模型。
Kimi K3 把参数规模推到 2.8 万亿,原生多模态、100 万上下文,重点攻长程编程和 Agent 任务,一下子震撼了整个业界,被称为第二个“DeepSeek 时刻”。
不久之后,GLM-5.3 卷土重来,不扩大参数规模仅靠后训练直接杀入第一梯队。GLM-5.3-Flash 又把成本压到了很低,甚至取代 DeepSeek 成了新的斩杀线。
Qwen3.8-27B 更夸张。官方公布的多项编程、办公和多模态测试已经达到或超过 Opus 4.6。模型量化后,一张 32GB 的 RTX 5090 就能跑起来。
尽管都很卷,但很明显这几家都让人印象深刻,都有一个让人记得住的理由。
再看 Hy4,我似乎暂时没找到那个能让人留下深刻印象的点,跑分也没有拉开明显的距离。
腾讯能打的牌,可能是 WorkBuddy、CodeBuddy 这些产品入口,但 Workbuddy 里面各家模型都能选,用户为什么一定要选 Hy4?
这个问题,可能要等正式版来回答。
参考:https://hy.tencent.ai/research/hy4-preview
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.