智猩猩AI整理
编辑: 没方
前天,有网友在 X 上喊话腾讯:“我已经准备好迎接 Hy4 了。”
腾讯官方只回了一句:“sooner than you think ”
![]()
还真没让大家等多久。
刚刚,腾讯混元Hy4-Preview 直接开源了,模型权重已经上线 Hugging Face。
![]()
值得注意的是,这次发布的还只是 Preview 版本,但从腾讯公布的信息来看,Hy4 已经是一次相当明显的“大模型化”升级。
Hy4-Preview 采用 MoE 架构,总参数规模达到 770B,激活参数约 49B,同时支持最高 100万 Token 上下文。
相比 Hy3,这一代不只是参数变大了,腾讯重点强化的方向也非常明确:真实生产力任务、复杂推理、长上下文以及 Agent 能力。
从官方提供的评估结果可以看出, Hy4-Preview 的智能水平大幅提升,稳居开源模型第一梯队。
![]()
01
163名专家盲测,实际工程任务
略胜GLM-5.3和Kimi K3
腾讯这次一个比较值得关注的评测,不是传统 Benchmark,而是直接找人做真实任务盲测。
他们组织了163 名内部专家,针对203 个工程类任务,对 Hy4-Preview、GLM-5.3 和 Kimi K3 的输出进行了匿名对比评价。
![]()
最终 Hy4-Preview 的平均得分为2.99/4。GLM-5.3 为2.92/4,Kimi K3 为2.94/4。
在和 GLM-5.3 的直接对比中,Hy4-Preview 的胜率约为46.8%,平局 12.8%,负率 40.4%;和 Kimi K3 对比时,胜率达到51.2%。
这里其实能看出腾讯对 Hy4 的定位。它并没有只强调“某个 Benchmark 第一”,而是反复把重点放在实际工程和生产力场景上。
这和 Hy3 的路线是一脉相承的。
腾讯此前就曾表示,Hy3 的性能提升最明显的地方之一,就是 Agent、长上下文以及 Coding、Office、金融建模和前端开发等真实任务。
Hy4 会继续沿着这条路线往上走。
02
模型定价
定价延续高性价比路线。
输入 6 元/百万 tokens、输出 18 元/百万 tokens、命中缓存 0.3 元/百万 tokens。
模型已同步上线腾讯云 TokenHub 与 OpenRouter,WorkBuddy、CodeBuddy、元宝、ima 等产品已接入。
![]()
03
不只是写代码,
Hy4还在往科研推理上走
Hy4-Preview 这次还有一个比较有意思的信号,就是腾讯开始更明显地强调模型在科学研究任务上的能力。
![]()
从官方披露的案例来看,Hy4 已经被用于AI 研发、分子动力学模拟、凝聚态物理、基础数学等等科学问题。
腾讯正在尝试把大模型从 Coding 和办公任务继续推向更复杂的 Research 场景。
它开始试图覆盖一条更长的能力链:
理解复杂问题 → 长程推理 → 调用工具 → 反复验证 → 完成实际任务。
这也是现在旗舰模型越来越明显的竞争方向。
04
总结
Hy4 preview 定位为 Hy4 迭代的早期版本,意图沿袭 Hy3 preview 路线。通过快速发布收集广泛真实反馈,反哺 Hy4 正式版。
对开发者而言,这是一次低成本实测国产旗舰 Agent 能力、并参与到正式版打磨中的窗口期。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.