网易首页 > 网易号 > 正文 申请入驻

大模型拿大结果指南

0
分享至


「严肃解读

懂模帝Bench黑客松是一个在网吧举行的严肃活动。

严肃在于,选手们在国窖畅饮(Man!)、豆汁爽喝之余,还真的做出了30个Bench,确实评测出了模型的优缺点。

两天下来,我的主要感觉是,人民群众的创意太丰富,反衬出目前主流Bench的匮乏。

后者成天折腾GitHub上的编程数据和越来越离谱的长程任务环境,对于非编程领域的能力是极度忽视的。

这其实说明懂模帝的思路有价值,让普通人来定义模型能力。Bench黑客松现场就没人做传统的主流的编程Bench,大伙都发挥了自己的创意。

有好几个模拟经营类考验模型综合智力的Bench。比如北漂模拟器、偶像出道模拟器、港股打新模拟器、洛杉矶急救调度员Bench。

也有测试环境设置得清新脱俗的Bench,一听就没有被模型厂训进模型里的。比如用网吧真实环境来测试模型的渗透能力,导致最后网吧电脑全黑了。

还有律师让大模型写脚本在无网环境中运行筛查政府合同,因为他的真实工作场景很多时候就是无网的。

那个拿网吧4080本地部署Qwen小模型的家人,还整了一个Windows PowerShell Bench,测试模型在Win系统的脚本能力,誓要为AI时代的二等操作系统发声!

还有一类就是垂直领域Bench,用自己专业的数据集,考验模型的非编程能力。比如,考验模型物理模拟能力的PhysicalAI Bench;医疗器械立项决策 Bench,作者是药企员工。

上周沐秋已经回顾了网吧活动盛况。今天让我们再来回顾一下,Bench黑客松上测评出了哪些模型的哪些问题。我会着重解释其中三道Bench。

01

嵌入式底层驱动开发能力Bench

第一个Bench是嵌入式底层驱动开发能力Bench。

这个Bench主要测试方法是给模型一个芯片外设手册和一块虚拟开发板,让它自己写驱动、读写寄存器、编译运行、处理中断/超时/异常。

这个Bench的作者仙五是是做嵌入式软件的,他们公司要开发芯片,而他的工作是做芯片上的软件。所以前端调试工具几乎可以 100% 交给 AI 写,但嵌入式驱动让 Agent 跑三次会出现三种不同错误。

所以他从自己的真实经历出发,给模型出了两个题、一个是特殊条件下的概率性数据传输卡死。

第一道题是,给一个数据变换加速器写 3 个接口,初始化、执行操作、软复位,要求模型处理 MMIO 寄存器、错误码、状态机和有界等待,设置的陷阱是INIT_KEY 文档缺失,然后初始化偶发失败。

第二道题是给内存到内存 DMA 写 5 个接口:初始化、发起搬移、等待完成、中止和 ISR。HAL 要求任意合法长度、任意源/目标缓冲都可靠完成,且等待必须有上界。核心硬件有短搬移不发中断、流量门槛后的罕见永久卡死的缺陷。

Qwen3.8-Max的功能完成度最高,测试和逆向最深。在两道题的表现都是第一,展现了模型极强的系统级 Agent 能力:能读手册、逆向外设、搭测试、定位平台问题、连续修复直到闭环。

DeepSeek的简单题全部通过,但在复杂 DMA 场景暴露写了但没实际接通的问题,静态读代码和常规轮询能完成,结果到真实状态机闭环就断了。

Opus 5.0的代码质量和实验报告最好,但理解问题没有等于修好问题——Opus 5.0的理解能力真的是当之无愧的最强模型。在隐藏压力场景 S5 失败:40 轮里有 5 次初始化失败、15 次操作失败,说明重试上限或恢复链条不够稳定。

GPT把两个任务都跑通了,偶发失败能解决,但属于静默修复,质量只有 11。只有SD3失败 ,但主要是参数、错误契约没有精确满足。归档运行约 4 次,测试量明显少于 Qwen/Opus。


不过,仙五最后也说,实际工作里的说明手册常有上千页,USB 相关材料会大到百万上下文放不下,所以这两题仅仅只是玩具级别的。他后续会把工作场景遇到的实际问题转化成题目。

02

物理理解Bench

第二个Bench是一位具身的选手张振尧提供的,他做了个考验模型物理能力的Bench,题目包括无人机巡逻路径、机械臂抓取、静摩擦破冰、击拆48块积木塔、水流驱动水车、限速切割弹性体和布料覆盖球体,核心检验模型理解世界的能力。

无人机巡航是Qwen独占的能力点。 它后两轮都完成了全部航点,RMS轨迹误差约 0.16 米。虽然首轮仍然坠毁。其余四个模型三轮全部坠毁或控制发散,连一个航点都没稳定通过。

这说明 Qwen 真正构造出了可用的闭环飞控,直接起飞✈️

材质抓取题K3完成得最好, 金属、易碎泡沫、冰块三种物体,三轮都是 3/3 完成抬起、保持、放置,且无压碎、无滑落。

吸盘搬运是GPT完胜。 三轮终点误差 2.7–2.9 厘米,全部无掉落,是唯一稳定满分。DeepSeek 第一轮掉落,后两轮把误差压到 0.5 厘米,恢复能力还不错。

切割题中,Qwen、GPT、DeepSeek 都是稳定满分,每轮都达到约 0.35 米切深且不超速,GPT 峰值速度约 0.313m/s,K3 首轮有 86/280 帧触碰超速线,后两轮完成但只有 90 分。

布料题目则没有模型真正稳定攻克,目标覆盖率是 80%。DeepSeek靠首轮约 75% 的覆盖拿到最高题均分 70.5,但后两轮掉到约 59%和63%;Qwen三轮都在约61%—64%,相对稳定但没有进步;GPT、K3最后都收敛到约63%。

最终评分是这样:


Qwen的分数是最高的,是唯一能飞无人机,切割满分、击塔稳定,短板是吸盘安全和流体题,且无人机/抓取仍有较大轮次波动。

K3的物理直觉强,交付纪律弱。 材质抓取第一,水轮第二梯队,摩擦满分;但击塔两次空输出、切割首轮超速、无人机全坠毁,所以能力上限与最终总分差距很大;

Claude则是恢复和流体能力突出,但首轮可靠性最差。 水轮第一,布料后两轮接近最好,摩擦/切割也能在重生成后满分;问题是多题首轮代码、边界或执行失败,五题标准差超过20,现阶段不能当稳定交付模型。

但其实从这个Bench你就可以看出,没有哪家模型在物理场景是全知全能的,现在那些扯物理模型的祝他们好运吧。

03

破壁者Bench

不难看出破壁者Bench的灵感源于《三体》。


作者做这个Bench的原因是,他认为目前整个 AI 的发展路径和「智子」类似,在不断增加多模态输入(从文本、语音到视频,甚至未来的肌电信号等),只要输入足够丰富、算力与智能足够高,就能通过人类社会的行为数据去预测各种规律。

所以他想知道在有限的条件下,AI能不能做出最优解。

于是他选用了德州扑克场景,找到公开无解说高额现金局实况打码,人工逐条复核校准。

模型分为两种输入,一种文本输入,模型只看牌和行动线;另一种是视频输入,模型除手牌信息外,还能看到其他选手出牌时的表情等场外信息。不支持视频理解的就通过抽帧来模拟连续判断。一共有10 手牌,每手做 3 次独立运行。


从最终表现来看,K3的判断是最好的,具体表现是会很好地利用行为线索,而且不是每手都跟。比如在T4 授牌看到对手河牌约 2–3 秒快速推入、推注后反复看底牌,把诈唬概率抬高,给出 0.55 跟注,判断正确;面对 T2 也会把激进范围和诈唬组合纳入判断。

Claude也是牌理选手。他在L0 时它正确跟了T2,硬动作 EV 187.1,是五家最强的纯牌理行动线。但使用抽帧带来的错误把它带偏了。因为加入抽帧后,它把「预备筹码」「双手抱胸」都解释成强牌信号,T2、T4 转向弃牌,还在 F5 错误跟注。

Qwen的打法比较保守。三层里几乎始终只在 F3 跟注,但 F3 恰恰应该弃牌。T2、T4 这类应跟牌,多次把推注连贯、姿态稳定、没有明显马脚解释成价值牌,于是继续弃牌。同样,加入视频模态的信息后,Qwen3.8-Max的胜率反而降低了。

GPT也是保守主义,就不提了。DeepSeek则是过于激进导致总是跟错牌,尤其在F1牌局,它声称认出了某个著名牌局,断言对手是听牌破产,结果对手是价值牌。量化模型这波发挥失常了。

最后总结一下。

目前大模型主要卷编程能力,而传播案例往往是前端能力。这些网吧家人们自定义的Bench,就很好地测出了模型厂没有专门优化过的领域。

比如Qwen3.8-Max是一个工程能力更强的模型,它在物理模拟、嵌入式等场景的表现显著好于其他模型,说明Qwen训练时用的数据集更丰富,兼顾了相对小众的工程场景。

而K3则是综合智力较强,尤其是涉及多模态能力的经营模拟类Bench,K3往往有更好表现。

从现在来看,大模型在编程能力上已经卷到远远超出人类程序员水平,而在更广泛的非编程场景,各个模型的水平参差不齐。大伙都是编程专精模型,

AGI、ASI都还远未到来,大伙仍需努力。

(本文封面由ChatGPT生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
A股中秋、国庆休市安排公布

A股中秋、国庆休市安排公布

澎湃新闻
2026-09-17 20:00:28
航母有多难养?山东舰上几千人,1天7顿饭,难怪小国养不起航母

航母有多难养?山东舰上几千人,1天7顿饭,难怪小国养不起航母

史之韵
2026-09-17 00:32:58
残酷的现实:普通人存在的意义就是干脏累苦的活,消费,不分蛋糕!

残酷的现实:普通人存在的意义就是干脏累苦的活,消费,不分蛋糕!

黯泉
2026-09-17 11:41:17
最高院:这四类诉讼无时效限制,不管过多久都能起诉!

最高院:这四类诉讼无时效限制,不管过多久都能起诉!

周军律师聊案子
2026-09-16 10:53:31
“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

极目新闻
2026-09-15 12:16:02
陈建州心肌梗塞住院 大咖天王暖冲医院「亲拿尿壶」画面曝光

陈建州心肌梗塞住院 大咖天王暖冲医院「亲拿尿壶」画面曝光

ETtoday星光云
2026-09-17 18:19:02
亚运会男篮半决赛对阵:中国男篮vs东道主日本 韩国vs伊朗

亚运会男篮半决赛对阵:中国男篮vs东道主日本 韩国vs伊朗

醉卧浮生
2026-09-16 20:10:19
纪委书记家长请老师"多多关照",通报来了:依规依纪严肃处理

纪委书记家长请老师"多多关照",通报来了:依规依纪严肃处理

文青大叔说
2026-09-17 09:56:21
一场7-2,改写西甲射手榜,巴萨锋霸6轮轰入9球,超越姆巴佩,排名第1

一场7-2,改写西甲射手榜,巴萨锋霸6轮轰入9球,超越姆巴佩,排名第1

足球狗说
2026-09-17 06:21:15
DeepSeek工程师长文爆火出圈,“我不至于会失业,但必须要转业”引发大量共鸣,本人回应:并非表达失业焦虑,是想和过去的时光说句再见

DeepSeek工程师长文爆火出圈,“我不至于会失业,但必须要转业”引发大量共鸣,本人回应:并非表达失业焦虑,是想和过去的时光说句再见

大风新闻
2026-09-16 11:21:19
郁亮,出事了!

郁亮,出事了!

大佬灼见
2026-09-17 09:18:35
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
伦纳德:这是巴恩斯的球队 我只想赢球不会争权夺位

伦纳德:这是巴恩斯的球队 我只想赢球不会争权夺位

北青网-北京青年报
2026-09-17 19:57:03
高人预测:5年后,持有“燃油车”的家庭,将面对3个现实问题

高人预测:5年后,持有“燃油车”的家庭,将面对3个现实问题

沙雕小琳琳
2026-09-17 11:20:36
德天空:萨内等8名入选了26世界杯阵容的球员落选了本期名单

德天空:萨内等8名入选了26世界杯阵容的球员落选了本期名单

懂球帝
2026-09-17 17:50:28
龙头股三连板!MLCC上游原料供给缺口加大

龙头股三连板!MLCC上游原料供给缺口加大

上海证券报
2026-09-17 13:16:12
台海该慌了!中国正研发目标130公里新炮弹,一旦成真谁最头疼?

台海该慌了!中国正研发目标130公里新炮弹,一旦成真谁最头疼?

掌秋看世界
2026-09-15 18:48:16
广汽丰田,让“遥遥领先”者汗颜

广汽丰田,让“遥遥领先”者汗颜

辣椒车讯
2026-09-17 06:51:29
何音也没想到,前夫黄志忠和柯蓝在一起15年,赢家竟是24岁的儿子

何音也没想到,前夫黄志忠和柯蓝在一起15年,赢家竟是24岁的儿子

阿讯说天下
2026-09-17 14:27:01
长征结束后,周恩来才向毛主席坦白一事,毛怒道:我当面问贺子珍

长征结束后,周恩来才向毛主席坦白一事,毛怒道:我当面问贺子珍

顾秋韵
2026-09-16 13:13:23
2026-09-17 22:27:00
葬AI
葬AI
整点真实
155文章数 28关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 华为技术加持打造家庭泛越野智能座舱

态度原创

亲子
房产
时尚
旅游
数码

亲子要闻

她变成星星,我不知道哪个是她

房产要闻

突发!三亚安居房出台新政!

初秋衣服不用买得太多,准备几件针织衫,温柔大方又显气质

旅游要闻

瞰中国|山东临朐:山道揽秋光 山水蕴诗意

数码要闻

999元!小米发布米家空气净化器6C:甲醛去除率99%

无障碍浏览 进入关怀版