让AI打游戏不新鲜,但把吃豆人当成考卷,专门测"临场反应",这事有点意思。提供AI接口服务的Opper公开了一个叫jevman的基准测试,规则很直接:让AI玩吃豆人。
它测的不是谁分数高那么简单。同一款游戏,6种AI模型各玩100次,然后横向比三件事:拿到多少分、做判断有多快、跑起来花多少钱。
![]()
为什么是吃豆人
![]()
吃豆人这类游戏,每一步都得在极短时间内决定往哪走。幽灵在动,路线在变,犹豫一下就被堵死。用它来考AI,考的是"当下这一秒怎么选",而不是慢慢想一道大题。
所以jevman盯的是"素早い判断"——快速判断。分数只是结果,判断速度和执行成本才是它想拉开差距的地方。
三项指标一起看
![]()
把得分、速度、成本放在同一张表里比,逻辑就清楚了:
- 得分:AI在游戏里实际拿到多少分
- 判断速度:每次决策有多快
- 执行成本:跑完这些局要花多少钱
三者叠加,比的就不只是"谁聪明",而是谁在真实场景里又快又省。对要落地AI的团队来说,这个组合比单看跑分更接近实际选择。
目前公开的信息就到这里:一个吃豆人基准,6款模型,各100局,三项指标。至于谁赢谁输,还得看完整结果。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.