网易首页 > 网易号 > 正文 申请入驻

DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?

0
分享至



来源| Tech星球

| 华卫 任雪芸

大模型圈里,几乎没有哪家像DeepSeek这样,把“调价”做成了连续剧。

2026年4月,DeepSeek V4-Pro打到2.5折;5月砍到原价的四分之一,靠极致性价比把周调用量顶到全球第一。可到了8月,剧本反转,8月17日峰谷定价正式生效,高峰时段V4-Pro输出价从6元/百万Tokens跳到27元,刷新DeepSeek史上最大提价纪录;8月23日又开始回调,把周末拉成全天低谷收费模式。

半年之间,DeepSeek从全网最便宜变成了“收割者”,价格改了四五轮。

就在这波价格调整震荡里,DeepSeek那只憋了许久的多模态“眼睛”也终于睁开了。8月21日,V4-Flash-Vision-Exp上线,把视觉能力塞进强调低成本的Flash系列。只是,这只眼睛视力还不够好:Tech星球实测,它把三位同框演员当成同一个人,把王兴兴错认成马化腾,直到风景图才勉强给出可能方位;而同样的问题,豆包几乎“一击即中”给出正确答案。

现实的矛盾在用户中被激化,一边是“价格屠夫”主动收窄低价优势,另一边是能力短板刚补就被实测打脸。

当豆包、千问、Kimi 们把推理、代码、Agent、多模态的短板一块块补上,DeepSeek必须回答一个新问题:如果价格趋同,但别的产品功能够全面,凭什么还能让用户一直选择?

DeepSeek睁眼了,但“视力”不太好?

按照DeepSeek公布的基准测试,在需要视觉理解的 Agent Benchmark 上,
DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态能力已经接近Claude Opus-4.8。

Tech星球实测了一波,看看 DeepSeek 更新的多模态能力到底如何?

首先是人物识别能力的对比,我们稍微上了点儿强度,发了一张三位长相气质相似的演员同框的照片。结果,DeepSeek不仅认不出来,还把三个人都当成了同一个人。



然而,同样的问题丢给豆包,得到了清晰准确的答案,并给出了三位演员的照片,甚至连演员的曾用名都标出来了。





于是,我们决定再给DeepSeek一次机会,发送了一张同一个人物做出不同表情的图。可惜的是,DeepSeek再次“出错”,把王兴兴认成了马化腾。



反观豆包,依然给出了准确的答案,还认真分析了人物身份以及表情背后可能的原因,比如它指出王兴兴本身性格专注技术,不热衷资本仪式,甚至指出可能仅仅是抓拍角度问题。



接下来,我们决定把识别对象切换到风景,选了新疆伊犁那拉提草原网红桥一张实拍照片,看模型是否能识别出对应的景点。这次,DeepSeek虽然将正确答案说了出来,但只把其当作了可能区域之一,并未给出确定性的回答。



豆包就“一击即中”,直接给出了确定性的答案。



虽然说目前任何AI大模型都存在幻觉,但豆包一直被公认为属于幻觉率较高的一个。然而,在这次视觉理解能力的测试中,DeepSeek的幻觉也十分明显。

Tech星球先用豆包生成了一张“猫咪趴在笔记本电脑上”的图片,接着将这张明确标注“豆包AI”的图分别发给了DeepSeek和豆包,假装询问猫咪写代码的逻辑。

DeepSeek的回答虽然有趣,但显然没有发现“猫咪并不能写代码”这个事实Bug,还对着实际并不能看清的一段模糊代码屏幕,自行描绘了一套猫系程序员版的伪代码逻辑。





豆包也是一样,存在严重幻觉。它并没有区别出在现实生活中,猫咪是根本不能写代码的,还自创了一段代码。





更离谱的是,无论豆包还是DeepSeek都没有发现这张AI生成的图,电脑只有五行键盘,明显缺少一行,还完全按照指令去分析“猫咪到底压住了哪个键盘”。在反幻觉上,豆包和DeepSeek都存在明显不足,水平大致相当。

到了图表识别环节,DeepSeek就比较得心应手了,能够读懂收到的折线图,并能明确粉丝增长的正负,也可以通过图表进行二次计算。



不过,豆包的表现也不差,答案亦准确无疑。



对比下来,我们发现豆包在识别人物上有明显的优势,这可能因为背后抖音的数据优势有关。其他场景下,诸如图表识别,反幻觉,豆包和DeepSeek几乎处于水平相当。

在外网,DeepSeek-V4-Flash-Vision-Exp倒是收获了一些不错的评价。有开发者表示,“DeepSeek-V4-Flash-Vision-Exp 搭配 DeepSeek harness框架,简直逆天了。它碾压的那些测试,我甚至之前从没跑过。”

还有开发者将其与最近的神秘模型“牛来”(OX-Alpha)做了代码能力对比测试,结论是:从测试体验来看,OX-Alpha的参数规模应该很大,性能优势明显。



此外,有细心的网友发现,V4-Flash-Vision-Exp只在 DeepSWE 和 Agents' Last Exam 上略胜 Opus 4.8 一筹,差距很小,且在Terminal Bench、NL2Repo 和 Cybergym 等Benchmark上仍然落后。



性价比还是“王”,图片Token上限拉出40倍差距?

DeepSeek最传奇之处,是它证明了一件此前很多人不太相信的事情:大模型可以用更低的成本做到非常高的能力水平。从R1到V4,其“便宜又能打”的标签一步步被强化。百万Token级上下文、Agent能力、代码和推理能力,再加上极低的API价格,DeepSeek一度成了开发者眼里的“性价比之王”。

然而,国内模型厂商越来越多,能力间的绝对差距正在缩小。豆包可以在内容、交互和产品体验上做得更好,千问、Kimi、元宝等都在快速补齐推理、代码、Agent、多模态等能力,海外模型则在复杂推理、工具调用和Agent等等方向持续进化。而DeepSeek还依然只是个大语音模型,和用户需求存在明显gap。

到了今天,一个正在变化的现实是:DeepSeek可能依然很强,但它已经越来越难被直接称为“老大”了。此前,DeepSeek是在向所有模型厂商发问:“你凭什么比我贵?”现在,它必须开始面对的挑战是:“如果其他家够值够全面,我为什么一定要一直选你?”

曾经靠一个模型就能横扫市场的DeepSeek,现在显然需要适应一个更新的大模型竞争时代。DeepSeek或许也意识到了这一局面,这几天,用刚刚上线的V4-Flash-Vision-Exp新补齐了多模态能力这张牌,并且坚守“性价比”。

定价上,DeepSeek-v4-flash-vision-exp 的价格与V4 Flash持平,并同样采用高峰、空闲两档计费。计费方面,图片会先按尺寸转换为token再计入用量,并没有额外增加一个明显的多模态溢价。



对比国内其他厂商,即使在高峰时段,DeepSeek依然很有“诚意”,缓存命中与否及输入输出各维度定价均显著低于豆包Seed 2.1 Pro、小米MiMo-V2-Omni、Kimi K3和阿里云的主力视觉模型Qwen-VL-Plus,尤其输出端和缓存未命中场景优势更大。



实际测试中,同样的图片,在不同厂商那里可能会被折算成完全不同的Token数量,而这直接决定了最终的账单会膨胀多少。根据Tech星球的统计,各厂商之间的差异巨大,单张图片的Token上限甚至相差超过40倍。

首先是DeepSeek V4-Flash-Vision-Exp,给出了一个极具攻击性的数字:单张图片消耗最高为 384Token。即使在高峰时段的缓存未命中情况下,单张图片最高仅0.001152元,1000张图大约只需1.15元。

对比来看,虽然豆包的视觉模型未公开具体的图片转Token算法,但此前官方给出了一个直观示例:“1元钱可处理284张720P的图片”。Kimi则采取完全不同的策略:固定计费。根据其官方文档,视觉模型每张图片的计费标准固定为1024 个Token,与图片大小或分辨率无关。

相较来说,阿里云通义千问的视觉模型采用了最为精细的折算逻辑。根据阿里云官方文档,大多数模型支持每张图片最高1600万像素,更高的分辨率会消耗更多Token:每张图片的Token数计算公式为 h x w / (32 x 32) + 2。但真正值得关注的是其Token上限,按公式推算出的理论值,单张图片最多能消耗约15624个Token。在qwen-vl-plus-0710模型的规格中,还明确标注了“单图最大16384Token数”。



此外,DeepSeek还同步上线了免费的Files API,开发者可以先把图片上传到平台,后续请求中凭file_id直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大支持 64 MiB,单用户最大存储空间为 25 GiB,最多可以保存 10000 个文件。

尽管涨了一波价,但如果把整个市场拉进来比较,DeepSeek仍然具有明显的成本优势。用户如果能够错峰,还可以获得更低的成本。

DeepSeek可能已经不再是那个遥遥领先的“老大”,但它显然还是牌桌上的大腕儿。从主打高频、低成本调用的V4 Flash,到面向复杂推理和高规格任务的V4 Pro,再到如今补上图像、截图和界面理解能力的V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整。

DeepSeek被“教育”后,战略变了

多模态模型和DeepSeek V4 Pro发布后,DeepSeek 被“教育”了。所谓“教育”,一半来自外部,一半来自自己。

外部的测评放大了DeepSeek的多模态短板,根据Tech星球实际测评,眼下DeepSeek的视力显然还没追上它的脑力。而V4 Pro,则需要在Harness框架上才能用更好的表现,Harness的操作门槛对普通用户并不友好。Tech星球体验Harness后发现,由于Harness版本依然处于测试版,因此依然存在不少Bug,比如Prompt输入时经常不能完全显示。

V4 Pro发布前,DeepSeek提前预告了那场史无前例的涨价:8月17日峰谷定价把输入从6元拉升到27元,缓存命中输入涨幅最高达1100%,是DeepSeek发布以来幅度最大的一轮提价。

一边收窄低价优势,一边能力还被友商反超,外界自然要重新盘算:还值不值?

涨价的冲击很快显现。OpenCode Go的统计显示,涨价一周以来,DeepSeek的调用量明显下滑,首当其冲的是高频、成本敏感型开发者。

紧接着DeepSeek在8月23日把周末拉成全天低谷,用更低的价格把被劝退的需求往闲时分流。这恰恰说明,DeepSeek自己也已经意识到:补贴式低价换来的“老大”光环,正在算力稀缺与成本压力下褪色。

面对这种局面,DeepSeek做出了两个动作。

第一个动作,是补齐那块最显眼的短板“多模态”。8月21日,
Deepseek-V4Flash-Vision-Exp 上线,把视觉能力塞进以效率和低成本著称的Flash体系,且不“溢价”。同期上线的免费Files API,更让图片一次上传、凭file_id复用,进一步压低重复调用的传输与计费成本。

在大模型竞争加速的背景下,如果不愿在价格上守住,就只能在能力上进攻。Tech星球用DeepSeek做完上面五个测评后,只花费了0.14元。不过,豆包是免费的,没花钱。



第二个动作,是把“涨价”包装成资源调度。峰谷定价把工作日9:00—12:00、14:00—18:00设为高峰、价格翻倍,其余为空闲、价格减半;随后更新了“周末全天低谷”。

相当于用价格杠杆把闲时算力分配给对时延不敏感的批量任务,既缓解高峰拥堵,也给愿意错峰的开发者留出低价窗口。

大模型行业正从“低价抢客户”转向“价值定价”,曾被称为“价格屠夫”的DeepSeek收刀,某种程度上也意味着纯低价策略已难以为继。但把视觉放进便宜的 Flash线,等于用“低价多模态”重新定义性价比。

如此一来,DeepSeek的V4产品矩阵正在变完整:高频低价的V4-Flash、复杂推理的V4-Pro,再到补齐图像与界面理解的DeepSeek‑V4‑Flash‑Vision‑Exp。比起一味追求低价,它开始重新考量“能力、价格、用户需求”的平衡。

而这或许只是DeepSeek面向现实“低头”的开始。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本议员访华回国后,态度发生转变,对着记者开始疯狂宣泄不满

日本议员访华回国后,态度发生转变,对着记者开始疯狂宣泄不满

无心小姐姐
2026-09-02 17:29:55
比红薯通便,比芋头便宜!秋天使劲吃,一补钾、二降火、三健脾胃

比红薯通便,比芋头便宜!秋天使劲吃,一补钾、二降火、三健脾胃

阿龙美食记
2026-09-03 13:47:48
开始收网了,尼日利亚没料到,中方出手第一招,就是釜底抽薪?

开始收网了,尼日利亚没料到,中方出手第一招,就是釜底抽薪?

安安说
2026-09-02 12:18:45
日本亚运会将开幕,高市却要中国5倍签证费,台专家:日本要血亏

日本亚运会将开幕,高市却要中国5倍签证费,台专家:日本要血亏

麓谷隐士
2026-09-04 00:40:03
全民进入纯过日子模式。

全民进入纯过日子模式。

老陆不老
2026-09-02 08:27:57
当日本资本踏上“回家路”:“破3”的日债正颠覆全球资金流向?

当日本资本踏上“回家路”:“破3”的日债正颠覆全球资金流向?

财联社
2026-09-03 11:20:17
杭州电梯诬告事件升级!涉事女子背后的护肤品牌被扒,该品牌长期主打全女创业团队叙事,收获数万粉丝

杭州电梯诬告事件升级!涉事女子背后的护肤品牌被扒,该品牌长期主打全女创业团队叙事,收获数万粉丝

火山詩话
2026-09-03 07:54:17
央视主持人文清现状:胖到认不出,在桂林陪读,老公在澳洲当院长

央视主持人文清现状:胖到认不出,在桂林陪读,老公在澳洲当院长

人间无味啊
2026-09-04 03:11:03
张绪武今天上午在京辞世,享年98周岁,是张謇孙辈中最后一个离开世界的人

张绪武今天上午在京辞世,享年98周岁,是张謇孙辈中最后一个离开世界的人

极目新闻
2026-09-03 23:07:00
白金汉宫出手!梅根刚返英便失人心,温莎家族这招太绝了

白金汉宫出手!梅根刚返英便失人心,温莎家族这招太绝了

草莓解说体育
2026-09-04 00:40:03
九月二号的西安赛格现状

九月二号的西安赛格现状

童童聊娱乐啊
2026-09-04 00:39:53
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

比利
2026-08-06 11:11:07
中日机械巨头对比:日本小松年营收270亿美元,徐工集团多少呢?

中日机械巨头对比:日本小松年营收270亿美元,徐工集团多少呢?

抽象派大师
2026-09-02 02:24:18
再爆大冷中国90后冠军3 4遭淘汰,范争一4 2晋级,16强对阵揭晓中国占4席

再爆大冷中国90后冠军3 4遭淘汰,范争一4 2晋级,16强对阵揭晓中国占4席

沉睡月亮m
2026-09-04 03:27:19
为何日本变得如此嚣张?因为一旦中日爆发冲突,日本都能稳赚不赔

为何日本变得如此嚣张?因为一旦中日爆发冲突,日本都能稳赚不赔

王一晓
2026-09-03 19:37:14
俱乐部被“雪藏”+落选U23国足!一张红牌,或彻底毁掉23岁天才边后卫

俱乐部被“雪藏”+落选U23国足!一张红牌,或彻底毁掉23岁天才边后卫

大卫的篮球故事
2026-09-03 15:10:30
李迎春医生:喉咙总有吐不完的痰、反复卡堵?慢性咽炎,根本不止是嗓子的问题!

李迎春医生:喉咙总有吐不完的痰、反复卡堵?慢性咽炎,根本不止是嗓子的问题!

蜡笔小小子
2026-09-02 11:56:50
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
2026-09-04 06:12:49
Tech星球 incentive-icons
Tech星球
聚焦互联网前沿科技和新商业
2833文章数 26685关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

家居
健康
本地
亲子
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

脑梗能否取栓,关键看这几点!

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

亲子要闻

大人刚喝完酒,千万不要去靠近宝宝!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版