4月24日这天,科技圈发生了两件大事,而且几乎是同一时间甩出来的。
上午DeepSeek发布了V4系列模型的预览版并同步开源。
下午华为紧跟着宣布:昇腾超节点全系列产品全面支持DeepSeek V4。
这不是一次普通的商业合作官宣,而是国产AI两条最粗的腿终于绑在了一起,准备开始跑了。
先说硬核数字。华为这次拿出的Atlas 350加速卡,搭载的是昇腾950PR处理器,单卡算力达到了英伟达H20的2.87倍。
![]()
H20是什么?就是美国专门给中国市场定制的阉割版芯片,算力只有H100的三成。华为这块新卡的HBM容量做到了112GB,比H20多出16%,多模态生成速度快了60%,最关键的是——它是目前国内唯一支持FP4低精度推理的产品,FP4精度算力做到了1.56P。
此前在AI推理这个环节中国人只能跟在英伟达后面跑,现在这块卡在某些指标上已经能正面硬刚了。
但硬件堆料只是故事的一半。真正让我觉得这事儿不简单的,是软件和硬件的咬合深度。DeepSeek V4这次搞了两个版本:Pro版1.6万亿参数、49B激活,Flash版284B参数、13B激活,两个都原生支持百万token的超长上下文。
![]()
关键支持是什么?DeepSeek在官宣文章里直接说了,细粒度专家并行方案同时在英伟达GPU和华为昇腾NPU上完成了验证。
要知道,国产大模型以前对英伟达的依赖几乎是写在基因里的,CUDA生态就像空气一样无处不在却又难以替代。现在DeepSeek从V4这一代开始,设计阶段就把华为的CANN生态纳入了深度适配,用的是华为的融合算子和多流并行技术来降计算开销、提推理性能。这意味着什么?意味着英伟达的CUDA不再是唯一能跑万亿参数大模型的基础设施了。
更狠的是价签。
![]()
DeepSeek明确表示,等下半年昇腾950超节点批量上市部署后,V4 Pro的价格会大幅下调。能降价的前提是什么?是国产算力成本已经降下来了。过去AI推理贵得离谱,很大一部分原因是芯片被卡着、溢价被人攥着。
现在昇腾的出货量已经上来了,2025年华为昇腾一家就卖了81.2万张加速卡,占国产总出货量的49.2%,国产芯片整体拿下了中国市场的41%份额。价格屠夫的刀,只有拿在自己手里才砍得下去。
这两个时间点也很有意思。美国商务部长卢特尼克前两天刚在国会听证会上承认,H200芯片自年初放行以来中国没买一块。中国这边反手就甩出了DeepSeek V4加昇腾超节点的全套国产方案。不是巧合,是产业链的集体转身。
深圳刚点亮了全国首个万卡昇腾910C超节点智算集群,总算力规模达到14000P。从模型到芯片到集群再到应用,一条完整的国产AI算力链条正在成形。
当然了,也不能上头就吹。
![]()
英伟达的B200旗舰卡在很多指标上依然领先,CUDA这十几年的生态积累也不是一两年就能全面赶超的,CANN还需要更多开发者、更多框架的原生支持才能真正叫板。昇腾在高端制程上依然受制于制造环节。
但DeepSeek V4和昇腾超节点这次的同频发布,透出了一个清晰的信号:中国AI产业最核心的两个环节:算法和算力已经从各自为战走向了精密咬合。这种咬合才是最让对手心里发毛的,因为生态这东西一旦形成,靠制裁是打不断的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.