网易首页 > 网易号 > 正文 申请入驻

DeepSeek下载火爆,一周超谷歌Gemini两年

0
分享至

DeepSeek下载火爆,一周超谷歌Gemini两年

原载2025年2月8日《大公报》



近期,国产AI大模型DeepSeek横空出世,仅以几十分之一的成本,就达到与全球领先的ChatGPT最新o1版本推理模型相当的实力。目前,DeepSeek下载量持续攀升,据研究公司SimilarWeb估计,在短短一周内,DeepSeek网站的用户数量就超过了谷歌的Gemini聊天AI,而后者已经存在了近两年。一时间,各界众说纷纭:DeepSeek为什么这么牛?何以如此?是创新还是蒸馏?……诸如此类的疑问频出。

人工智能专家高飞长期跟踪研究ChatGPT与DeepSeek的发展轨迹,他在接受大公报独家专访时,从技术肌理与论文研究原点出发,破译“深度求索”成功的基因密码,揭秘DeepSeek低成本、高性能的原因。他还表示,DeepSeek-R1“出圈”,得益于高性能、低成本、强开放三个因素,这与美国闭源、收费、高成本的ChatGPT形成鲜明对比。 大公报记者 苏雨润、凯雷北京报道

三大创新凝练DeepSeek “东方神秘力量”

大公报:DeepSeek是如何实现低成本的?

高飞:DeepSeek的低成本得益于其创新性,它打破了“只有靠最先进硬件才能训练出前沿模型”的传统观念。DeepSeek团队利用有限的资源,通过创新的方式,训练出了以“测试时间计算”方式运行的推理模型,并对标OpenAI最先进的o系列模型,实现了看似“不可能”的“低成本+高性能”极限组合,并提供开源代码,让企业、个人可以在本地算力设施上部署免费使用。所以,它的低成本不是“因”,而是“果”,且是“果”之一。

大模型的“大”,其实是大算力、大参数、大数据。每一个“大”,都意味着高成本。DeepSeek在约束条件下,做了极限创新,减少算力需求、减少参数数量、降低数据规模。这是在资源上做减法,但却不对性能有任何妥协。所以,DeepSeek不仅“低成本”,还有“高性能”,以及开源模式的“强开放”。

这次OpenAI跟随DeepSeek-R1发布o3 Mini模型,CEO山姆·奥特曼承认其对于开源的判断有误,站在了“历史错误的一边”。言外之意,OpenAI可能也会在未来考虑对其模型全部或者部分开源。因此,DeepSeek-R1模型的成功,不仅是技术创新的成功,更是技术开放的成功。

实现强化学习法 让用户看到“内心戏”

大公报:DeepSeek-R1兼具低成本和超高性能,更在低成本的前提下实现对标OpenAI o系列模型,这究竟是怎么做到的呢?

高飞:DeepSeek-R1模型代表了高性能、新思维的突破。大家知道,OpenAI的o系列模型是一种测试时间计算(Test-Time Computation)模型,模型在推理阶段(Inference Phase)会执行计算的方式。表现在使用上,就是模型不会立刻回答用户的问题,而是根据问题难度,经过一番思考(通常是几十秒),给出高质量答案。

DeepSeek R1使用了一种创新的强化学习(RL)方法,实现了该种模型的训练。最终实现的效果是,当你提问DeepSeek-R1,它看似是最终给你一个答案,其实模型有大量的“内心戏”,是经过反复推敲、多步思考,最终给出一个相对完美的答案。在学术上,这个过程叫思维链(Chain of thought)。

大公报:可否从技术肌理层面为我们解读,DeepSeek的高性能主要源于何种技术创新呢?

减少消耗 分工明确“餐厅模式”

高飞:DeepSeek所拥有的“东方神秘力量” ─ 高性能,主要来自混合专家模型(MoE)、多标记预测(MTP)和多头潜在注意力机制(MLA)等三大技术的创新。其中,MoE技术实现了DeepSeek在参数上的精简。例如,去年底发布的DeepSeek-V3,就是DeepSeek团队采取混合专家模型的模式,将大模型分成多个“专家”子模型,将DeepSeek-V3的671B参数进行拆解,每个子模型的参数量大约只有37B(总参数的1/20),且擅长不同领域的知识。这样,针对不同的输入数据,模型会动态地选择最合适的部分专家来参与计算,自然就减少了资源消耗。

大公报:可以举一个形象的例子,解释一下MoE技术是如何运行的吗?

高飞:训练大模型就像点菜,美国的主流大模型就像一个有100个档口的大排档,用户点一份披萨,所有厨师、服务生都要动起来。而MoE技术就相当于组织分类,用户同样点一份披萨,西餐档口只调动相应的西餐厨师和服务生,其他档口并不受到扰动,因此忙而不乱,井然有序。从粗放式管理到精细化模式,即专家模式,其实就是提升模型的组织创新力。

同步炮制 后厨“预判式做饭”

高飞:如果说,MoE技术让模型尽可能用更少的参数工作,是空间上的优化,那么MTP技术就是时间上的优化,它让模型用同样的资源做更长期的工作。MTP技术可以让模型不是每次预测生成一个Token(文本拆分的最小单元),而可以在每个位置预测多个未来Token,这就更大程度利用了计算资源,增加了训练信号密度,提高了训练效率。就像让餐厅档口做第一道菜时,就同步准备第二、三道菜,用一份算力做更多工作,将资源利用到极致。

高飞:多头潜在注意力机制(MLA)技术,就是将原始高维特征压缩到一个较低维度的潜在空间(潜在向量),再通过上投影矩阵恢复的技术。打个比方,就是将一段高清视频压缩成较小的文件,却能在播放时基本保持画质。还以餐厅档口为例,过去档口在和顾客交互中要记录每一道菜,而现在把菜单中的菜品抽象汇总分类,计为十碗“例汤”、十碗“白饭”,要记录的信息一下子就少了很多。

DeepSeek团队在训练V3版模型时,还使用了对数据资源节省技术,即“FP8混合精度训练”。FP8是一种比常规大模型训练使用的FP16和FP32更低精度的数据格式,每个数字占用的比特数更少,这使得模型在训练和使用过程中,所需的存储空间和计算量大大减少,效率也就更高。之前大家也不是没想过这种方式,但只有DeepSeek团队真正实现了这一点。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大病最危险信号,不是消瘦,是排尿频繁出现5个表现,别不当回事

大病最危险信号,不是消瘦,是排尿频繁出现5个表现,别不当回事

芹姐说生活
2026-09-08 23:21:41
承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

天天热点见闻
2026-09-07 06:10:14
总统和副总统,谁会杀了谁?

总统和副总统,谁会杀了谁?

中国新闻周刊
2026-09-09 08:38:08
中原粮仓换上“数智引擎”丨活力中国调研行

中原粮仓换上“数智引擎”丨活力中国调研行

经济日报
2026-09-09 20:55:14
1949年划江而治险成真!幸亏没听美苏的,不然中国多惨

1949年划江而治险成真!幸亏没听美苏的,不然中国多惨

小豫讲故事
2026-09-08 06:00:10
实体店为啥越来越难干了?网友:很多东西比线上贵一半

实体店为啥越来越难干了?网友:很多东西比线上贵一半

康富贵碎碎念
2026-09-09 11:47:46
“这走路姿势,上医院看看吧!”10岁女孩178厘米!上学人潮里鹤立鸡群!

“这走路姿势,上医院看看吧!”10岁女孩178厘米!上学人潮里鹤立鸡群!

林林先生
2026-09-09 13:38:29
广西检察机关依法对罗伟雄涉嫌受贿案提起公诉

广西检察机关依法对罗伟雄涉嫌受贿案提起公诉

环球网资讯
2026-09-09 16:09:48
疑现乌龙指!300943,一度20%跌停

疑现乌龙指!300943,一度20%跌停

证券时报
2026-09-09 14:15:04
周涛与前夫姚科未离婚之前的一张合影照,儒雅的姚科,终究留不住周涛

周涛与前夫姚科未离婚之前的一张合影照,儒雅的姚科,终究留不住周涛

南万说娱26
2026-08-22 08:56:48
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

旧窗老街
2026-02-23 01:50:19
决裂41年后李政道公开表示:我和杨振宁分裂,是中华民族一大悲剧

决裂41年后李政道公开表示:我和杨振宁分裂,是中华民族一大悲剧

浩渺青史
2026-09-08 01:16:10
官方定性郭德纲歪曲经典!德云社演出被全国叫停,没罚钱却断了生路,再看曹云金于谦郭麒麟,三人早已赢麻了

官方定性郭德纲歪曲经典!德云社演出被全国叫停,没罚钱却断了生路,再看曹云金于谦郭麒麟,三人早已赢麻了

子芫伴你成长
2026-09-09 21:36:32
内部员工曝光:别买中国轮胎?

内部员工曝光:别买中国轮胎?

新浪财经
2026-09-07 20:58:55
紧急送医才几天,38岁赵丽颖传来“喜讯”,原来冯绍峰真没说错

紧急送医才几天,38岁赵丽颖传来“喜讯”,原来冯绍峰真没说错

乡野小珥
2026-09-09 08:20:59
改打中锋彻底爆发,弗里克保护拉菲尼亚的四步棋

改打中锋彻底爆发,弗里克保护拉菲尼亚的四步棋

王衜晓
2026-09-08 20:14:02
“这么长时间救援人员都没来,让人愤怒”,CHINA GT车手还原事故现场:被救车手还在ICU,“英雄车手”吸入大量浓烟,手部被烫伤

“这么长时间救援人员都没来,让人愤怒”,CHINA GT车手还原事故现场:被救车手还在ICU,“英雄车手”吸入大量浓烟,手部被烫伤

每日经济新闻
2026-09-09 16:35:04
42岁前阿里高管命丧美国:他不是被收割,是被自己的美国梦坑死

42岁前阿里高管命丧美国:他不是被收割,是被自己的美国梦坑死

说故事的阿袭
2026-09-08 13:33:23
悲催!浙江一男子8000元创业,半年狂赚130万,终陷千万负债,网友:普通人要明白一个道理,发财了不是你牛逼,是你站在风口上

悲催!浙江一男子8000元创业,半年狂赚130万,终陷千万负债,网友:普通人要明白一个道理,发财了不是你牛逼,是你站在风口上

火山詩话
2026-09-04 06:12:16
全员灾难!利物浦两大旧将集体崩盘!欧冠一战沦为足坛笑柄

全员灾难!利物浦两大旧将集体崩盘!欧冠一战沦为足坛笑柄

一隅非生
2026-09-09 10:44:03
2026-09-09 22:59:00
文学聊斋
文学聊斋
发布文学信息,品鉴精美作品
214文章数 63关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

红旗HS7 PHEV申报图曝光 尺寸升级/搭载激光雷达

态度原创

数码
教育
游戏
时尚
本地

数码要闻

OWC推出USB4 Hub扩展坞:配HDMI 2.1接口,130美元

教育要闻

坚决支持取消英语的主科地位,这对大多数普通孩子绝对是有利的!

《塞尔达时之笛RE》获玩家力挺:差评的人只为博眼球

和童年顶流做邻居,这事我藏了很多年

本地新闻

宁波,中国制造的隐藏大佬

无障碍浏览 进入关怀版