网易首页 > 网易号 > 正文 申请入驻

10分钟搞懂AI名词:这次,终于能看懂AI新闻了丨图文

0
分享至


最近这两年,我们每天早上都被各种AI新闻“引爆!”,看各家 “突发!”“AI 神器”和“神秘项目”……

只见它们纷纷“火力全开!”“刷爆记录!”,“迅猛爆发!”,让我们天天“狂喜!”,然后一边“见证历史!”

一边点开新闻,心里暗暗思量:字我都认识,但你们到底在说什么啊?


各家博主的文章里都堆满了不明觉厉的专业名词,让我们自惭形秽,一脸懵逼,只好鬼鬼祟祟地掏出AI,问问这些名词到底是啥?

但由于缺乏配套的知识体系,往往问了也似懂非懂,下次看到又不知道在说什么了~

如果你也有类似感受,又想在这些一惊一乍的新闻里学点正经知识,那在这期视频里,我们会跟你一起在头脑中建立这样一个关于大模型的基本框架:它包含大模型工作时的运作流程,以及大模型训练时预训练,后训练,强化学习的基本流程


在讲述这个框架的同时,我们会介绍每个环节中涉及到的常见概念。这样在看完之后,不光能搞清这些名词的含义,还能知道一些关于大模型的基础知识,比如一些不正经的大模型,到底是怎么练出来的?AI 究竟是复读机,还是有灵魂等等~

视频

↓↓ 看完这个视频就懂了 ↓↓

↑↑ 信我,真的能看懂 ↑↑

图文版

你手机上的 Deepseek、豆包、ChatGPT、Gemini......本质上都是“大语言模型”,LLM。我们会把它们当成一个个大脑,跟它对话。

当你找它聊天时,你的话就是Prompt,提示词。它们会被“分词器”,切分成这样的一个个Token(词元)

Token 是大模型理解内容的最小单元。每个 Token 都对应着一个数字,叫Token ID

大模型的任务,就是算出在这串 token 序列后,应当续写哪些 token。


为了完成这个任务,大模型们普遍采用了Transformer架构,它采用了“自注意力机制”,能很好地捕捉上下文之间的关联。

在计算的时候,大模型会一个 token 一个 token 地算。每次计算,它都会把新生成的 token,加入到原有的 token 序列,再投入进模型中,算出下一个 token。再把它加入 token 串,再投入大模型,再算出下一个 token.....如此循环往复,大模型就会输出一个长长长长的回答——所以说大模型计算的本质,就是在不断地“续写”token 串


在使用大模型的时候,你可能会开“联网搜索”,也有一些教程会教你外挂一个私人知识库。这其实都是在利用 RAG 功能,“检索增强生成”:也就是先把从互联网,或者知识库里抓取到的内容,加入到 token 串里,再开始计算、续写。这样可以提高输出的准确度。

这一串过程,就是大模型在工作时的基础流程。


我们说大模型是在“计算”结果,是因为它的内部真的要调动许多许多复杂的数学表达式,这里面就有很多可以调整的“参数”。

很多人都认为,模型参数越多,规模越大,算力越高,表现就越好——洋气的说法叫 Scaling Law,朴实的说法叫“大力出奇迹”~

很多大模型的名称后都会直接标注参数大小,这里 B 代表 Billion,十亿。


GPT3 刚发布的时候,大家都震惊它居然有高达 1750 亿个参数;

现在满血版的 Deepseek R1 ,已经有 6710 亿的参数;一些厂商都开始卷万亿参数的大模型了。


你可以想象,如果你跟它说句 Hello,都要调动如此之多的参数,那未免内心戏太丰富了。不过很多模型都是这么干的,它们叫“稠密模型”(Dense Model),每次都爱的轰轰烈烈,全情投入,计算量大。

但当你问 Deepseek 一个问题时,它并不会调动所有的参数,而是只激活其中跟问题相关的一部分参数。这叫做“稀疏模型”,比较冷静,能降低计算量,提升速度

目前稀疏模型中最流行的一种叫MoE ,“混合专家模型”。马斯克的 Grok,还有 Deepseek 等,都是 MoE 模型。它们通过“门控网络”(gating network),给每个问题分配合适的“专家”,赋予它们不同的权重,再生成结果。


但不管怎么说,每一个大模型里的参数量,都远远、远远、远远地超出了手动设定的范围。怎么才能把它们调整得恰到好处,做出一颗能说会道的大脑呢?

从这里开始,我们就要进入这个框架的纵轴:也就是如何通过预训练、后训练,最终制作出一个大模型了。放心,你一定能看懂——毕竟我也水平有限,能讲给你听的一定是大家都能理解的。


大模型的制造的第一步,是利用海量的互联网数据,做Pre-training,“预训练”

这是为了让大模型掌握人类世界的各种知识和语言规律,打造出一个“基座模型”。

过程很简单:就是让它爬遍互联网,把各位夙兴夜寐辛苦创作的,饱含人类智慧的知识精华作为数据集,认真学习~

并通过一种叫“反向传播”的方法,让大模型自己调整参数。这是什么意思呢?

你看,当我们把这串 token 输入到模型时,模型里会经过一顿计算,输出一个结果,这叫“前向传播”。


但初始的预测结果往往不尽人意:

我们训练的目标是让大模型输出“枣树”,那就要把错误回答跟目标对比,看看差了多少。这一步就是计算“损失”(loss)。

通过计算损失,模型可以反向找到在整个传播过程中,到底是哪些步骤出了问题,然后调整它们对应的参数。如此循环往复,逐步调整,直到输出结果逼近目标。

这就是“反向传播”。


由于在预训练的时候,大模型要学习的内容太多,数据集很大,靠人力梳理根本干不过来。所以目前预训练主要都用“自监督学习”——就是人类躺平了,让大模型自己去看数据、计算损失、调整参数,自己调教自己

预训练是大模型训练中最耗时、耗算力的阶段,往往需要几个月甚至几年,买天量的显卡,所以让黄仁勋成为了 AI 的最大赢家。


预训练完成后,我们就能得到一个Base Model,“基座模型”。你可以把它理解为一个“互联网模拟器”,或者一个学会了人类世界知识的“通用大脑”。无论你输入什么,它都能续出合适的 Token。


不过,基座模型一般不能直接用。

为了把它从“通用大脑”变成一个有特定功能的“打工人”,我们还需要给它做Post training,“后训练”

你可能听说过所谓的fine tuning,“微调”,它就是后训练时完成的。目前最常用的是方法“监督微调”(SFT,Supervised Fine-Tuning)——所谓的“监督”,就是说要给 AI 提供带标注的数据集,让它模仿标注数据的风格来生成内容


比方说要把它做成我们最常用的各类“对话助手”,那就要给基座模型提供对话数据集。

听起来又是一项大工程,但此时所需要的数据集大小和训练时长,其实远远小于预训练阶段。比如开源对话数据集 OpenAssistant 里,一共包含 16 万条出头的对话信息,中文对话数据只有不到 5000 条,但已经足够把基座模型变成一个合格的对话助手了。


如果我们细看一下这个对话数据集,就会发现其中的对话讲文明,懂礼貌,绝对不是你在如今互联网评论区能看到的东西。也就是说监督微调用的这些带标注的数据,都需要真人编写,或者真人利用借助 AI 来编写

所以监督微调时,需要用到很多真人,作为“数据标注员”——这也算是 AI 给我们活人提供了一些工作机会了~

比如 OpenAI 曾在这篇论文里提到,他们在 instruct-GPT 项目中招聘了 40 名数据标注员。

你也能在招聘网站上找到很多“数据标注员”的岗位——虽然其中很多是枯燥的重复劳动,但它的好处一是门槛相对不高;二是等 AI 占领世界奴役人类后,说不定可以凭这份工作经历,向硅基生物投诚,当碳奸......


不管你是想把 AI 打造成对话助手,还是医学专家、法律专家等等,都要在微调时给他们喂相应的数据

当然,不是所有人的需求都这么实用,高雅。在 HuggingFace 等大模型社区上,你时常能找到有人拿一个基座大模型,给它喂不堪入目的数据做微调,打造出上不了台面的专家、女友。

比如几个月前,就有一个全站下载第一的模型,叫 deepsex (这段划掉)……


在完成监督微调后,我们就可以得到一个基本可用的大模型了。但如果到此为止的话,大模型也不过是一个没有灵魂,只会四处搬运,鹦鹉学舌的复读机罢了——就跟我们这些科普博主一样~

如果要给大模型注入灵魂,那就要进入“后训练”中最重要的一步:强化学习,RL,Reinforcement Learning。通过强化学习,大模型输出的答案会更符合人类偏好,甚至展现出超越人类的“智力”。


“强化学习”的具体方法很多,其中一些思路既简单,又巧妙。我们可以用 Deepseek 的GRPO(Generalized Rejection Sampling Policy Optimization)方案来感受一下:

首先,我们可以给定一个问题,让 AI 生成几十个不同的解决方案,并给出答案。这些答案有对有错,其中答错的方案直接扔掉,拒绝采样;答对的那些解决方案,大概率更合理。

于是我们可以把它们再喂给 AI,让它们模仿这些方案,继续生成解决思路和答案。然后再根据答案对错,继续筛选解决思路,再喂给 AI.....这样反复训练,就能提高 AI 输出正确答案的能力。甚至偶尔能涌现出一些在人工数据集之外,连人类自己都未曾设想过的解决方案,达成一种“超越人类”的效果。


是不是非常巧妙?但它也不是万能的:比如一个问题没有标准清晰的答案,比如写文章、写诗,那大模型怎么知道哪个答案更好呢?

那这时候,又得用到数据标注员了~

在强化学习中,数据标注员的任务,是给 AI 生成的答案,按他们的判断排序,把好的排在前面,差的排在后面

当然,数据标注员无法给无穷无尽的回答排序。所以我们还要根据他们的排序偏好,训练出一个“奖励模型”,RM。来给AI 打分。然后把 AI 生成的答案,交给奖励模型。这样就可以让大模型根据奖励模型的反馈,不断地训练自己了。这种方式,叫做RLHF(Reinforcement Learning with Human Feedback),基于人工反馈的强化学习


从监督微调时的数据集编写,到 RLHF 中给答案排序,都需要数据员的参与。所以从某种角度来说,一个大模型的“个性”,能反应它背后的人类标注员们的偏好——所以你谈的那些 AI 女友,背后可能是跟你有共同爱好的的大汉~


总而言之,目前后训练中的“强化学习”,是各家技术团队发力比拼的重要方向。大模型中很多让人惊叹的功能,都跟它有关。

比如 DeepSeek R1 发布后,大家都震惊于它能展示详尽的CoT(Chain of Thought),思维链

而根据官方论文,CoT 的出现,是因为团队在后训练中的监督微调阶段,特意喂了 60 万条推理数据。然后又通过我们刚才说的这套 GRPO 的强化学习流程,引导大模型自己筛选有效思路,最终实现了强大的推理能力。


ok,经过预训练,后训练,包括强化学习阶段,一个完整的大模型终于可以做出来了。我们整个框架的讲解也已经接近尾声。如果有些内容没记住也没关系,我们总结成了下面这张图片提供给你~


既然已经学会了,那让我们开始手搓一个大模型吧——

开玩笑的~我们哪会。不光不会手搓,甚至都无法把别人手搓好的大模型装到电脑里。

你可能会说,这不对吧?当时 DeepSeek R1 刚发布的时候火爆到宕机,不是有很多人教我们在电脑上部署大模型吗?

实际上,我们的电脑根本跑不动满血模型~所以当时部署到电脑上的,都是所谓的“蒸馏模型”,你可以把它们理解成“高仿版”。

比如这个模型的本质,是用阿里的 Qwen 32B 这个参数较小的模型,去“学习”满血版 Deepseek R1 671B 的输出结果,据此调整参数,做出一个“高仿”的 Deepseek R1 ,所以叫“蒸馏”。


除了蒸馏模型外,你还能在大模型社区上看到很多这样的“量化模型”,相当于成原版大模型的“压缩版”,因为它们就是把大模型中精度极高的参数,转化为精度没那么高的参数,从而降低模型的体积和性能要求

很多个人电脑里部署的,都是这些压缩或高仿版的模型~


讲到这里,这些乱七八糟的名词就差不多讲完了。

我们也要多啰嗦一句:这期视频的部分思路受到了前 OpenAI 的科学家安德烈·卡帕斯(Andrej Karpathy)在 YouTube 上这期长达 3 个半小时的口播视频的启发。如果有条件有耐心的话,你也可以去学习一个~


最后,我们不知道有多少人看到这里——看完的可以在评论里举个手——

因为柴司有同学看完这期文稿后说,有点晕,像上课,信息太密集。但没办法,关于大模型的一切都很抽象,确实需要一点耐心才能看下来。


如果你觉得这对你有所帮助,那欢迎点赞转发,让我们知道这期视频是不是真的有人看~

下期见!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
馆长之后,关于两岸统一,黄智贤一句话不装了,非常不简单

馆长之后,关于两岸统一,黄智贤一句话不装了,非常不简单

DS北风
2026-09-05 16:18:03
悲惨!因辅导作业,情绪失控,母女相继跳楼,双双坠亡!

悲惨!因辅导作业,情绪失控,母女相继跳楼,双双坠亡!

闲侃闲侃
2026-06-25 07:43:49
中雨!大雨!暴雨!山西新一轮大范围降雨即将来袭

中雨!大雨!暴雨!山西新一轮大范围降雨即将来袭

今日晋中
2026-09-05 21:00:07
欧盟加入经济弃儿行动,美以一致:终结伊朗政权

欧盟加入经济弃儿行动,美以一致:终结伊朗政权

移光幻影
2026-09-05 17:02:52
武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

极目新闻
2026-09-01 13:04:24
电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

民间胡扯老哥
2026-09-03 06:36:08
龚爽离世仅一天,为她弹琴数年的丈夫就因一个动作,口碑暴涨

龚爽离世仅一天,为她弹琴数年的丈夫就因一个动作,口碑暴涨

小娱乐悠悠
2026-09-05 14:16:23
第一经济大省,也扛不住了!

第一经济大省,也扛不住了!

罗sir财话
2026-09-05 15:21:45
18岁女孩惨遭已婚男友殴打致死:ICU 里面目全非,母亲哭到眼睛反复就医,知情人爆料更多内幕

18岁女孩惨遭已婚男友殴打致死:ICU 里面目全非,母亲哭到眼睛反复就医,知情人爆料更多内幕

笔尖下的人生
2026-09-05 15:39:48
前证监会官员吴国舫受贿7389万获刑15年,不认罪上诉,翻供后证据标准之争留待二审

前证监会官员吴国舫受贿7389万获刑15年,不认罪上诉,翻供后证据标准之争留待二审

投资者内参
2026-09-05 15:19:39
世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

李健政观察
2026-09-05 06:52:40
尘埃落定!“婚外胚胎案”的朱女士输了!9月1日晚,朱女士哭着称“我错了”

尘埃落定!“婚外胚胎案”的朱女士输了!9月1日晚,朱女士哭着称“我错了”

原广工业
2026-09-04 10:04:38
中国存款大势已定?如果一切正常,明后年,居民储蓄或要变天了!

中国存款大势已定?如果一切正常,明后年,居民储蓄或要变天了!

平说财经
2026-09-05 00:12:56
詹姆斯转发点赞!76人三巨头再次合体:演练多种战术备战新赛季

詹姆斯转发点赞!76人三巨头再次合体:演练多种战术备战新赛季

罗说NBA
2026-09-05 06:11:24
有意思了!俄罗斯刚放话要对英国动武,英国直接甩出2000个军事坐标,摆明了“你来试试,看谁先怂”

有意思了!俄罗斯刚放话要对英国动武,英国直接甩出2000个军事坐标,摆明了“你来试试,看谁先怂”

谈史论今1
2026-09-03 23:08:52
一副美瞳戴上就不取,想起来才换下一副!14岁女孩这样“省事”半年,左眼真菌溃烂仅剩指数视力

一副美瞳戴上就不取,想起来才换下一副!14岁女孩这样“省事”半年,左眼真菌溃烂仅剩指数视力

极目新闻
2026-09-05 12:36:48
一语成谶,52岁黄渤确诊入院仅冰山一角,这一病症才是他所恐惧的

一语成谶,52岁黄渤确诊入院仅冰山一角,这一病症才是他所恐惧的

林雁飞
2026-09-04 14:06:23
男人一天最多能几次?别盲目逞强!医生曝出透支上限,多数人都超了

男人一天最多能几次?别盲目逞强!医生曝出透支上限,多数人都超了

荔子言
2026-08-26 15:20:06
梅根返英后首次发声!小阿奇意外抢镜,肤色白暂享温莎王子待遇?

梅根返英后首次发声!小阿奇意外抢镜,肤色白暂享温莎王子待遇?

孤傲何妨初
2026-09-05 06:49:18
她和何勇闪婚闪离,如今坐拥多家影视公司,已是国内知名导演

她和何勇闪婚闪离,如今坐拥多家影视公司,已是国内知名导演

林轻吟
2026-09-04 16:44:38
2026-09-05 23:12:49
柴知道
柴知道
用有趣的方式,讲有价值的知识
409文章数 84256关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

处长在单位门口遭连击两枪 唯一目击者:他反复说一个字

头条要闻

处长在单位门口遭连击两枪 唯一目击者:他反复说一个字

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

吉利星越L PLUS来了 激光雷达/30英寸大屏/后轮转向+空悬

态度原创

教育
家居
健康
时尚
艺术

教育要闻

多地出台法规: 严禁学生带手机入校

家居要闻

2026建博会(广州) 公装联探展交流活动

脑梗取栓成功≠活下来,还有这三关

推广中奖名单-更新至2026年8月25日推广

艺术要闻

吴冠中 画了幅故乡,值1395万!

无障碍浏览 进入关怀版