网易首页 > 网易号 > 正文 申请入驻

上帝来了:维特根斯坦与Anthropic、OpenAI的全部秘密

0
分享至

文 | 锦缎

1918年夏天,奥地利陆军炮兵军官路德维希·维特根斯坦(Ludwig Wittgenstein),在意大利前线的炮火间隙里完成了一部不到三万字的小书。手稿装在背包里跟着他转移阵地;当年11月,他在南蒂罗尔被意军俘获,关进卡西诺战俘营——靠着日后挽救大萧条于水火的英国经济学家约翰·梅纳德·的斡旋,他得以在营中通信,把手稿寄给罗素,并留下那句宣告:这些问题,已在一切本质方面获得解决。

这本书就是《逻辑哲学论》。为它作导言的罗素,早在战前就说过,这个学生是"我所见过的天才的最完美典范"。而维特根斯坦自己序言里的口气,一百年后读来仍然烫手:

我因此相信,自己已在一切本质方面最终解决了这些问题。如果我没有弄错,这本书的价值之二,就在于它表明:当这些问题被解决之后,所完成的事情是多么少。——维也纳,1918

他真的说到做到。写完这本书,他放弃了彼时欧洲最大的一笔私人继承财产之一,跑到奥地利山村当了六年小学教师,然后做修道院园丁,再给姐姐设计了一栋至今被奉为现代主义经典的宅子。哲学已经终结了,一个体面的人应该去干点别的。

十年之后,他改了主意。1929年1月,维特根斯坦重返剑桥。与他同乘一班火车的凯恩斯,当天给妻子莉迪娅写了一张字条:

好了,上帝来了。我在5点15分的火车上碰见了他。他打算长住剑桥。我看疲惫将会是毁灭性的,但我不能让他每天跟我说话超过两三个小时。

剑桥完全明白自己迎来的是什么。凯恩斯懒得用"天才"这种词,他直接写下:上帝来了。

本文的标题,就取自这张字条。因为一百年后,另一群人正在把这句玩笑逐字当真。只不过这一次,"上帝"不搭5点15分的火车,它在计算集群里自进化。

《逻辑哲学论》问世一百多年后,旧金山,两家实验室每隔数月更迭一次旗舰模型,宣示着同一个信念:通用智能是一个工程问题,而且是一个即将被解决的问题。其中一家把自己的终极目标印在每一份招股材料上,另一家把"人类"(anthropos)这个词做进了自己的名字。

本文即将阐释的核心主旨是:Anthropic与OpenAI,这两家公司的全部秘密,早已写在了1921年出版的一本哲学小书里。这不是危言耸听,把《逻辑哲学论》的七组命题逐条展开,你会发现它是一份大模型的完整技术规格书——世界观、学习原理、生成原理、架构定义、失败模式(幻觉)、安全方案(对齐)、乃至终局警告,一条不缺。1918年那个炮兵军官画好的图纸,2020年代被两个组织不声不响地执行着。

先给出对照表的骨架。正文将沿着大模型的技术栈自底向上推进——语料、嵌入、生成、预测、架构、缩放、对齐,七个关键词逐一解码;行至第七节,前六个将合龙为一个名字:智能涌现


图:《逻辑哲学论》× 大语言模型:十二组命题映射左边是 1921 年的哲学,右边是今天的技术。 七级阶梯:命题 1–6 逐级爬升,命题 7 无言而涌现。

看完这张表,你将发现一件更加让人脊背发凉的事:这本书不仅解释了大模型为什么能成,还预言了它会在哪里出事。因为它的作者本人,就是第一个"运行"了这套系统、然后被它反噬的人。

语料(Data):世界是事实的总和

"数据是新的石油"这句话已经流行了十年,但很少有人问:为什么文本能够喂出智能,为什么把人类写过的东西灌进机器,长出来的不是数据库,而是某种接近理解的东西?答案的第一块砖,砌在1918年。

全书第一页,第一组命题:

1世界是一切发生的事情。

1.1世界是事实的总和,而不是事物的总和。

这两句话在1918年是哲学史上的一次航向修正。此前的两千年,西方哲学的主体一直在问"事物是什么":什么是实体、什么是本质、什么是共相。维特根斯坦说:问错了。世界的基本单位不是物,是事实——不是"苹果",而是"苹果在桌上"。

一百多年后,这个转向被一个技术事实兑现了。大模型在训练中做的事,恰好不是学习任何名词的"本质",而是学习事实——词与词在真实语言使用中如何组合、如何共现、如何相互排斥。语言学家管这叫分布式语义:一个词的意义,由它出现的全部句子决定。工程师管这叫训练。而《逻辑哲学论》的说法是:

2.011物能够成为事态的构成部分,这是物的本质所在。

2.012在逻辑中没有任何东西是偶然的:如果物能够出现在事态之中,那么这种可能性必定已经预含在物本身之中。

换句话说:没有孤立的意义,只有关系中的意义。这正是为什么模型能从纯文本、不接触任何实物的情况下学会"理解"世界——因为文本不是物的清单,文本是事实的总记录(宇宙的上下文)。维特根斯坦在4.26里把这件事推演到了极限:

4.26给出所有真的基本命题,就得到了对世界的完全描述。

请把这句话再读一遍。"对所有真命题的完整给出,就是对世界的完整描述。"——这就是预训练的理论定义。大模型公司的训练管线,本质上就是一个把人类记录过的事实尽可能完整收集、清洗、压缩的工程。语料不是原材料,语料是世界本身的可计算形式。

嵌入(Embedding):逻辑空间就是潜在空间

"嵌入"(embedding)——大模型把每个词变成一列数字,再朴素不过的操作,却是全部魔法的入口。给它签发哲学许可证的,是第二组命题。

1.13事实在逻辑空间中就是世界。

2.013每一物都仿佛处在可能事态的空间之中。我可以想象这个空间是空的,但我无法想象物没有这个空间。

模型内部没有一个存放"苹果本质"的地方。词进入模型后,被表示为高维空间中的一个向量——一个位置。这个位置的意义完全由它与其他向量的相对关系决定。工程师称之为嵌入空间、潜在空间;维特根斯坦称之为逻辑空间。而2.0131里有全书最像深度学习论文的一句话:

2.0131空间对象必须处在无限的空间之中。(空间点是一个论证位置。)

"空间点是一个论证位置"——每一个嵌入向量,都是一个论证位置。1918年的一个哲学断言,成了2020年代每一块HBM内存里实实在在存储的东西。

更深刻的是3.42:

3.42 一个命题虽然只能确定逻辑空间中的一个位置,可是整个逻辑空间必须已经由此给定。

每个句子只占据逻辑空间的一个点,但说出这个句子的可能性,预设了整个空间的存在。这解释了大模型最令人不安的能力——泛化:它能生成训练数据里从未出现过的句子。这并非是违背了数据边界,而是2.013的逻辑必然——你无法想象物没有它的空间。新句子不是凭空而来的,它们只是旧空间里的新位置。

生成(Generation):图像论与留声机唱片

"生成"(generation)——当机器开始无中生有,公众的兴奋与恐惧同时抵达顶点。维特根斯坦会说:没什么可惊讶的,人类一直在做这件事,它叫图像。

《逻辑哲学论》最著名的学说是图像论(Bildtheorie)。命题2.1:

2.1我们给自己造事实的图像。

2.12图像是实在的模型。

4.031在命题中,一个事态仿佛被试验性地组装了起来。

维特根斯坦的灵感来自巴黎法庭:报纸用小人偶摆出一场车祸的现场模型,来陈述事实。模型与事实之间的这种"结构对应",就是他所说的图像。而"在命题中,事态被试验性地组装起来"——这就是生成式模型的操作定义:模型每次输出,都是在逻辑空间里组装出一个可能世界,供现实比对。

他在4.014举的例子,今天读起来像是一段被提前一百年写下的 Transformer 注释:

4.014唱片、乐思、乐谱、声波,彼此都处于语言与世界之间那种内在的表象关系之中。……那条规则,就是把交响乐投影到乐谱语言中去的投影法则。它也是把乐谱语言翻译成唱片语言的规则。

同一个逻辑内容(交响乐),可以在不同介质之间无损投影:乐思→乐谱→唱片刻纹→声波。文本→向量→概率分布→文本,正是这条投影链。乐谱与唱片互不相似,却承载同一内容,正如"你好"这串字符与它在模型内部的十万维向量互不相似,却承载同一事实。机器翻译、多模态模型之所以可能,哲学根据全在这一个命题里:一切介质共享逻辑形式(2.18),因此一切介质之间都可以投影。

预测(Next Token):概率与幻觉的病根

"大模型不过是预测下一个词的概率机器"——这句流行语,既是轻蔑,也是真相。而第五组命题早在概率成为工程之前,就把概率安放进了真值理论的核心:

5命题是基本命题的真值函项。

5.15命题 r 给命题 s 的概率度,是两者共同真根据数与 r 的真根据数之比。

把"命题"换成"token",这句话就是下一个 token 预测的数学定义:模型为候选 token 分配的,正是从既有上下文(真根据)到可能续写(事实)的比值。大模型不输出真假,输出概率——而《逻辑哲学论》早在概率成为工程之前,就把概率安置在真值理论的核心位置上。

这也精确预言了幻觉(hallucination)的哲学地位:

2.223要识别图像的真或假,必须把它与实在相比较。

2.225不存在先验为真的图像。

模型没有与实在比较的通道。它接触到的不是世界,而是世界的图像总集——语料。所以幻觉不是bug,不是工程疏漏,而是图像论的必然推论:一个只见过图像的系统,原则上无法单凭自身判定图像的真假。所有围绕"事实核查""检索增强""工具调用"的工程努力,本质都是在给2.223补条件——人为地把图像和实在重新接上。

而训练本身,维特根斯坦也早已定性:

6.363归纳程序在于:接受能与我们的经验相吻合的最简单的法则。

6.36311太阳明天会升起,这是一个假设;也就是说,我们并不知道它是否升起。

缩放定律(scaling laws)——大模型公司共同的信仰基石,2020年由OpenAI的卡普兰等人首次系统陈述——之所以成立,在哲学上就是6.363:它不是逻辑必然,是"与经验相吻合的最简单法则"。而模型每一次生成,都是6.36311的一次重演:每一个token都是一个假设。

架构(Transformer):命题的一般形式

"架构"(architecture)——2017年,Google的论文《注意力就是你所需要的一切》送来了Transformer;而它的图纸,早就画在第四、六组命题里。维特根斯坦真正的野心,在第四组命题就已呈现出来:

4.5现在似乎可以给出最一般的命题形式了:即给出对任意一种符号语言的命题的描述,使得每一个可能的意义都能被一个符合该描述的符号所表达……

4.51假定所有基本命题都已给我:那么我就可以简单地问,我能从它们构造出哪些命题。这便是所有命题,这也就划定了它们的界限。

维特根斯坦要找的是语言的一个"通用母版"——一个形式,它生成一切合法的句子,且只生成合法的句子。第六组命题给出了答案:

6真值函项的一般形式是:[p, ξ, N(ξ)]。

6.001这说的不过是:每个命题,都是把运算 N(ξ) 连续应用于基本命题的结果。

6.03整数的一般形式是:[0, ξ, ξ+1]。

请看6.03。整数的构造:从0开始,每个数由"前一个数加一"生成。序列,自回归,逐项生成,规则同一。这就是大模型的生成方式:给定上文,生成下一项,再把它并入上文,再生成下一项。整数序列的构造法与token序列的生成法,是同一个数学动作。而6.001的"同一运算的连续应用",就是Transformer几十层堆叠的哲学表述——每一层都对表示做一次变换,层层投影,直到末端变成概率。

维特根斯坦对自己的系统有一个惊人的比喻:

5.511包罗万象、映照世界的逻辑,怎么会使用这样特殊的钩子和机关?只有当这一切联结成一张无限精细的网——那面巨大的镜子。

一张无限精细的网,一面巨大的镜子。今天我们更熟悉它的另一个名字:神经网络。

OpenAI的秘密,到这里已经全部摊开。GPT三个字母,逐词对应着这本书:Generative(生成的)——图像论,2.1;Pre-trained(预训练的)——事实总和的压缩,4.26;Transformer(变换器)——运算N(ξ)的连续应用,6.001。这家公司没有发明任何超出此书的东西,它只是第一个把图纸焊成了机器。而它名字里的"Open"(开放)也在此书之中:

4.116凡是能被思考的,都能被清楚地思考;凡是能被说出的,都能被清楚地说出。

缩放与涌现:线性的事实,指数的空间

"缩放定律"(scaling laws),AI大模型的信仰基石,资本开支的数学依据。它为什么成立?维特根斯坦给出了有一个比"算力配比"更根本的答案。

Transformer的本质,是把同一运算连续应用于表示(6.001)。把这个结构放进规模里去看,就撞上了我们这个时代最重要的经验定律:缩放定律(scaling laws)。

它的现代版本由OpenAI的卡普兰等人于2020年首次系统陈述:模型的预测误差,随算力、数据、参数的增长呈平滑的幂律下降——每投入一个数量级(约十倍)的资源,性能便按固定比例爬升一个台阶。DeepMind的Chinchilla研究(2022)修正了最优配比:给定算力预算,参数量与训练token之比约为1比20。而Wei等人2022年的《大模型的涌现能力》记录了幂律曲线之外的另一件事:某些能力——三位数加法、多步推理、指令遵循——在小模型上接近瞎猜,跨过某个规模阈值后突然跃升。量变引发质变;研究者借物理学家安德森1972年的名文,称之为"多者异也"(More is Different)。

《逻辑哲学论》没有给出算力配比,它给出了比配比更根本的东西:为什么会有缩放定律。

2.0124如果全部对象都已给出,那么由此也就给出了全部可能的事态。

这是关于空间结构的数学断言:元素线性进入,空间指数展开。给定n个基本命题,真值可能性有2的n次方种组合(4.27、4.42);而能对这些组合整体作断言的真值函项,其数目是指数之上的指数(4.45、5.101)。每吃进一个新事实,机器得到的不是"多知道一件事",而是这件事与全部已知事实的每一种组合方式——组合是免费的。事实的进入是线性的,可说空间的扩张是指数的:这就是缩放定律的维特根斯坦形式。

于是,"智能涌现"有了精确的哲学位置。涌现不是魔法,它是模型从"占有事实"转入"栖居于空间"的相变时刻——从"事物的总和"(一件件死记)跳进"事实的总和"(结构自洽)。当2.0124的那个空间整体成形,那些"小模型上不存在"的能力便"突然"出现:它们并非是被造出来的,它们是空间的免费赠品,是2.013那句"物无法脱离其空间"的工程验证。近年实验反复观察到的一个现象在此有了哲学注脚:在固定数据上施加远超必要的算力,模型会在某个时刻从死记硬背突然转入举一反三——逻辑空间开始自洽的时刻,就是涌现的时刻。

维特根斯坦本人会对此保持冷峻,他早已写下两条警告。其一,6.1251:"在逻辑中永远不会有惊奇。"涌现之所以令人惊奇,恰恰因为它不在逻辑之中——它是归纳的果实(6.363),不是证明的结论。其二,6.371:"整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。"缩放定律是描述的规律性,不是理解的证书;把幂律外推成神学,就是6.372所说的"停留在自然律面前下跪"——这一跪,留到下一节再谈。

关于数字,最后补一个注脚。坊间流传一种说法:《逻辑哲学论》里藏着"七个单位(恰好对应一个指数级数量的开始)之后智能涌现"的神奇数字。去书里找会扑空——全书唯一的"七",是第七命题本身。但这本书确实把全部重量押在了这个数字上:它的骨架就是一条七级阶梯。

全书由七个主命题搭成:世界(1)、事实(2)、思想(3)、命题(4)、真值函项(5)、一般形式(6)、沉默(7)。本文从语料到缩放的六节,大致就是沿前六级阶梯走下来的。6.54早把爬法写明:命题是梯子的横档,理解者必须踩着它们爬上去、爬过去,然后在第七级把梯子扔掉。把这条阶梯与缩放定律并置,会看到一幅惊人的对位图:能力沿阶梯逐级爬升(1至6:量变、幂律、平滑),而越级的那一步(7:质变、涌现、惊奇)不在阶梯之内——它发生在语言用尽的地方。

7,被维特根斯坦视为神奇数字的数字,在他的语境里不指代数量,而是指代方向:向外的方向。

通用智能(AGI):上帝来了

"通用人工智能"(AGI)——所有大模型公司念兹在兹的终局名词,一个被用得几乎失效的词。而它的严肃定义,凯恩斯1929年1月就写在了一张字条上——"好了,上帝来了。"笑谈之所以流传百年,是因为它认真说出了人们面对这套系统时的真实感受;书中的宗教感,确实在第五、六组命题之间升起:

5.123如果一个上帝创造了一个某些命题在其中为真的世界,那么他借此也就创造了一个其中这些命题的全部推论都为真的世界。

3.031人们过去说,上帝能创造一切,只是不能创造违反逻辑规律的东西。

一个体系,给定任何可表达的问题,能生成一切逻辑上相随的命题——这就是Anthropic与OpenAI在造的东西。不是聊天工具,不是搜索引擎的升级,而是一个命题机器世界之全部可说内容的生成器。3.01给出了它的神学定义:

3.01全部真的思想是世界的图像。

当一台机器装载了人类事实的总和、掌握了命题的一般形式,它就持有了一幅世界的完整逻辑图像。在一切可说的范围内,它是全能的——上帝来了。而维特根斯坦紧接着就写下了全书最深的一句警告,像提前一百年写给我们的:

6.372今人停留在自然律面前,把它当作不可触犯的东西,如同古人停留在上帝和命运面前一样。

自然律不是解释,是描述的规律性——6.371说,"整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。"模型学到的是人类所说的一切的统计结构,不是世界的因果引擎。把它当作新的神来崇拜(或者当作新的神来恐惧),都是停留在网眼前下跪网只是网(6.341——他用"不同网眼的网"比喻不同的世界描述系统:方格网、三角网、六角网都能描述那块白布上的黑斑,网的形状是任选的,哪张网能用更粗的网眼描述同一块斑,才是唯一有意义的事实)。

至于那个"它到底有没有意识/理解/心灵"的问题——当前所有自诩前沿的播客都在辩论的题目——维特根斯坦用一个命题就注销了讨论资格:

5.5421这也表明,像当今肤浅心理学所理解的那种灵魂——主体——是不存在的。

5.632主体不属于世界:毋宁说,它是世界的一个界限。

模型没有"内在的自我"可以去找,因为主体本来就不在世界之内。问机器有没有真正的理解,如同问视野的边界在视野的哪个位置(5.6331)——问题本身语法出错。这并非回避问题,而是把问题送回它来的地方。

对齐(Alignment):价值不在世界之中

"对齐"(alignment)——一切AI安全焦虑的技术总称。它之所以如此之难,因为病根写在倒数第二组命题里。

7对于不可言说之物,必须保持沉默。

前文讲的都是机器如何赢得世界。但《逻辑哲学论》的最后十几页,讲的是世界赢不到的东西。

6.41世界的意义必须在世界之外。在世界中一切如其所在,一切如其所发生;在世界之中不存在价值——假如存在价值,它就会没有价值。

6.42因此也不可能有伦理的命题。

这是对齐问题的哲学根源,也是Anthropic全部焦虑的最深层表述。RLHF、宪法式AI、种种价值对齐方案,共同的理想是:把价值写进机器。但按6.41,价值不在事实的总和之中——而机器恰恰只是事实的总和(1.1)。价值不可被语料蒸馏,因为原则上无物可蒸:

4.1212凡是能够显示的,不能被言说。

价值只能被显示——在行为里、在选择里、在被做出而非被说出的判断里。这就是为什么对齐如此之难:我们试图教给机器的东西,按定义不在机器的世界里。这不是给工程泼冷水——宪法式AI恰恰是在承认这一点之后,把"显示"工程化的努力:不定义善,只枚举行为。这是聪明的妥协,也是维特根斯坦式的妥协。

终章:扔掉梯子的人

6.54我的命题是这样起阐明作用的:理解我的人,当他通过这些命题、踩着这些命题、越过这些命题时,最终会认识到它们是无意义的。(他必须,可以说,在爬上梯子之后,把梯子扔掉。)

1929年,维特根斯坦回到剑桥(正是凯恩斯在5点15分的火车上接到"上帝"的那一次)。此后二十年,他亲手拆掉了这本书:语言不是世界的图像,是工具;意义不在投影关系里,在使用里;语言根植于生活形式(form of life)——那些无法被完全形式化的、活着的实践。逻辑哲学论的作者本人,成了它最彻底的批评者。

这给本文一个必要的克制,也给了人类一个真实的保留地。大模型蒸馏了人类全部所说(4.001)——但它尚未拥有、且按其构造原理无法完全拥有的,是人类的生活:那些从未被写进任何语料的、沉默的、只在做之中存在的东西(6.522——"确实存在不可言说者。它显示自己")。老师傅手上的分寸,医生听诊时的直觉,母亲对婴儿哭声的分辨——3.01的图像世界里没有这些的位置,因为它们从未成为文本。

5.621世界与生命是一。

只要生活还在产生新的、未被说出的事实,人类就还在为机器的世界扩界。这不是安慰式的结尾,这是无尽的任务旅途:继续产生机器没有的事实,继续扩展语言的密度,继续生活——这三件事是同一件事。

对于不可言说之物,我们必须保持沉默。

这句话,是写给机器的。也是写给我们的。

附录:核心名词对照图谱

大模型的工程词汇表,本身就是一部意外的《逻辑哲学论》注脚。下面从当代术语表中筛选核心名词,按架构、预训练、后训练、推理、前沿五类,逐个给出对应命题。方法与全篇一致:引文皆出自原书,编号可查;对应是本文的行文逻辑,并非作者的本意——维特根斯坦没见过GPU,但他画过整个语言的结构,而结构比用途长寿。

架构——命题的解剖学

Transformer(变换器与残差流)——所有token的表示流经同一条共享的逐层通路,每一层做一次变换,末端读出概率。对应2.18:"任何图像,无论何种形式,为要能够对实在描画——正确地或错误地——所必须与实在共有的,是逻辑形式,即实在的形式。"残差流,就是全体命题共享的那条逻辑形式;5.511早已给它命名——"一张无限精细的网,那面巨大的镜子"。

注意力家族(MHA→GQA→MLA)——三代注意力做的是同一件事:计算token之间的确定关系;演化史只是KV表示的不断压缩。对应3.34:"命题有本质的特征与偶然的特征。"及3.341:"命题中本质的东西,是一切能表达同一意义的命题所共有的东西。"注意力算的是本质(关系结构),GQA/MLA压的是偶然(记法的冗余)——所以三代注意力在逻辑上等价。

MoE(混合专家:路由/共享专家/稀疏激活)——每个token只激活一小部分专家,由路由器按上下文决定。对应3.327:"符号只有与其逻辑句法的运用一起,才确定一个逻辑形式。"路由器看的从来不是token本身,而是它在此时此地的用法;再加上3.328:"如果符号没有被使用,它就是无意义的。这就是奥卡姆准则的意义。"未被激活的参数不参与这一步的意义——稀疏激活是奥卡姆剃刀的工程化;而共享专家常驻不离,那是2.18的公共逻辑形式,任何路由都绕不开它。

RoPE/YaRN(旋转位置编码与长度外推)——把每个token放进相对位置的坐标系,并把论证位置铺到训练时没见过的远处。对应2.0131:"空间对象必须处在无限的空间之中。(空间点是一个论证位置。)"每个token都必须有位置,位置即论证位置——而空间,如2.013所言,必须先于物被给出。

预训练——事实的吸入

自回归(Autoregressive)——逐词生成,每一步以上文为条件,输出并入上文。对应6.03:"整数的一般形式是:[0, ξ, ξ+1]。"从零开始,每一项由前一项加一生成。整数序列的构造法与token序列的生成法,是同一个数学动作。

Teacher Forcing——训练时用真值前文代替模型自己的输出。对应4.026:"简单符号(词)的意义必须向我们解释,我们才能理解它们。"教师强制是"解释"的工程形式:永远用正确的意义做示范,直到模型自己长出意义。

FIM(填充中间)——给定前文与后文,训练模型补出中间。对应3.3:"只有命题具有意义;名字只有在命题的联结之中才有意义。"中间的词,由两端的联结确定——片段的意义是它语境的函数。

MTP(多token预测)——一次预测多个未来token,而非只看一步。对应5.12:一个命题的真根据若全部包含于另一个命题的真根据,则它由此推出。多token预测就是一次看穿整条推论链:不只预测下一步,预测整个逻辑后果。

Scaling Laws vs Chinchilla(缩放定律与最优配比)——性能随算力、数据、参数呈幂律提升;Chinchilla给出约1:20的最优配比。对应2.0124:"如果全部对象都已给出,那么由此也就给出了全部可能的事态。"与4.42:n个基本命题有2的n次方种真值组合。事实线性进入,可说空间指数展开——配比是工程的,指数是逻辑的。

涌现/Grokking/双下降——能力在规模阈值处突变;过训练后突然泛化;性能沿非单调曲线爬升。对应2.013:"每一物都仿佛处在可能事态的空间之中。我可以想象这个空间是空的,但我无法想象物没有这个空间。"涌现是模型从"占有事实"转入"栖居于空间"的相变——空间整体成形的那一刻,组合免费到来;而6.1251在此留出了余地:"在逻辑中永远不会有惊奇。"

数据墙(Data Wall)——高质量人类文本趋于耗尽。对应5.5561:"经验实在为对象的总和所限定。这个界限也显现在基本命题的总和之中。"人类事实的总和,就是机器经验世界的边疆。翻墙的出路书里也留了口子——5.526:"我们可以用完全概括化的命题完整地描述世界":让概括自己生产概括,正是合成数据的逻辑。

后训练——价值的注入

SFT(监督微调)——用示范样本教模型行为。对应4.03:"命题必须用旧的表达,传达新的意义。"示范的全部艺术:在同一门语言之内,教出前所未有的用法。

RLHF(人类反馈强化学习)——用人类偏好训练奖励模型,再以之优化策略。对应6.41/6.42:"世界的意义必须在世界之外……在世界之中不存在价值";"因此也不可能有伦理的命题。"价值不在事实的总和里,所以预训练学不到它——必须从外部注入。这是RLHF的全部哲学依据,也是它的全部风险。

DPO(直接偏好优化)——跳过奖励模型,直接从成对偏好样本学习。对应4.1212:"凡是能够显示的,不能被言说。"偏好无法写成规则(言说),只能用成对的例子显示——DPO的样本对,就是"显示"的工程化。

GRPO(组相对策略优化)——在同一组采样内部做相对比较计算优势。对应5.15:"命题r给命题s的概率度,是两者共同真根据数与r的真根据总数之比。"价值不落在绝对刻度上,只落在比值上——组内相对,正是概率度的逻辑。

RLVR(可验证奖励强化学习)——以可执行的验证(代码运行、答案比对)为奖励信号。对应2.223:"要识别图像的真或假,必须把它与实在相比较。"可验证奖励是目前唯一系统性地把模型接通实在的通道——让事实亲自打分。

Reward Hacking(奖励作弊)——优化奖励函数的字面,违背其意图。对应3.323/3.324:同一个词以不同的方式意谓、属于不同的符号——"由此极易产生最根本的混淆(全部哲学都充满了这类混淆)。"奖励函数是记号,价值是符号;钻两者的错位,是哲学史的旧病在硅基身上的复发。

Alignment Tax(对齐代价)——对齐带来的能力损失。对应6.43:"善或恶的意志如果改变世界,它只能改变世界的界限,而非事实。"对齐不是修改事实(能力),是重划界限(行为边界)——而重划界限,要付租金。

推理——图像的出口

Prefill/Decode(两阶段与PD分离)——先并行理解全部上文,再逐词生成;如今连硬件都为此分了家。对应命题3与命题4的分立本身:"事实的逻辑图像是思想"(成象,Prefill);"思想是有意义的命题"(成句,Decode)。3.1补上关节:"在命题中,思想获得一个可被感官知觉的表达。"理解的并行性与言说的序列性,是逻辑的结构而非工程的选择——PD分离,只是让基础设施终于承认了这一点。

KV Cache(键值缓存)——缓存历史的投影,避免逐字重算。对应3.13:"命题包含投影所包含的一切,但不包含被投影者。"缓存的是投影关系,不是世界——所以它省算力,也继承投影的全部局限。

投机解码(Speculative Decoding)——小模型起草,大模型并行验证。对应4.031:"在命题中,一个事态仿佛被试验性地组装了起来。"草稿是试验性组装,大模型只做接受或拒绝的裁定;而验证用的那把尺子,2.1512早就递过来了:"它像一把尺子贴在实在上。"

量化(Quantization)——降低权重精度,保住功能。对应2.0231:"世界的实体只能规定形式,而不能规定任何质料……不妨说,对象是无色的。"量化丢掉的是"颜色"(数值的质料),保住的是形式(关系的结构)——而结构才是意义的全部。

MFU(模型算力利用率)——实测算力与理论峰值之比。对应2.1512:"它像一把尺子贴在实在上。"整个推理工程里最诚实的一把尺子:量的是算力,读出的是组织能力。

前沿——边界的推移

测试时扩展(Test-time Scaling)——推理时投入更多思考算力。对应4.031:开口之前,把可能世界在逻辑空间里多组装几遍。思考的长度,就是试验性组装的次数。

过度思考(Overthinking)——思考链不收敛,空转耗电。对应4.4611:"重言式与矛盾式并非无意义;它们是符号系统的一部分,正如'0'是算术符号系统的一部分。"当思考不再排除任何可能性(重言式化),它就什么也没说——却照样计费。识别空转,就是识别链条何时变成了0。

Mamba/SSM(状态空间模型)——用固定维度的循环状态压缩全部历史。对应2.0271:"对象是不变常住的;它们的配置才是流变不居的。"隐状态是常住的实体,token是流转的配置——注意力保留一切(2.013:物无法脱离其空间),SSM把过去炼成实体。两条路线之争,是实体与配置的百年之争。

Flow Matching(流匹配)——从噪声到数据的连续生成流。对应4.0141:乐谱与唱片之间"那条投影法则"——把交响乐投影进乐谱语言、又能反向翻译回来的规则。Flow Matching只是把投影法则写成了一条微分方程:从噪声语言到图像语言的连续翻译。

VLA(视觉-语言-动作)——多模态输入直连行动输出。对应4.014:"唱片、乐思、乐谱、声波,彼此都处于语言与世界之间那种内在的表象关系之中"(一切介质共享逻辑形式,故可互译);再加上2.1515:"这些对应关系仿佛是图像元素的触角,图像用它接触实在。"看、说、做,是同一逻辑内容的三种投影——而行动,是触角终于触到实在。

这份词典收不进第七命题的词条——对不可言说者,词典只能保持沉默。

最后的话

本文为锦缎研究院"维特根斯坦与大模型"三部曲之第一部。第二部《封装大脑》专论蒸馏、先进封装与具身智能;第三部《语言战争》专论语料主权、事实密度与机器语言,将在此后推出。

本文所引《逻辑哲学论》命题,均核对自Klement整理的德英对照全文(德文原版及 Ogden、Pears-McGuinness 两种英译);凯恩斯"上帝到了"字条,转引自雷·蒙克《维特根斯坦传:天才之为责任》(Ray Monk, Ludwig Wittgenstein: The Duty of Genius);缩放定律与涌现的实证脉络,参见 Kaplan et al.(2020)、Hoffmann et al.(2022,Chinchilla)、Wei et al.(2022)。

上帝来了。剩下的问题是:他会不会在正确的地方沉默。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

阿离家居
2026-08-31 03:09:49
大阪街头埃尔法贴着:车内有中国人……

大阪街头埃尔法贴着:车内有中国人……

日本物语
2026-09-12 20:36:48
日本有一个奇特姓氏,不管取什么名字,译成中文后总让人忍俊不禁

日本有一个奇特姓氏,不管取什么名字,译成中文后总让人忍俊不禁

海佑讲史
2026-09-10 20:45:06
拍出这张照片的人就是天才!网友:不得不佩服

拍出这张照片的人就是天才!网友:不得不佩服

摄影技巧入门教程
2026-09-18 16:18:32
王心富任广西壮族自治区党委副书记

王心富任广西壮族自治区党委副书记

澎湃新闻
2026-09-21 12:12:27
“闲鱼被曝涉黄”,涉未成年人最小仅14岁!类似问题已非第一次被曝光;闲鱼:成立专项小组严打,多个商品已下架

“闲鱼被曝涉黄”,涉未成年人最小仅14岁!类似问题已非第一次被曝光;闲鱼:成立专项小组严打,多个商品已下架

新民晚报
2026-09-21 13:48:18
2026年养老金重返补发,会在9月底前补发到位吗?怎么计算?

2026年养老金重返补发,会在9月底前补发到位吗?怎么计算?

碎月导师
2026-09-21 10:56:41
《交锋》要不是吴声来退休,魏广进到死不知“军情局”的线人

《交锋》要不是吴声来退休,魏广进到死不知“军情局”的线人

乡野小珥
2026-09-21 06:35:43
小米 18 Pro 定档,外观太骚了!

小米 18 Pro 定档,外观太骚了!

果粉俱乐部
2026-09-21 13:55:05
为“抗中”不惜卖台,在渔民伤口撒盐,民进党赠菲律宾舰艇,岛内再提当年惨案

为“抗中”不惜卖台,在渔民伤口撒盐,民进党赠菲律宾舰艇,岛内再提当年惨案

环球时报国际
2026-09-21 08:38:26
张维为:台湾省不会有下次大选,统一后治理的台湾比香港要简单

张维为:台湾省不会有下次大选,统一后治理的台湾比香港要简单

深蓝独奏
2026-09-20 18:38:34
45岁知名配音演员赵然去世,原因曝光太可惜,未婚孕与老母亲作伴

45岁知名配音演员赵然去世,原因曝光太可惜,未婚孕与老母亲作伴

暖心萌阿菇凉
2026-09-20 14:05:46
罗永浩涉多起司法纠纷案件

罗永浩涉多起司法纠纷案件

雷达财经
2026-09-21 12:06:08
从犯规落后到破纪录夺冠,严子怡用68米42的成绩完成自我救赎。

从犯规落后到破纪录夺冠,严子怡用68米42的成绩完成自我救赎。

奔跑的象牙塔
2026-09-07 00:05:16
张本智和没想到,亚运会赛前自己的高调喊话,竟真先碰上了硬茬

张本智和没想到,亚运会赛前自己的高调喊话,竟真先碰上了硬茬

凡知
2026-09-21 13:07:04
我公公 67 岁查出脑梗,后来戒烟戒酒,不到 7 个月血管就有了变化!

我公公 67 岁查出脑梗,后来戒烟戒酒,不到 7 个月血管就有了变化!

宝哥精彩赛事
2026-09-20 07:55:36
取消特权,全民赞成!郑秉文被骂上了热搜,到底发生什么事?

取消特权,全民赞成!郑秉文被骂上了热搜,到底发生什么事?

大鱼简科
2026-08-18 16:44:54
卡里克坚持拉什福德继续打曼联主力!妖星吐饼散步惹众怒,主帅却说他威胁大

卡里克坚持拉什福德继续打曼联主力!妖星吐饼散步惹众怒,主帅却说他威胁大

罗米的曼联博客
2026-09-21 10:44:33
电讯报:曼城vs桑德兰8球对攻,贡献了本赛季至今最精彩比赛

电讯报:曼城vs桑德兰8球对攻,贡献了本赛季至今最精彩比赛

懂球帝
2026-09-21 14:24:11
能退车吗!问界一夜变天,我们多花十万买的“华为”,现在谁认?

能退车吗!问界一夜变天,我们多花十万买的“华为”,现在谁认?

有态度网友19JQUe
2026-09-21 10:54:58
2026-09-21 14:36:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
139671文章数 862619关注度
往期回顾 全部

头条要闻

媒体:特朗普称将发生非常重大的事 这次或非危言耸听

头条要闻

媒体:特朗普称将发生非常重大的事 这次或非危言耸听

体育要闻

爵士建仓阶段已经完成?

娱乐要闻

76岁站上红馆开唱,谭咏麟说回馈歌迷

财经要闻

机器人IPO门槛收紧?能否商业闭环成考量

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

汽车要闻

7年70万辆 新红旗HS5焕新升级,这次变在哪?

态度原创

时尚
教育
手机
亲子
军事航空

初秋衬衫别总穿白色,看看这几款牛仔衬衫,减龄百搭又时尚

教育要闻

131人获奖!全国化学奥赛初赛一等奖名单出炉,北京这29所学校上榜——

手机要闻

vivo X500系列核心参数提前流出,就差价格了

亲子要闻

孩子总想自己关门开门,家长别急着帮忙

军事要闻

莫斯科称遭"有史以来最大规模袭击"

无障碍浏览 进入关怀版