陶哲轩表示,今天大语言模型背后的数学其实很简单。训练和运行它们主要用到线性代数、矩阵乘法,再加一点微积分,这些是本科生就能处理的材料。我们理解如何搭建和运行这些模型。
真正的谜题在于:为什么它们在某些任务上表现极好,在另一些任务上却会失败,而且我们无法提前预测。我们缺少好的规则来预测模型在不同任务上的表现,所以进展很大程度上依赖经验。
![]()
一个关键原因,是真实世界数据的性质。纯噪声已经被理解得很透彻,完全结构化的数据也被理解得很透彻,但自然文本处在两者之间——一部分有结构,一部分是随机的。而针对这个中间地带,数学工具是稀薄的,这有点像物理学在原子和连续介质之间的介观尺度上遇到的困境。
正因为存在这个缺口,我们目前只能描述模型运作的机制,却还不能解释能力跳变,也无法给出可靠的任务级预测。陶哲轩说,这种错位——简单的机械结构,对应难以预测的行为表现——才是核心谜题。
这段表述来自Brian Keating教授的YouTube频道视频。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.