智猩猩AI整理
编辑:林夕
8月31日晚,智谱2026年中期业绩会上,智谱创始人唐杰谈到了下一代GLM-6.0,也谈到了一个比“把模型做大”更激进的方向:Fully Self-Training,全自训练,唐杰又往前走了一步。
在唐杰看来,大模型的Scaling并没有结束,只是它正在变成另一件事情。
他反复谈的是:模型为什么会变强?Scaling到底应该怎么Scale?后训练还有多少空间?长周期任务怎么做?模型能不能自主训练?
面对外界关于为什么不继续堆参数的质疑,他也没有简单回答“我们不需要更大的模型”,而是把问题拆成了参数、数据、算力、训练和部署等不同变量。
Scaling从来不是简单地把模型做大,而是找到那个阶段最值得继续放大的变量。
最近他公开谈Scaling时也明确强调,参数量并不是判断模型能力的唯一维度。GLM-5.3和GLM-5.2采用相同基础模型,通过扩大长周期任务环境和强化学习后训练获得能力提升。
![]()
唐杰这段时间一直谈的Coding、Agent和Long Horizon Task,指向的也是这一层。
模型能力的提升,已经不只是把底座做大这一件事了。
一个模型能不能真正变强,还取决于它在什么环境里训练、训练多久、能够完成什么样的任务,以及能不能从一次次任务中获得有效反馈。
GLM-5.3就是一次很直接的验证。
它和GLM-5.2采用相同基础模型,在参数规模没有变化的情况下,通过扩大后训练规模和长周期任务环境,让模型在真实任务中的完成能力继续提升。
![]()
那么问题自然就来了:如果后训练和任务环境本身就是Scaling的一部分,能不能把这些事情也逐渐交给AI?
这就走到了唐杰所说的Fully Self-Training。
他的设想比字面听起来更具体。过去,研究人员设计任务、准备数据、搭建环境、训练模型,再由人来判断模型到底有没有变好。
往后,这些环节会一段一段交给AI,自己生成和筛选训练数据,自己构建任务环境,自己完成任务拿反馈,再根据结果进入下一轮训练。
甚至连训练模型所依赖的基础设施,也可以开始由AI参与优化。比如智谱已经在用GLM-5.3驱动的Infra Agent参与推理内核、性能诊断和服务栈优化。
模型就这样进入了原本属于工程师的工作链条,一边在系统里运行,一边反过来优化承载自己的系统。
于是,一个新的循环开始出现:
GLM生成任务环境 → 下一代GLM在环境中训练;
GLM优化训练和推理系统 → 系统再承载更强的GLM。
这才是Fully Self-Training真正有意思的地方。
它并不是突然让AI自己变强,而是让AI逐渐接管训练过程中越来越多原本需要人完成的环节。
这条路最难的地方,也恰恰在这里。
如果只是让模型不断生成数据、不断训练,并不意味着它真的能够自我进化。
模型必须知道哪些数据值得留下,知道自己的答案什么时候是错的,还要知道什么时候应该继续训练、什么时候已经训练得足够。
唐杰认为,这种自我判断能力可能才是全自训练最核心、也最难解决的问题。
因为一旦模型无法可靠地判断对错,错误就可能随着训练循环不断被放大;只有模型能够持续发现问题、验证结果并修正自己,这个闭环才真正有可能跑起来。
这也是唐杰为什么把GLM-6.0的技术方向指向Full Self-Training。
8月31日的这场会上,他首次明确谈到了下一代GLM-6.0的这一技术路线,但并没有公布具体发布时间。
所以现在还不知道GLM-6什么时候真正到来,但方向已经越来越清楚了:过去,人训练模型;后来,人让模型帮自己完成工作。
而唐杰正在尝试的下一步,是让模型开始参与训练模型这件事本身。
唐杰将这一路线称为Full Self-Training,在海外相关讨论中,也常被放在RSI——Recursive Self-Improvement,递归式自我改进的框架下理解。
当然,这并不意味着今天的AI已经能够完全自主完成这套流程,相反,唐杰也明确提到了其中仍然存在大量人工环节。
但至少,GLM-6.0的方向已经被摆到了桌面上,从训练一个更强的模型,到让模型参与训练下一个自己。
这可能才是唐杰这次真正往前走的一步。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.