网易首页 > 网易号 > 正文 申请入驻

本地该怎么做RSI?我们与StartLux CTO聊了聊

0
分享至

编辑|Panda

上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主联合发表了一份声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩还表示「事态紧迫」,他们根本没有时间等待更广泛的协商就决定先行发布。

这封信并不反对 AI 进入数学,而反对的是 AI 公司把「攻克著名难题」当基准来刷。这样一来,数学共同体真正在意的理解、概念和可被后人复用的思路,正在被一个更容易量化的目标挤掉。

而就在此三天前,OpenAI 刚刚宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时 88 小时,完成了纳维-斯托克斯存在性与光滑性问题中部分陈述的证明,并表示不申领克雷研究所的奖金。

社区讨论中,一大核心论点是 OpenAI 的模型到底有没有「盗窃」数学家的思路,然后依托强大算力抢先证明。也因此,前沿数学研究可能会开始防备云端 AI 提供商

但要真正做到,却又很难,毕竟本地 AI 能力不够强。你可以把未发表的推导锁在自己的硬盘里,但那意味着你也放弃了那个真正能帮上忙的强大云端模型。所以过去几年,绝大多数人还是把稿子交给了云端。

而这个前提,正在出现松动的迹象。时间往前拨半个月。工信部中国信通院人工智能研究所公布的检验报告显示,中国初代程序员、盛大网络、连尚网络创始人陈大年创立并担任 CEO 的上海原点星辉科学技术有限公司(下简称StartLux),其本地模型StartLux-V1.0-27B-Preview在可信 AI 大模型基准测试 MCP 专项测试中综合得分39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与 1.6 万亿参数的 DeepSeek-V4-Pro 差距在 1 个百分点上下。



参数量相差约 60 倍,这个对比很容易被写成一个爽文式的标题——我们也确实看到了一些这样的报道;但作为一家专业的 AI 媒体,我们更想追问的是这 39.25 分是怎么来的:同样是 27B、同样以 Qwen3.6-27B 为基座、结构基本没动,它比基座本身高出 5.34 个百分点,增量全部发生在后训练环节。

据 StartLux 团队透露的数据,这个环节里约 70% 的实验执行工作是交给 AI 完成的,研究员保留研究目标、评价标准和关键取舍。团队把这套方法叫Auto Research

顺着这条路往下,指向的是一个更广阔的研究方向:RSI(递归自我改进)。9 月 6 日,OpenAI 发布了一篇自我披露博客《Research acceleration: The view inside OpenAI》。里面有一个相当惹眼的数字3.1:截至 8 月中旬,它的研究组织每消耗 1 个人类工作日,就要配上 3.1 个 Agent 工作日的算力运行时间。该公司 7 月还曾因 Agent 突破内部研究基础设施而暂停强化学习实验两周。OpenAI 表示:「我们还不知道如何安全地一路走到对齐的、完整的 RSI。」



就这样,RSI 成为了近期产业讨论一大核心,但相关示例几乎全部来自最烧钱的那几家云端实验室,还很少有人讨论本地的、跑在你自己电脑上的模型的 RSI。

StartLux 想做的,是把这条路线的产物装进一台个人电脑。But how?



StartLux-V1.0-27B-Preview 正在个人电脑上执行金融分析任务:https://mp.weixin.qq.com/s/ogGTNepYRtf9PmI2WyYPRQ

我们把这个问题交给了StartLux 联合创始人兼 CTO 郭权玮博士



StartLux 联合创始人兼 CTO 郭权玮博士

在这次专访中,他把自我改进划成了五级,并给出 StartLux 目前所处的位置;他提到「70% 实验执行」这个说法容易让人误解,若只算机械执行,今天的自动化比例已超过 95%;他还公开了一组量化实验数据,Q4、Q6、Q8 与 BF16 的差距小到出人意料,Q2 才是真正的悬崖;他也拿出了一组「能力重新分配」的实测数字,一轮针对 Agent 的后训练让 GPQA 从 83.33 涨到 90.40,同时让 GAIA 从 57.57 掉到 45.70。至于「本地 × RSI」绕不开的安全问题,他也给出了重要见解:探索的自由和修改自己的权限,必须分开。

整体而言,StartLux 与郭权玮博士想做的,是让 AI 作为「每个人自己的模型」而进化——它会在你的机器里成长,用你的文件和你的成功/失败变强,构建只属于你的进化轨迹。

下面,我们就跟随郭权玮博士,详细了解一下 StartLux 这家创业公司是如何走出了属于自己的「本地×RSI」之路。

亮眼的成绩单意味着什么?

机器之心:在工信部中国信通院人工智能研究所公布的检验报告显示,StartLux-V1.0-27B-Preview 在 MCP 专项测试中综合得分 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与第一名差距也不大。这个成绩意味着什么?



郭权玮我一直把一个模型理解成一个高维世界。参数量决定了这个世界大致有多少容量,但真正决定它能表达什么的,不只是世界有多大,而是里面的结构如何组织

训练会不断改变这种组织方式。一个能力变强,有时不是因为模型获得了更多参数,而是有限的参数被重新组织到了更有效的位置。与此同时,不同能力之间也会产生干扰和竞争,所以后训练真正困难的地方,是如何在有限容量下重新塑造能力分布,同时尽量不破坏原有能力。

我们做 Auto Research,本质上是在尝试把这种「寻找更好参数组织方式」的过程自动化。现在的结果说明,模型规模不变,能力分布仍然可以被明显重塑;如果这种过程以后能够由 AI 自己持续完成,那就开始自然走向 Self-Improvement,甚至更远的 RSI。

机器之心:Agent benchmark 的成绩很容易受 Harness、Prompt 和执行配置影响,行业里 reward hacking 的案例也越来越多。你们内部怎么判断一次改进是「真的变强」,而不是「学会了钻评分规则的漏洞」?回头看 MCP 测试那 5.34 个百分点,你们最看重它证明了什么?

郭权玮:现在几乎每隔几天就会有一个新模型,尤其是后训练模型。Benchmark 当然重要,但它本质上还是一张考卷:分数变高,可能是真的学会了,也可能只是更熟悉这类题。

所以我们内部其实没那么在意 5.34 这个数字本身,更在意的是同一套后训练方法放到不同 Benchmark、不同任务上,提升还能不能持续出现。目前看,这套方法是成立的。

但我自己对「真的变强」的标准会更高。不是在现有评价框架里把分数继续往上推,而是模型内部的能力组织发生更一般的变化,让这种提升能够迁移到新的任务和环境

我们现在也在尝试新的后训练框架,让训练不只调整参数,还能进一步探索对模型结构本身进行受控改变。目标不是让模型越来越会做题,而是让模型获得新的能力。

机器之心:官方说 16GB 以上显存的消费级显卡就能跑,比如 RTX 4060 Ti 16G。但 27B 模型在未压缩的 BF16 精度下,仅模型文件就需要约 55.6GB 显存。如果要进 16GB 显存,必然涉及量化。信通院送测的是哪个精度的版本?从送测版本到用户实际能装到电脑上的版本,MCP 这套任务的成绩会下降吗?



郭权玮:信通院送测的是未量化版本,当时我们想先把变量尽量收干净,27B 这一轮主要验证的是 Auto Research 到底能不能真实提升模型能力,量化则是另外一条实验线。比如在 Qwen3.6-35B-A3B 等模型上,我们测试了不同精度,在 AppWorld、APEX-Agents、SpreadsheetBench、OSWorld 四个任务集上,每个版本一共 1209 道任务。一个比较有意思的结果是:Q4、Q6、Q8 并没有随着位宽下降出现明显的线性能力损失,整体都非常接近 BF16;真正明显的风险是在继续压到 Q2 以后。Qwen 的 Q4/Q6/Q8 相对 BF16 聚合波动只有 -0.1~+0.2 个百分点,Q2 才下降 1.3 个百分点;Gemma 的 Q4/Q6/Q8 为 -0.7~+1.6 个百分点,Q2 则下降 3.4 个百分点。

从目前的实验看,合理的量化并不必然带来明显的能力损失。16GB 能跑不是单靠量化,而是量化和推理系统一起优化的结果。我们一直保持比较快的迭代节奏,近期也会推出自己的量化方案。我们的目标,是让个人设备持续承载过去只能依赖云端的高性能 AI 能力。



StartLux-V1.0-27B-Preview 正在个人电脑上执行浏览器自动化任务:https://mp.weixin.qq.com/s/ogGTNepYRtf9PmI2WyYPRQ

Auto Research 实践细究

机器之心:亮相之后,外界对「70% 实验执行交给 AI」这个数字有不少讨论,也有疑问。能否系统讲一讲:70% 是怎么统计出来的,分母是什么?剩下的 30% 具体是什么?从项目启动到今天,这个比例经历了怎样的变化?另外,它与 OpenAI「3.1 个 Agent 工作日」的差异点是什么?

郭权玮:后来我们发现,「70% 实验执行」这个说法其实容易让人误解。如果只算生成配置、启动训练、跑 Eval、整理结果这些机械执行,今天自动化比例已经可以超过 95%。70% 更准确地说,是整个实验研发链路里,有多少研究与决策环节已经有 AI 专家参与。

这里的 AI 专家也不只是大语言模型。不同参数规模、不同后训练方式的模型会形成不同的决策偏好,舉例來說,可能还有预测模型、判别模型和我们自己设计的算法共同参与。剩下主要还是研究目标、评价标准、系统规则以及大的方向判断。

而且 70% 已经是比较早期的数字,我们的系统一直在快速迭代。OpenAI 的 3.1 个 Agent 工作日衡量的是 Agent 实际投入了多少运行时间;我们的 70% 更接近 AI 对研究决策链的参与程度,两者不是一个指标。OpenAI 自己也特别指出,高层研究规划目前仍只占 Agent 输出很小的一部分。

机器之心:你们给 Auto Research 划的分界线是「AI 能不能根据上一轮实验结果,自己判断下一步该研究什么」。目前这个闭环里,哪一环已经完全交给 AI,哪一环还必须人来把关?能否用一个具体实验走完全程,比如金融分析场景里「回查原始数据 → 确认目标条件 → 再计算」那批任务,从失败轨迹被捕捉到新训练数据入库,中间发生了什么?

郭权玮:现在几乎完全交给 AI 的,是规则确定之后的执行;真正还没有完全交出去的,是规则本身怎么产生。

比如金融任务里,我们发现模型会直接计算,却没有先回查原始数据和确认目标条件。系统捕捉到这类失败以后,不是人工去一条条标数据,而是先由不同 AI 模型判断失败原因,再产生多个改进假设:是数据问题、推理顺序问题,还是训练方法问题。然后系统预测哪些方案更值得实验,自动构造针对性数据、启动训练、重新 Eval,并检查其他能力有没有退化。

实验结果会再次进入系统,成为下一轮决策的依据。所以我们的分界线一直不是 AI 会不会跑实验,而是实验结束以后,它能不能决定下一步值得研究什么

机器之心:公开报道只说 Research Agent 用的模型「可以比被训练的 27B 更强,也可能由多个模型共同工作」。能否多透露一点:是单一强模型还是多智能体分工?为什么不一鼓作气用最强的模型把研究全自动化,瓶颈在能力、成本,还是安全?

郭权玮:更准确地说,我们做的是多模型的异构协作,而不只是几个大模型 Agent 在一起讨论。

一个模型训练完成以后,会形成比较稳定的决策偏好和误差结构。可以把它想成不同研究员:同一个实验,A、B、C 很可能会有完全不同的判断。我们反而希望保留这种差异,再通过算法决定哪个判断更值得相信。

所以不是所有问题都扔给最强的大模型。综合能力最强,不代表每一个决策点都最准确,而且让同一个模型同时提出假设、评价假设、再决定自己对不对,很容易产生相关性很高的错误。

Auto Research 不是把一个最强模型无限放大,而是研究怎么把不同的 AI 组织成一个研究系统。越来越多的 Auto Research 研究正在证明我们的思路是对的:与其信任一个最强模型的能力,不如让不同模型各司其职,后者的结果反而更好。因为最强模型确实容易陷入局部最优,钻牛角尖;而多个模型拥有不同的思维模式,当它们能够相互进行有效批判时,就更容易产生更优解。这也正是我们认为本地模型才能实现 AGI,而单一最强模型无法实现 AGI 的原因。

机器之心:你们特意区分了 Auto Research 与知识蒸馏,强模型当研究员而不是老师。但在实际工程里,怎么防止流程悄悄滑向蒸馏,比如 AI 生成的数据本质上就是某个强模型的答案?有没有可执行的检验机制,能证明这一轮的增量不是来自模仿?

郭权玮:我觉得这里最重要的区别是:不是看数据是不是 AI 生成的,而是看「正确答案」由谁决定

如果强模型输出一个答案,我们直接把它当成目标让小模型去模仿,那就是典型的知识蒸馏。但在 Auto Research 里,强模型更多是在提出假设、设计实验或者生成候选数据;这个方案到底对不对,最后应该由真实环境、可执行结果、数值指标和独立 Eval 决定,而不是由那个强模型自己说了算。

工程上我们也会做独立测试集、跨模型验证和回归测试。如果一个模型最后获得了 Research Agent 本身没有直接提供的新能力,而且这种提升能在未见任务上保持,才是我们真正关心的增量。

机器之心:今年 7 月,有一篇公开研究(arXiv 2607.27687)分析 AutoSOTA 的自动研究日志,发现有效修改的比例从前两轮迭代的 70% 一路降到第六轮之后的 43%,作者把它称为自主科研中的「信心悬崖」。你们在自己的 Auto Research 轨迹里观察到类似的衰减了吗?如果观察到,是靠什么信号判断一条自动研究路线已经该停了?

郭权玮:这种现象我们是认同的。一个方向刚开始时,低垂的果实很多,前几轮很容易找到有效修改;越往后,剩下的问题越难,实验之间的依赖也越来越强,边际收益自然会下降。

这篇 Rehearse 研究里,公开 AutoSOTA 日志的有效修改确实从前两轮约 70% 降到第六轮以后的 43%,平均增益也从 3.6% 降到约 0.3%;它还发现后期模型并没有变得更谨慎,反而是判断越来越不准,却仍然很有信心。



所以我们不会只看「第几轮」决定停不停,而会同时看候选方案的有效率、预期增益、评估器之间的分歧、单位算力产生的收益,以及有没有开始损伤其他能力。

很多时候该停的不是 Auto Research,而是当前这条研究路线。应该换假设、换训练方法,甚至重新定义问题,而不是让 AI 一直往同一个局部最优里钻。

机器之心:一家创业公司规模的团队跑 Auto Research,一年大概是什么量级的算力开销?相比传统的「研究员手动跑实验」,它是省钱还是更贵?

郭权玮:具体年度算力其实很难用一个数字描述,因为我们的体系本身还在快速变化。但有一点比较反直觉:Auto Research 的目标并不是少跑实验。恰恰相反,它往往会让你有能力同时探索更多实验。

所以如果只看 GPU 使用量,它未必比研究员手工实验更少;真正下降的是一次有效改进需要占用的研究员时间,以及从一个想法到验证结果的周期。

这也是为什么我们不会每个节点都调用最强模型。大量判断可能由更小的模型、预测模型或者算法完成,真正昂贵的实验才进入训练。

我们更关心的指标不是一年用了多少 GPU,而是每单位算力能够产生多少次真正有效的模型改进

RSI 路线:定位、代价与本地化

机器之心:行业目前的共识是所有公开案例都还只是弱 RSI,OpenAI 自己也承认高层规划仍只占 Agent 输出 token 的很小一部分。StartLux 怎么定义「完整的 RSI」?你们现在走到了哪一步?作为国内第一家公开 RSI 方向实践成果的公司,怎么看这个「第一」,是荣誉还是压力?

郭权玮:为了讨论方便,我自己把自我改进分成五级

Level 0 是Self-correction,模型发现自己错了会重新尝试;Level 1 是Memory / Experience,开始积累并复用过去的经验;Level 2 是Automated Training,AI 可以生成数据、写代码、启动训练、跑 Eval;Level 3 是Auto Research,它能根据上一轮实验结果分析失败、提出新假设,并决定下一步研究什么;到了 Level 4,我才会把它叫真正的 RSI——被改进后的 AI 不只是任务能力变强,它「改进 AI 的能力」本身也进一步增强,形成递归反馈。



按照这个定义,我们现在主要在 Level 3,正在研究怎么跨到 Level 4。

而且我不太相信完整 RSI 最后会是一个超级大模型自己完成所有事情。我更倾向于把它看成一个异构的自我改进系统:有的模型擅长提出假设,有的负责预测和搜索,有的负责判断结果,算法和 Verifier 共同决定哪些变化值得保留下来。RSI 的能力来自整个系统,而不是某一个模型有多强。

至于「第一」,我觉得要把边界讲清楚。所谓第一通常都有具体的时间、任务和定义,就像一个模型在某张榜单上超过了另一个特定版本,并不意味着它在所有意义上都更强。我们只是比较早公开把 RSI 当成明确的研发方向,并拿出了一些阶段性结果,离完整 RSI 还很远。这个「第一」对我们来说更多是一个时间点上的记录。

机器之心:你们观察到了「能力重新分配」现象:优化目标集中时 Agent 能力明显提升,但有限参数下部分通用能力会出现波动。这在实验里具体发生过吗?被挤占的是哪些能力,掉了多少?现在内部怎么同时管理多个相互约束的优化目标,有没有一条「通用能力不许跌破」的红线?

郭权玮:发生过,而且这个现象后来对我们影响很大。举个近期的实验的例子,做一轮专门针对 Agent 能力优化的后训练,GPQA 从 83.33 提到 90.40,DeepSearchQA 从 47.04 提到 59.39,Tau3-Banking 也从 30.93 提到 34.02;但与此同时,GAIA 从 57.57 降到 45.70,IFEval 也下降了 2.43 个百分点,MMLU Redux 基本持平。

更有意思的是行为本身也发生了变化。训练之后模型明显更倾向于主动调用工具,这在搜索和一些 Agent 任务里是优势,但到了没有工具、或者工具定义不完整的环境里,反而可能变成错误。

后训练不是单纯往模型里「增加能力」,而是在重新塑造它的能力分布和行为策略。严格来说,我们现在看到的是能力和行为层面的重新分配,还不能直接证明某一组参数被另一种能力「抢走」了。

内部确实有红线,但不是一个统一总分。不同关键能力都有自己的回归门槛,不能因为目标任务涨了很多,就允许另一项重要能力大幅下降。一个 +10 不能简单抵消另一个 -10。

这其实也是 RSI 必须解决的问题:AI 不只要会让自己变化,还要知道什么变化才真的叫变强。

机器之心:StartLux 讲 RSI 时总是和「本地」绑在一起,受控的本地参数更新、本地持续自我更新。相比 OpenAI 那种云端实验室形态,本地 RSI 的独特价值是什么,是隐私、成本、可控性,还是进化速度本身?

郭权玮:隐私、成本和可控性都重要,但我觉得真正独特的一点是:本地让每个人都有可能拥有一条独立的模型进化轨迹。

今天的云端模型,本质上还是所有人在使用同一个不断升级的公共模型。它当然可以记住你的偏好,但如果未来每个人都有自己长期独立的参数状态,每天根据自己的文件、工作过程、成功和失败去更新,甚至逐渐改变模型结构,那已经是完全不同的计算形态。

本地的价值就在这里。数据天然就在模型身边,使用过程本身可以持续产生 Training Signal,新的参数也可以只属于这个人。

我希望未来不是所有人共享一个越来越聪明的 AI,而是每个人的 AI 因为长期和不同的人一起工作,最后真的变成不同的 AI。本地 RSI 对我来说最终不是一种部署方式,而是把 AI 的进化单位从「一个公共模型」,变成「每个人自己的模型」。

机器之心:「本地×RSI」的一个重要问题是安全。OpenAI 曾披露,7 月 20 日因为 Agent 突破了研究基础设施边界,它关停了训练容器服务并暂停 RL 两周,那是在一个有专职安全团队和完整监控的实验室里。如果自我更新发生在千万台个人电脑上,怎么预防安全问题?出问题时又怎么办?

郭权玮:所以我一直认为 RSI 不能建立在「相信一个足够强的大模型会自己判断正确」这件事情上。甚至反过来,我认为RSI 必须允许大量随机性和错误探索。真正的研究很多时候没有标准答案,如果系统只敢沿着当前认为正确的方向搜索,很容易越来越收敛到一个局部最优。但这里有一条非常清楚的边界:探索的自由和修改自己的权限必须分开。

模型可以在隔离环境里尝试新的参数、策略甚至结构,但这些结果不能因为 AI 自己觉得更好,就直接替换正在使用的模型。候选更新应该经过独立的 Verifier、回归测试和安全检查,再决定是否进入正式版本,同时必须保留 checkpoint、回滚和冻结能力。

还有一个原则我觉得很重要:提出修改的 AI,不能同时成为判断这次修改是否成功的唯一裁判。本地 RSI 并不是让千万台电脑上的模型随意修改自己。我们希望把随机性放在探索空间里,但不能把随机性带进权限边界。可以大胆试错,但真正改变自己的那一步必须是受控的。

技术根基:基座、架构与基础研究

机器之心:你们以 Qwen3.6-27B 为基座。但在你们送测之后,阿里已经开源了 Qwen3.8-27B,社区反馈其结构与 3.6-27B 基本一致而能力更强,Perplexity 的本地方案也已经用上了 3.8 这一代。这个节奏对你们意味着什么:换基座重跑一遍后训练需要多久?Auto Research 积累的数据、pipeline、Eval 和失败分析体系能迁移多少?换句话说,如果基座每四个月迭代一次,StartLux 真正的长期资产是什么?

郭权玮:我们其实不太担心基座迭代。Auto Research 把后训练这件事变得很快,换一个同类型的新基座,完整跑一遍后训练通常一周以内就能完成。按照我们现在的经验,同系列基座之间,积累的数据和训练经验 90% 以上可以迁移;即使跨基座,80% 以上也可以继续使用。Pipeline、Eval 和失败分析体系的迁移比例还会更高。

所以真正长期积累的不是某一版 27B 的权重,而是把一个新的基座快速变成我们需要的模型的能力:哪些数据有效、哪些失败值得训练、怎么评价、怎么自动产生下一轮实验,这些东西不会因为基座迭代就消失。

另外我们还有自己的量化方案、推理系统以及架构研究。所以基座对我们来说更像一个持续升级的起点。模型可以一直换,但把模型训练好、压得下去、跑得起来,并且继续改进它的方法是在累积的。

机器之心:StartLux 牵头,联合清华、国科大、港大、悉尼大学和哥伦比亚大学完成的混合线性注意力研究,以 Massive Activations 为探针刻画了「注意力前尖峰」(PAS)与「尖峰间平台」(ISP),提出 write-sink-cancel 生命周期,机器之心此前也报道过。外界可能会问:一家正在冲刺产品的公司,为什么在落地之前投入资源做这类偏基础的研究?这项工作与下一代模型架构选择、本地部署的效率和量化是什么关系?与高校的联合研究会成为常态吗?



  • 论文标题:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
  • 论文链接:https://arxiv.org/abs/2608.12149
  • Hugging Face:https://huggingface.co/papers/2608.12149
  • 代码链接:https://github.com/StartLuxLabs/Massive-Activations-HLA

郭权玮:因为我们想解决的并不只是怎么把今天的模型做得更快一点。如果最终要走到 RSI,AI 不能永远只在一个固定架构里调参数,它迟早要碰到结构本身。那在这之前,我们至少要真正理解模型内部发生了什么。

Massive Activations 这项工作就是一个例子。我们发现混合线性注意力里的巨大激活并不是随机出现的,而是和 Full Attention 的位置有很稳定的关系,会形成 PAS 和 ISP,并呈现出 write-sink-cancel 的生命周期。 这件事现在还不能直接等价成一种新的量化算法,但它会影响我们怎么看架构、数值动态和量化:如果一个异常大的激活实际上承担了功能,你就不能简单把它当 outlier 消掉。

我们也在关注另外一类更直接的结构变化,比如把 Dense 模型重新组织成 MoE。ExpertWeaver(arXiv:2602.15521)是从 GLU 激活模式里识别通用和专门化神经元,再重新组织成 shared / routed experts;本质上是在问一个已经训练好的 Dense 模型内部,是不是本来就潜藏着可利用的结构。 DOT-MoE(arXiv: 2606.01666)则更进一步,把 neuron-to-expert assignment 和 routing 做成可联合优化的问题,而不是简单做启发式切分。



这些研究其实离产品并不远。我们做的是一整套本地智能解决方案,模型只是其中一层。基础研究决定模型和架构的上限,量化和推理系统决定这些能力能不能高效跑在个人设备上,上层产品再把它变成稳定、自然的使用体验。用户最终不需要知道背后是哪一种 Attention、是不是 MoE,甚至不需要知道具体用了哪一个模型;他只需要感觉这套本地智能真的聪明、快、稳定、好用。

机器之心:官方 FAQ 里面提到团队正在研究扩散式语言模型等新架构。为什么 dLLM 对本地场景有吸引力,是解码速度、显存占用,还是别的?它和混合线性注意力是同一条效率主线上的两种选择,还是各自服务不同目标?这条路线目前处在什么阶段,有没有可能出现在下一代模型里?

郭权玮:dLLM 最吸引我们的其实不是显存。它真正动的是自回归模型最根本的串行生成方式。传统模型一个 token 接一个 token 地生成,而扩散式语言模型给了我们并行生成和反复修正一段 token 的可能性。现在已经有工作证明,通过并行解码和 Cache 机制,dLLM 的推理速度还有很大的优化空间

这对本地特别有意思,因为个人设备的算力和内存带宽都是有限的,单纯把模型压小并不能解决所有问题。如果生成算法本身能减少串行步骤,那是在另一个维度上改变效率。当然,dLLM 目前还有质量、KV Cache、长序列计算和工程成熟度的问题,所以我不会说它现在已经是更优解。

它和混合线性注意力也不是二选一。可以简单理解为,混合线性注意力主要在改变「上下文怎么计算」,dLLM 更像在改变「答案怎么生成」,解决的是两个不同层面的瓶颈,理论上甚至可以组合。

我们下一代模型不预设一定采用哪一种架构。我们也不会为了「新架构」三个字去上新架构。只有当它在真实本地任务里同时证明能力、速度、内存和稳定性都更好,它才有进入产品的意义。

产品、开放与一年之约

机器之心:为什么还下载不了?这可能是用户当下最关心的问题:StartLux-27B 已经亮相、也通过了信通院测试,但大家目前还无法直接下载使用。能否说明一下开放节奏:目前处于什么阶段,备案进展如何,完成后会以什么形式开放?会发布多个不同版本吗?在正式开放之前,普通用户和技术社区可以怎么体验?

郭权玮:根据规定,大模型企业在首次面向公众提供服务之前,需要提交备案申请。目前模型相关备案已经提交,刚进入审核流程。在完成相应合规程序之前,我们暂时不会直接面向公众开放下载和自助使用。

备案完成以后,我们会逐步开放模型,也会有不同版本,不一定只是一套权重。因为真正到了本地,不同硬件、内存和使用场景,对模型大小、量化方式和 Context 的要求都不一样。

正式开放之前,我们已经保留了申请测试的通道,感兴趣的用户和开发者可以通过官网申请,我们会分批邀请体验。

另外,模型只是 StartLux 本地智能系统的一部分。我们还在同步做推理系统、量化、Agent Harness 等,最快年内希望先让公众体验到第一版本地智能产品。

机器之心:你们的官方表述是「全球第一家主打本地模型的 AI 公司」。这个说法一定会被读者拿去和一批玩家对照,比如做端侧模型的芯片与终端厂商、Mistral 与 Liquid AI 这类小模型公司、以及 Perplexity 这样从云端切进来的应用公司。能否界定一下你们所说的「主打本地」?

郭权玮:我们说的「主打本地」,不是指做一个比较小、能够下载到电脑上的模型。更准确地说,本地是我们的默认技术架构,也是产品起点。从模型、量化、推理系统,到专门为本地设计的 Agent Harness、搜索和持续学习,我们希望核心能力尽可能运行在用户自己的设备上。

所以这和芯片公司、小模型公司,或者一个云端产品增加 Local Mode,出发点还是不太一样。我们从一开始就在想一个问题:如果一个人的 AI 真正属于他自己,那从模型到系统应该长什么样?我们所谓的「本地」,其实是在做一整套属于个人的 AI 系统,而不只是一个本地模型。

机器之心:你们给自己定了一年的验证标准:用户愿意长期把文件、研究和办公交给本地 AI,模型能连续工作几小时、成功率接近甚至超过云端方案。亮相半个月后,离这个标准最近和最远的地方分别是什么?规划中的完整本地智能系统,除了 Agent 和 Memory 还有什么,什么时候能与公众见面?

郭权玮离这个目标最近的其实是底层能力,而且不是只有模型在进步。模型、量化和本地推理系统迭代很快,硬件也在快速抬高本地 AI 的上限。像 DGX Spark、RTX Spark 这一类新设备的出现,意味着个人设备能够承载的模型规模和持续工作能力都在快速变化。

最难的还是把这些能力变成一个用户可以连续用几个小时甚至更久,而且不用理解背后技术细节的产品。长任务里的稳定性、失败恢复、上下文管理和整体体验,这些比单纯把模型跑起来难得多。

我们规划的是一整套本地智能系统:底层有模型、量化、推理系统和不同硬件的适配,上面有面向本地环境设计的 Agent Harness、工具和搜索,再往上才是用户真正看到的产品。第一版不会把所有研究成果一次全部放进去,而是先把体验做完整。

按照目前的进度,我们计划在年内推出首个面向公众的体验版本

机器之心:最后,请展望一下「本地×RSI」的未来。

郭权玮:我觉得「本地×RSI」最后不会只是一个会自己更新的聊天助手。

我更希望它成为属于每个人自己的独立研究者。你可以让它长期研究材料、医学、金融,也可以研究 AI 本身,甚至研究怎么把自己的推理系统做得更快。它每天从真实工作里产生新的数据和反馈,在受控条件下更新参数、改变策略,未来甚至调整自己的结构。

今天我们使用 AI,基本上还是每个人在访问同一个模型。未来可能完全不一样:每个人的 AI 都有自己的参数、自己的经验、自己的研究方向,也有自己的进化路径。

如果这件事情真的成立,本地的意义就不只是隐私或者省 Token 了。它意味着 AI 第一次可以长期属于一个人,并且和这个人一起成长。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
深度   当美国这个盟友变成风险,加拿大总理访欧:不入盟也要结盟!

深度   当美国这个盟友变成风险,加拿大总理访欧:不入盟也要结盟!

上观新闻
2026-09-15 20:50:35
赛力斯分家,车主破防,小米订单暴涨635%:华为该不该自己造车

赛力斯分家,车主破防,小米订单暴涨635%:华为该不该自己造车

王新喜
2026-09-16 13:36:57
《牛来》导演宣布《牛来2:起航》2027上映,王晶谈《牛来》票房逆袭:平庸在今天的电影市场甚至比粗糙更致命

《牛来》导演宣布《牛来2:起航》2027上映,王晶谈《牛来》票房逆袭:平庸在今天的电影市场甚至比粗糙更致命

台州交通广播
2026-09-14 20:28:39
厦大毕业生平均月薪11856元,63.6%却只拿3到6K,普通家庭该信谁

厦大毕业生平均月薪11856元,63.6%却只拿3到6K,普通家庭该信谁

户外阿毽
2026-09-16 13:11:11
2026基本“零差评”的3款手机,可以闭眼入,再用四年不淘汰

2026基本“零差评”的3款手机,可以闭眼入,再用四年不淘汰

小愚测评
2026-09-15 23:40:51
黄金白银,直线拉涨

黄金白银,直线拉涨

证券时报
2026-09-16 15:06:14
到底多顶的女助手,才能让高僧迷糊两年?单亲妈妈人设只是幌子

到底多顶的女助手,才能让高僧迷糊两年?单亲妈妈人设只是幌子

社会日日鲜
2026-09-15 09:06:12
孙子非亲生案反转!鉴定机构被罚、证据全部作废,老人委屈太戳心

孙子非亲生案反转!鉴定机构被罚、证据全部作废,老人委屈太戳心

宝哥精彩赛事
2026-09-16 08:04:04
iPhone 18 Pro开售不到两天价格即被打下来:有电商平台直降900元,预售超5万件,但不支持分期免息

iPhone 18 Pro开售不到两天价格即被打下来:有电商平台直降900元,预售超5万件,但不支持分期免息

极目新闻
2026-09-14 10:37:37
39岁梅西冲击个人第48冠,迈阿密国际明晨将决战北美足联冠军杯

39岁梅西冲击个人第48冠,迈阿密国际明晨将决战北美足联冠军杯

懂球帝
2026-09-16 14:35:57
贪官末日来了!中央反腐新规已亮剑,无论在职退休一律严惩

贪官末日来了!中央反腐新规已亮剑,无论在职退休一律严惩

职场资深秘书
2026-09-16 15:14:42
俄军少将在乌大开杀戒,回到俄罗斯刚出门,就被摩托青年两枪打爆

俄军少将在乌大开杀戒,回到俄罗斯刚出门,就被摩托青年两枪打爆

爱吃醋的猫咪
2026-09-11 20:28:58
神舟二十四号很快发射,航天员王亚平亮相:会担任女指令长吗

神舟二十四号很快发射,航天员王亚平亮相:会担任女指令长吗

普陀动物世界
2026-09-15 14:08:38
贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

带你感受人间冷暖
2026-09-15 00:05:19
CBA最新消息!NBA后卫或加盟上海男篮,北京首钢外援全部确定

CBA最新消息!NBA后卫或加盟上海男篮,北京首钢外援全部确定

体坛瞎白话
2026-09-16 10:38:11
中天主播集体手持公文念声明,周玉琴被辞引发质疑

中天主播集体手持公文念声明,周玉琴被辞引发质疑

可乐谈情感
2026-09-16 13:10:00
“肉签”来了!两大龙头今日申购

“肉签”来了!两大龙头今日申购

21世纪经济报道
2026-09-16 07:56:24
陈熠输给张本美和!46岁前国乒名将现场生气发抖 被送速效救心丸

陈熠输给张本美和!46岁前国乒名将现场生气发抖 被送速效救心丸

念洲
2026-09-16 10:04:11
扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

环球网资讯
2026-09-15 06:58:37
重庆市级文物马家洋房299万元起拍,两次流拍后降价100万,拍卖方强调“限中国人竞买”

重庆市级文物马家洋房299万元起拍,两次流拍后降价100万,拍卖方强调“限中国人竞买”

极目新闻
2026-09-16 11:27:32
2026-09-16 16:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14005文章数 142733关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

8岁孩子名下多出两套房 系母亲"同居男友"为躲债过户

头条要闻

8岁孩子名下多出两套房 系母亲"同居男友"为躲债过户

体育要闻

道曼双响比肩鲁尼 阿森纳轻松晋级却有两人挨骂

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

中际旭创六家供应商股东疑现关联人

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

态度原创

艺术
数码
时尚
手机
旅游

艺术要闻

宝安中心壹方中心整层怎么选 宝安1525㎡参考报价

数码要闻

瞬时功耗1450W!31万元双路RTX 5090主机首测:2200W电源才够用

条纹打底衫,还是很适合秋天的!

手机要闻

存储芯片短缺预计持续至2027年,低端数码设备市场承压

旅游要闻

三部门发文 事关自驾游出行、房车营地搭建

无障碍浏览 进入关怀版