![]()
作者 | 四月
9月2日消息,前字节跳动Seed团队强化学习专家、腾讯Robotics X智能体中心前负责人孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
能吸引顶尖技术专家入局,星尘智能已具备一定行业势能。创始人来杰拥有17年AI与机器人研发经验,不仅曾操刀百度小度机器人,更是腾讯Robotics X实验室的“1号员工”。技术路径上,星尘智能避开了主流方案,以“绳驱”本体破局,确立了“AI模型+具身OS+绳驱本体”的全栈研发架构。
资本层面,公司在今年6月刚完成B轮系列融资,创下三个月内连融3轮、累计超10亿元,估值突破百亿元,投资方阵容汇集了蚂蚁集团、经纬、国科投资等一线机构。在商业化上,其起售价8.99万元的T1机器人已将产能拉升至万台级,并拿下了零售、工业等多场景的千台级订单。硬件与商业的成熟,为算法演进提供了真实落地场景。
据悉,过去十余年,孙鹏的技术经历始终围绕强化学习与智能体展开,但应用场景经历了几次明显迁移:从最早的机器人控制,到《星际争霸》《炉石传说》等复杂博弈AI,再到大规模强化学习基础设施和近年来的大模型RLHF、强化微调及Agent。
如今重新进入机器人领域,也让这次人事变动多了一层行业意味。
当前,机器人基础模型的主要目标还是让机器人解决“会不会做”的问题。但随着越来越多机器人从实验Demo走向真实场景,行业开始面对一个更现实的问题:动作能做出来,不代表能够长期、稳定、高成功率地做好。如何让机器人依据真实执行结果和环境反馈不断修正自身策略,也让强化学习重新成为具身智能行业的重要技术方向。
十余年深耕强化学习
孙鹏博士毕业于清华大学,此后先后在康奈尔大学和罗格斯大学从事博士后研究。早期在腾讯AI Lab及Robotics X机器人实验室期间,孙鹏曾担任智能体中心负责人,开展深度强化学习与机器人控制研究。
在机器人方向,他曾利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;在复杂博弈方向,则参与研发《星际争霸》AI智能体TStarBots、TStarBotX,探索多智能体强化学习在长时序、高复杂度决策环境中的应用。
加入字节跳动后,孙鹏的工作进一步从算法研究扩展至大规模RL系统工程。
其间,他主导开发强化学习基础设施ByteRL,用于支撑多款自研游戏AI的规模化训练。其团队曾获得IEEE CoG 2023策略卡牌AI竞赛冠军,并研发《炉石传说》AI,在复杂策略环境中探索强化学习的决策与泛化能力。
随着大语言模型兴起,孙鹏的研究重心进一步转向大模型强化学习和后训练。
在字节AI Lab/ByteResearch期间,他作为项目负责人参与研究并发布强化微调方法ReFT(Reinforced Fine-Tuning)及数学推理智能体DeltaProver;进入Seed团队后,又进一步参与模型RLHF、预训练、模型对齐、推理增强及Agent相关工作。
从机器人控制、游戏AI到大模型后训练,孙鹏过去十余年的工作虽然横跨不同技术周期,但解决的问题其实高度一致:如何让智能体通过与环境交互获得反馈,再利用反馈持续优化自身行为策略。
而随着AI进一步进入物理世界,这套经验正在重新回到机器人领域。
强化机器人后训练
对于星尘智能而言,孙鹏此次加入,主要对应其机器人强化学习及模型后训练方向的进一步建设。
目前,星尘智能正在推进由AI模型、具身OS和绳驱机器人本体组成的技术体系。其提出的Design for AI思路,核心是将机器人本体、数据获取与模型训练进行协同设计,而非将几者完全割裂。
模型侧,星尘智能此前已经推出Lumo系列具身模型。
![]()
其中,Lumo-1主要探索机器人对动作意图以及动作背后因果关系的理解;Lumo-2则进一步引入Latent World Dynamics,在隐空间中预测未来环境状态,再据此生成机器人动作。
此外,其前端Agent Philia主要承担长期记忆、任务管理、多机器人协同及自然交互等功能。
相比基础模型负责学习“如何完成任务”,强化学习更多位于训练链条的后端:机器人完成基础能力学习后,通过真实任务执行获得反馈,再进一步优化动作策略、成功率以及长期部署中的适应能力。这一方向也与孙鹏此前在大模型RLHF、强化微调以及大规模RL系统中的积累形成衔接。
下一步,星尘智能计划进一步探索大模型时代已经得到广泛应用的强化学习后训练方法,如何与真实机器人的执行反馈、数据回流以及长期部署结合,使模型不仅能够完成任务,还能够在真实环境中的重复执行过程中持续优化策略。
孙鹏表示:“过去十多年,我一直在做强化学习和智能体,也亲历了强化学习从机器人控制、复杂博弈走向大模型后训练的过程。现在,我很希望把这些积累真正带回物理世界。”
他同时表示,接下来希望进一步将强化学习融入真实机器人的训练与部署,让机器人能够在持续的真实执行和反馈中不断提升任务表现。
声明:本文为 AI 前线编辑,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。
今日荐文
![]()
你也「在看」吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.