都说具身智能是AI的下一站,但这个行业有个尴尬的秘密——大多数机器人的"聪明",只在Demo里。
一个机器人,在实验室稳稳完成抓取搬运,看起来惊艳;一旦放进真实工厂,遇到没见过的零件,当场宕机。问题出在训练框架:仿真、训练、推理三套系统互相割裂,显卡闲置,跑得又慢又难调。
百度百舸率先给出了解法——在RLinf v0.3发布当天即完成适配,成为国内首家支持的云厂商,开发者可直接在百舸上一键拉起预制环境,让前沿开源成果直接变成产业生产力。
RLinf是什么?
简单说,RLinf是专门给机器人做强化学习训练的"一站式后台工具"。名字里的"inf"很有意思,既代表Infrastructure(基础设施),也寓意Infinite(无限扩展)。
这个框架2025年9月由知名科创企业联合清华大学正式开源,同时参与研发的还有北大、UC伯克利等机构。GitHub上的Star数早已超过2600,智源大会的强化学习分论坛专门把它列为MAPPO之后最具影响力的代表性成果。
真正让RLinf在行业里站住脚的,是它真正解决了具身智能训练的痛点:六层架构贯通用户层到硬件层,训练速度直接起飞,相比其他框架的分离式执行模式,VLA模型涨幅达到40%到60%。
![]()
v0.3,补上了最关键的一环
7月16日,RLinf正式发布v0.3版本。半年内三次迭代,v0.1解决复杂强化学习任务效率问题,v0.2引入RLinf-USER把机器人硬件和GPU纳入统一调度,v0.3则更进一步——首次完整打通了数据采集、数据管理、SFT微调、强化学习、模型评测、真机部署所有关键环节。
![]()
换句话说,以前机器人只能在虚拟世界练习,现在终于打通了「仿真训练→真机在线学习→持续迭代」的完整闭环。机器人既能在大规模仿真环境里反复试错自学,也能在真实物理世界中不断积累新数据、持续进化自己的能力。
五大维度全面升级:
模型生态新增DreamZero、GR00T、StarVLA等主流VLA模型支持;
算法体系扩展了真机强化学习、人在环学习,引入DSRL、RECAP、SAC-Flow等代表性算法;
真机闭环完整打通LeRobot数据格式和部署流程;
仿真环境覆盖Genesis、IsaacLab等主流平台;
系统底座新增Value Model、SGLang推理服务,深度优化FSDP Offload和显存机制。
百度百舸AI计算平台在v0.3发布当天即完成适配,成为国内首家支持的云厂商。开发者可以直接在百舸平台上,通过"快速开始"功能一键拉起RLinf v0.3预制开发环境,省去繁琐的环境打包和软件部署。结合百舸的AI Infra工程优化能力,模型训练和仿真都能获得极致性能提速,大幅缩短迭代周期。平台已服务超过30家具身智能头部企业。
![]()
最后说一句
RLinf v0.3的出现,本质上是把具身智能从"能训练"推进到"能进化"——机器人在虚拟世界里反复练习,在真实世界里持续学习、自我迭代,这种"数字躯体"的双闭环进化能力,正在重新定义智能体的发展路径。当百度百舸率先完成适配、开发者生态持续扩大,具身智能真正爆发的前夜,或许已经到来。
(完)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.