智猩猩AI整理
编辑: 没方
这两天,一只丑萌的“机器鸭”,在推特( X )上火了。
![]()
它会走路、坐下、蹲伏,被推倒后还能自己爬起来。嘴巴不仅是装饰,还能低头夹起地上的小物体。装上两个轮子之后,它还可以踩着“旱冰鞋”满屋跑。
这是Hugging Face旗下机器人团队 Pollen Robotics 在8月27日发布的新产品Microduck,售价399 美元。
发布后市场反馈相当夸张,据 Business Insider 报道,Microduck 上线 24 小时的销售额已经超过260 万美元。短短几天,预购量就已经突破 1 万台。
![]()
但这只小鸭子真正值得关注的,不只是“萌”。
它更像是Hugging Face 把大模型时代熟悉的开源模型玩法,第一次完整搬到了机器人动作上。
他们把 Microduck 的机器人软件、SDK、仿真环境、强化学习训练代码,甚至从 Simulation 迁移到真机的 Sim2Real 方法全部开源了出来。
其中,microduck,也就是机器人真正运行时的“脑子”,在 GitHub 上已斩获5.5k Star。
![]()
microduck_rl负责训练小鸭子动作的完整强化学习环境,目前也已经拿下1.3k Star。
![]()
搞笑的是,该团队在仓库里还塞了个梗。
![]()
“在制造这款机器人时,没有一只鸭子受到伤害。实际上,我们还咨询了好几只鸭子的意见。”
![]()
01
从控制栈到强化学习,
Microduck把机器人底层全开放了
Microduck 本体高约 25cm、重量不到 800g,搭载15 个电机、前置摄像头、LiDAR、两颗 IMU 以及一个能够抓取物体的可动机械嘴巴,核心计算平台是一颗带 AI 加速器的 Rockchip RK3566。
![]()
Rockchip RK3566 上运行着一组相互独立的 daemon。其中robotd负责最核心的 50Hz 控制循环和电机总线;padd处理游戏手柄输入;mediad负责通过 WebRTC 输出摄像头画面;tofd管理距离传感器;btd提供蓝牙通信;configd管理 Wi-Fi 与设备身份;updaterd则负责软件更新、健康检查以及失败后的回滚。
这些模块通过 Unix Socket 上统一的 JSON-RPC 接口通信。
于是无论控制 Microduck 的是手机 App、游戏手柄、命令行,还是开发者自己写的程序,最终调用的都是同一套机器人接口。
这套设计的意义在于,Microduck 并没有把“机器人控制”做成一个封闭黑盒。
开发者可以直接进入控制栈,对传感器、电机、Policy、蓝牙甚至 OTA 更新机制进行修改。
microduck_rl 则用来教这只鸭子学习动作。
它的动作不是工程师逐帧手写的,而是通过强化学习训练出来的。
![]()
官方选择的训练环境建立在mjlab + MuJoCo Warp之上,并使用 PPO 训练 Policy。
一个 Policy 在仿真环境中,是和真机一样用50Hz控制频率训练。
训练完成后,模型会被导出为ONNX,再交给 microduck 仓库里的 Runtime,直接部署到真实机器人上运行。
整个链路其实非常清晰:
MuJoCo 仿真 → PPO 强化学习 → ONNX Policy → Microduck 真机。
比较难的是,怎么让模拟器里学会的动作,到了现实世界依然能跑。
现实中的电机有延迟,齿轮有间隙,地面摩擦力不固定,机器人重量也不可能和仿真模型精确到完全一致。
在模拟器里健步如飞的 Policy,到了真机上可能两步就直接摔倒。
研究团队因此把一整套Sim2Real Recipe也一起开源了。
其中包括 BAM actuator physics 电机模型、Domain Randomization,以及专门模拟真实舵机齿轮间隙的Backlash Simulation。训练时,系统会不断改变机器人参数和环境,让 Policy 不再依赖某一组“完美物理参数”,能够学会在真实世界里保持稳定。
目前项目已经准备了相当丰富的 RL Task。
![]()
最基础的是 Velocity Policy,让 Microduck 根据速度指令行走。VelStand 将走路和跌倒恢复训练到同一个 Policy 中。StandUp 专门负责从趴倒、仰倒或者坐姿中重新站起来。SitStand 用来学习坐下和站立之间的切换。
还包括一些“整活”的动作。
GroundPick 会让机器人降低身体,用嘴接触地面再恢复站立。BallKick 让它学习踢一个约 70mm 的小球。Roulade 训练它完成向前翻滚并重新站起来。
最有辨识度的就是给脚底装上被动滚轮之后,只需要切换到 Roller 相关的 Policy,Microduck 就从一只走路的小鸭子变成了“旱冰鸭”。
02
小鸭子的动作训练教程
硬件要求:NVIDIA CUDA GPU(训练依赖 MuJoCo Warp)。
(1)安装 uv
curl -LsSf https://astral.sh/uv/install.sh | sh第一次运行 uv sync 会下载大量 CUDA 相关依赖(约2 GB),而 UV 的默认 HTTP 下载超时时间为 30 秒,这可能导致下载过程中中断。如果在 ARM 设备(Jetson / DGX)上,建议先设置:
export UV_HTTP_TIMEOUT=600(2)训练环境下载与使用
uv run scripts/infer_policy.py --walking output.onnx如果没有 GPU,可以使用 Hugging Face Jobs 云端训练:
uv run train Mjlab-Velocity-Flat-MicroDuck --env.scene.num-envs 4096 --hf-jobs用下面命令可查看当前所有可用环境:
uv run list-envs
(3)断点续训
--agent.resume True(4)多策略联合测试(仿真)
--new-cmd-obsscripts/export.py 会把 observation normalizer 烘焙进 ONNX。直接转换 checkpoint 会导致真机观测归一化错误。
所有策略都使用相同的 61 维观测(48 维本体感知 + 13 维指令),这是真机运行过程中,能直接切换不同动作策略的关键。
03
Physical AI,也需要
自己的开源飞轮
过去几年,开源大模型之所以发展得如此快,一个重要原因是模型能力变成了一种可以自由流动的数字资产。
有人训练出了模型,其他人可以下载。发现问题可以继续微调,做出新的数据集、训练框架和评测工具,又可以反过来被整个社区复用。
最终,模型能力在社区里不断积累。
但进入 Physical AI 之后,这套飞轮却很难复制。
因为机器人的能力不只是一个模型权重。它背后还牵涉硬件、电机、传感器、仿真环境、Reward、控制频率、执行器模型,以及最麻烦的 Sim2Real。
也正因为如此,今天大量具身智能成果仍停留在实验室 Demo。
Microduck 想做的就是把这条链路再往前推进一步。
当机器人从硬件、仿真、训练到真机部署都能够被复现、修改和共享,Physical AI 才有可能形成属于自己的开源飞轮。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.