网易首页 > 网易号 > 正文 申请入驻

Science Robotics|人形机器人躺进婴儿床蹬腿玩床铃,重做发展心理学半个世纪的经典实验

0
分享至

科学家把一个「小孩」放进了婴儿床里。

床上方吊着一个会晃的床铃,一根弹性绳把床铃和它的一只手腕连在一起——它动一动胳膊,床铃就跟着晃。

躺在床里的不是婴儿,而是身高与儿童相仿的iCub人形机器人。



这项研究来自汉堡大学、捷克技术大学布拉格分校和巴黎西岱大学/CNRS的联合团队,昨日发表在国际顶级期刊《Science Robotics》上。



他们想搞清楚一件发展心理学里的老问题:婴儿是怎么发现「我动一下,世界就变一下」的?而这次给出答案的方式,是让机器人自己躺进婴儿床里,真的玩一遍。

01.

把发展心理学的经典实验,搬给机器人做一遍

被搬过来的实验叫mobile paradigm(床铃范式),1969年由Rovee和Rovee提出,是研究婴儿感觉运动关联(sensorimotor contingency,SMC)最经典的方法之一。

做法很简单:婴儿躺在小床里,只有一条肢体用绳子连到头顶的床铃上。到3~4个月大时,婴儿会发现是自己在让床铃动,然后更多地去动那条「连着的」肢体。如果这时把绳子解开,有些婴儿会出现「消退爆发」(extinction burst)——动作先猛增一下,再慢慢回落到基线。

但这个现象并不总能观测到,婴儿之间差异很大。到底是什么机制在起作用,一直不清楚。

之前也有不少计算模型试图解释这个范式,包括强化学习类、动力系统类和具身模型。但它们都只在仿真里跑过,没有真实世界的噪声、延迟和物理约束,也没怎么纳入预测误差、好奇心这些被认为支撑人类行为的认知机制。

这次研究团队把自己此前的仿真模型搬上了真机。iCub用的是肩部3个自由度、肘部1个、腕部1个,共5个关节;视觉只用右眼相机,分辨率320×240、15帧,经过池化后变成70个视觉单元,模型的输入就是「画面里有多少比例的格子发生了变化」这一个量。



实验一共七种条件,三种在真机上、四种在仿真里做。

真机部分:complex条件用的是接近原始实验的多部件床铃,被拉动后运动相当混乱;simple条件换成一根通过滑轮悬挂的泡沫管,运动方式确定得多;control条件干脆不挂床铃。仿真部分则包括simulated complex、把视觉输入与手腕位移做成1:1对应的simulated simple,以及两个「回放」条件——床铃的运动是从之前录好的数据里回放的,画面刺激一模一样,但和机器人的动作完全没关系。



每种条件都重复多次:真机complex和simple各20次,control 10次,四种仿真条件各60次。

模型这边,机器人的「大脑」是一个实时训练的神经网络,输入19个值(上一次动作的18个关节值+过去的画面变化),中间两层3000和1100个神经元,输出990+18+1个值——990个运动指令、18个关节值预测、1个画面变化预测。

990个运动指令怎么变成18个关节角度?靠的是群体编码(population coding):每个神经元同时影响同一肢体内的3个关节,还要加上±0.05的随机噪声来模拟婴儿的运动变异性。也就是说,机器人事先完全不知道自己的关节和肢体运动、环境效果之间是什么关系,必须自己学。

学习靠两个监督信号:预测损失(把自己的动作和环境的反应都预测对)和好奇损失(去探索那些结果不可预测、因此「有意思」的动作)。模型会把让自己惊讶的动作记在一张兴趣表里,惊讶就把兴趣值直接拉到1,不惊讶才每次减0.1。



02.

机器人确实学会了,但不是靠「动得更多」

怎么判断机器人到底有没有「发现」这个关联?

团队的思路是:训练一个多层感知机(MLP)当外部观察者。给它看两只手臂连续10个位置构成的序列,让它判断当时是左手还是右手连着床铃。用留一交叉验证,如果它能稳定分对,就说明机器人的探索行为里确实存在系统性差异。

结果如下(随机水平50%)



真机complex条件65%,显著高于随机;simple条件53%、control条件48%,都没超过随机。仿真里simulated complex 67%、simulated simple 58%,都显著;而两个回放条件掉到45%和48%。

七种条件里,四种有关联的条件有三种超过随机水平,无关联条件全部没有。

有意思的是出现了一个反直觉的规律:越简单、越确定的条件,反而越难分类。团队的解释是,complex条件恰好落在一个「难度甜区」——足够有挑战性,能激发主动探索,但又不至于永远学不会。真机simple条件里那根泡沫管占据了视野很大一块,画面变化过于剧烈反而难以预测;而仿真simple条件又太简单,探索不足、动作变少,留给MLP的线索也就少了。

那么,机器人到底是「怎么」表现出差异的?按婴儿文献的经典假设,应该是连着的那只手动得更多。

团队测了手腕走过的路径长度。



结果是:没有明显差别。不管哪种条件,连接手臂和非连接手臂的总路径长度都差不多。唯一一致的现象是,在有关联的条件里,真机约200步、仿真约450步之后,动作量会出现一次突然的转变。

换句话说,MLP抓到的东西,不是「动得多」。

03.

两种策略背后,是预测与好奇的拉锯

于是团队改用决策树,把轨迹先转换成一系列运动指标——运动发生在空间的哪个区域、变异性、两臂之间的相关性等等,再让分类器去找边界。





在complex条件下,四种主导策略覆盖了87%的样本。

比如其中一种:只要左臂在靠近躯干的一小片区域里活动(横向不超过约9厘米),就能判定是右臂连着——因为在那个位置,绳子是松的,左臂再怎么动床铃也不会动。另一种覆盖了75%左手连接样本的策略则相反:连着的手臂待在远离躯干、绳子绷紧的区域,只需要非常小的动作就能让床铃晃起来。

还有两种策略是大幅度的探索性运动,动的不一定只有连接的那只手。

四种策略可以归成两大类:要么大范围、大幅度地探索,要么在绳子有张力的特定区域做小而精准的动作。

更关键的是第二棵决策树——团队用模型的内部变量(预测损失的两个分量、好奇损失、画面变化、目标关节值)又训练了一次分类器,找出8组内部状态,再算它们与外部行为策略的条件概率对应。

前两种「精准小动作」策略,出现在损失都很低的优化状态:模型已经学会控制身体、也能准确预测环境反应,不再感到惊讶,于是转向「维持现状」,用最小的动作把关联握在手里。

后两种「大范围探索」策略,出现在运动前向模型还没学好的时候:动作预测损失偏高,行为主要由好奇心驱动,于是就是大幅、多变、不局限于连接肢体的乱动。

这正好是强化学习里那一对:探索与利用(exploration vs. exploitation)。

而它和婴儿数据也对得上。Watanabe和Taga 2006年的研究发现,2个月大、运动控制还不成熟的婴儿会增加所有肢体的运动;4个月大、运动能力更好的婴儿则专门增加连着床铃那条肢体的运动。

此外,机器人在部分试次里也出现了类似婴儿那种时有时无的消退爆发。

团队还做了消融和降自由度实验,结论有点反直觉:对模型来说最难的其实是运动控制本身,而复杂的关联反而可能帮助学习——因为相比只有「开/关」两种状态的二元关联,它提供了更多可操作的可能性、更精细的比例式反馈,以及更丰富的刺激来持续引发好奇。

所以这项研究给婴儿研究者留下的建议是:别只用「动了多少」这一个指标去判断婴儿有没有学会。婴儿相关文献里那些「不符合典型模式」而被排除掉的试次,说不定正是另一种有效策略。研究者还可以反过来用MLP和决策树这套框架,去更定量地刻画婴儿的策略,甚至通过给肢体加小重物、给床铃加噪声来分别操纵「动作可预测性」「环境可预测性」和「好奇心」这三个因素。

论文数据和代码都已公开。

论文地址:

https://www.science.org/doi/10.1126/scirobotics.aed4106

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
几十个国产操作系统打不过Windows:操作系统越多,战斗力越弱

几十个国产操作系统打不过Windows:操作系统越多,战斗力越弱

王新喜
2026-09-07 13:49:07
中科院:江浙沪血液有害物质浓度爆表!

中科院:江浙沪血液有害物质浓度爆表!

生命科学前沿
2024-03-27 17:38:51
这条无耻新闻,终于引起公愤了!

这条无耻新闻,终于引起公愤了!

胖胖说他不胖
2026-09-07 11:50:18
中美紧张,中日紧张,中英紧张,中加紧张,中印紧张,中韩紧张,中欧紧张…… 各类消息看多了,怎么感觉每天都在过得很紧张?

中美紧张,中日紧张,中英紧张,中加紧张,中印紧张,中韩紧张,中欧紧张…… 各类消息看多了,怎么感觉每天都在过得很紧张?

回京历史梦
2026-09-07 17:48:31
记者暗访化妆品“地下工厂”:冒牌SK-II、赫莲娜制作窝点藏匿民宅,有人打电话冒充派出所人员威胁记者

记者暗访化妆品“地下工厂”:冒牌SK-II、赫莲娜制作窝点藏匿民宅,有人打电话冒充派出所人员威胁记者

新京报
2026-09-07 09:25:27
湖南经济为什么掉队了?当地县中医药主任轻飘飘的一句话,让人寒毛倒竖

湖南经济为什么掉队了?当地县中医药主任轻飘飘的一句话,让人寒毛倒竖

回旋镖
2026-09-07 12:45:44
为什么赛车手敢去救人,救援人员却丢下灭火器逃离?

为什么赛车手敢去救人,救援人员却丢下灭火器逃离?

火山口的普林尼
2026-09-06 23:37:56
17岁少年肺被炸成爆米花,罪魁祸首可能你家就有!让2亿孩子无处可逃……

17岁少年肺被炸成爆米花,罪魁祸首可能你家就有!让2亿孩子无处可逃……

医护健康科普
2026-09-06 09:06:35
昔日巴萨“子弹”退役:86场20球 曾上演帽子戏法 梅西3助攻

昔日巴萨“子弹”退役:86场20球 曾上演帽子戏法 梅西3助攻

叶青足球世界
2026-09-07 15:12:40
启东市卫生健康委员会党组书记、主任苏高飞被查

启东市卫生健康委员会党组书记、主任苏高飞被查

扬子晚报
2026-09-07 12:51:00
女篮世界杯出线形势已明朗!中美韩8队提前晋级:日本或被淘汰?

女篮世界杯出线形势已明朗!中美韩8队提前晋级:日本或被淘汰?

篮球快餐车
2026-09-07 16:00:07
凤姐评论景甜,太敢说了……

凤姐评论景甜,太敢说了……

麦杰逊
2026-09-07 11:33:34
袁腾飞去了美国,梁宏达去了加拿大?

袁腾飞去了美国,梁宏达去了加拿大?

十柱
2026-09-06 12:32:39
特斯拉中国官宣大降价,实在是太狠了!

特斯拉中国官宣大降价,实在是太狠了!

XCiOS俱乐部
2026-09-07 11:19:28
保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

z千年历史老号
2026-09-07 11:43:45
天塌了!全是上亿细菌!家家户户天天在用,别不知道了!快看看!

天塌了!全是上亿细菌!家家户户天天在用,别不知道了!快看看!

三农老历
2026-09-07 15:59:35
“还我季洁”热搜第一,演员李沐宸致歉:“饰演季洁是荣幸,抱歉没接住大家对角色的期待”;导演此前称“挨骂”是意料之中

“还我季洁”热搜第一,演员李沐宸致歉:“饰演季洁是荣幸,抱歉没接住大家对角色的期待”;导演此前称“挨骂”是意料之中

大风新闻
2026-09-07 15:18:10
华为时隔六年再次发布高性能芯片

华为时隔六年再次发布高性能芯片

新华社
2026-09-07 15:08:32
万科大批员工发离职贴

万科大批员工发离职贴

地产微资讯
2026-09-07 12:59:12
重磅,大水要来了…

重磅,大水要来了…

子木聊房
2026-09-07 17:18:20
2026-09-07 20:15:00
机器人大讲堂 incentive-icons
机器人大讲堂
立德机器人平台,是一个集媒体品牌、智库咨询、投资孵化、引智招商为一体的机器人垂直领域服务平台
7049文章数 4602关注度
往期回顾 全部

科技要闻

华为Mate XT 2起售价19999元 9月12日开售

头条要闻

"女孩看演唱会被取消低保"引热议 当地人员曾反复劝阻

头条要闻

"女孩看演唱会被取消低保"引热议 当地人员曾反复劝阻

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

25.99万元起 凯迪拉克全新XT5 PHEV正式上市

态度原创

教育
本地
亲子
艺术
军事航空

教育要闻

【拜耳】招人啦!120-200/天!零基础实习!500强药企实习经历!弹性工作!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

亲子要闻

工程车小故事:小救护车给妈妈帮忙

艺术要闻

风华绝代的影后,一生坎坷令人心碎

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版