上周我去线下参加了一个具身智能模型的本地演示,看完以后相当震惊。
这是我第一次看到真实的、没有遥控和预编程,能跟周围环境、人物实时交互,而且是运行在本地、真正跑在机器人上的具身智能模型。
这家公司叫“一念Unisonmind”,是一个清华团队,CEO是清华计算机博士耿威。他们在没有拿太多融资的情况下,做出了非常了不起的成果。
我一直以为具身智能或者机器人行业的 GPT-3.5 时刻还需要很久才会到来,但现在看来,它可能很快就会到来。
他们在现场演示了三个机器人。这个模型是通用的,可以在任何机器人上运行:
1. 人形机器人
2. 四足狗形机器人,四足轮式机器狗
3. 甚至是你在市场上随便买的电动轮椅,也可以适配。
更令我震惊的是它的识别和交互速度,非常迅速且准确。
比如当时演示了一个拍乒乓球的场景:随便找一个人去拍球,让机器人数数。
我们都知道多模态模型做这类任务非常困难,因为注意力机制(Attention)的问题,它很难捕捉到所有的视频帧,如果拍球速度极快,很可能就会漏掉。
但它一个都没数错,而且这是在线下随机找人测试的,拍球数量和节奏无法作假。
更有意思的是,线下的机器人、机器狗和机器轮椅之间还能相互沟通交流。因为他们暂时还没跟机器人厂商深度合作,只是把本地显卡绑在机器人后面,导致机器人走起来有点“难受”。
机器人甚至会尝试叫那个机器轮椅过来接它。还有一个特别搞笑的细节:机器人休眠的时候是蹲着的,它竟然问周围的人自己是不是在“拉shi”,需不需要给它一张纸。
它现在基本上可以完成一些正常的任务。比如有一个场景是机器狗跑到隔壁咖啡店找到老板,点了一杯咖啡,然后领着老板把咖啡送回来。我觉得这个场景非常有意义。
当有人拿着假的广告牌演示对应的商店让它去找时,它甚至知道那是假的,还会吐槽说:“你又拿那个假的牌子骗我,又在糊弄我。”这种“人味儿”是非常可贵的,非常厉害。
他们也分享了实现具身智能 AGI 的“3+1”个必要条件:
1. 一个脑子实现多模态的流式(Streaming)理解和生成
2. 需要端侧部署
看完这个演示以后,我对具身智能“大脑”部分的发展变得乐观了许多。如果后面他们有机会再举行线下演示的时候,我觉得离得近的可以去试试,很有意思。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.