![]()
刷新纪录!8月12日下午,自变量进行了持续一小时的分拣挑战直播,分拣效率达到1816件每小时!直接刷新了之前Figure AI 1248件的单小时纪录。需要注意的是,自变量的硬件方案只采用了双机械臂搭配夹爪,并非采用昂贵的灵巧手方案,相比之下成本下降70%。采用自研的WALL-B世界统一模型,面对随机包裹,其效率提升了45%。
这份成绩不是单次的技术秀,而是自变量长期坚持全栈技术路线的集中落地,其技术底色早在今年WAIC 现场就已清晰展现。
01
从“完成动作”到“理解任务”,机器人开始重新定义“会干活”
在今年WAIC现场,机器人展示的重点正在发生变化。
从“能不能完成一个动作”,转向“能不能理解一件事情”。这看似只是技术细节的变化,却意味着具身智能竞争开始进入新的阶段。
把一只水杯放到桌子另一侧,对于人来说,这是一个完整的动作;但对于机器人而言,它需要经历识别水杯、规划路径、控制机械臂、调整抓取力度、移动、放置等一连串步骤。过去很长一段时间,机器人更多是在执行这些被拆解好的动作,一旦环境发生变化,例如杯子的位置偏了一点、桌面多了一件杂物,就可能需要重新规划甚至重新训练。
![]()
图源:自变量机器人官网
真实世界显然不会按照预设剧本运行。
工厂里的零件摆放每天都可能发生细微变化,医院里的推车随时会移动,家庭环境更充满大量不可预测因素。机器人要真正进入这些场景,仅仅能够完成某一个标准动作已经远远不够,更重要的是理解自己正在完成什么任务,以及下一步可能发生什么。
这也是世界模型(World Model)成为近一年具身赛道核心方向的原因。今年 5 月,自变量发布全球首个事件级预测具身智能世界模型 WALL-WM,并在本届 WAIC 作为核心技术成果亮相。和传统方案按固定时间帧预测动作不同,WALL-WM 以 “抓取”“归置” 这类语义事件作为推理单元,让机器人的关注点从连续的画面帧,转向完整的任务过程。
在 WALL-B 世界统一模型的底座之上,自变量又通过 WALL-WM 进一步强化了世界预测与任务理解能力,形成了 “基础底座 + 专项突破” 的技术迭代节奏。
打个比方,以前的机器人像逐帧盯监控,每隔固定时间记录一次画面;现在的机器人更像人回忆事件,记住的是 “拿杯子”“放柜子”“关门” 这些关键节点,而不是大量几乎没有变化的冗余画面。
机器人开始尝试理解事件之间的因果关系,能够判断哪些信息值得关注,哪些过程可以省略,也更容易把一次任务积累的经验迁移到新的场景中。正是在这一趋势下,包括英伟达、Google DeepMind等企业,都将世界模型视为推动机器人提升泛化能力的重要方向,并持续投入相关研究。
整个行业的关注重点也正在重新调整。除了围绕模型参数和算法精度的技术竞争之外,机器人是否真正理解任务、能否适应开放环境、是否具备持续学习能力,正在成为新的讨论焦点。
但模型能力只是技术底座,不代表就能完成工程化落地,训练出来的能力如何持续迭代,并最终变成可以复制、可以量产的产品,才是下一阶段拉开差距的地方。
如何让模型能力真正转化为稳定的产品能力,正是自变量机器人坚持全栈路线的出发点,也是整个具身智能行业共同面对的新课题。
02
从模型到机器,全栈路线为什么成为下一阶段竞争关键?
如果说世界模型解决的是机器人“如何理解任务”,那么决定机器人能否稳定上岗的,则是另一套更复杂的系统工程。
在机器人行业,全栈一直是充满争议的话题。有人认为,鉴于传统半导体行业的Fabless模式,没有必要重复造轮子,采购成熟的机械臂、灵巧手和关节模组,再结合优秀的大模型,同样能够快速推出产品;也有人倾向于IDM模式,坚持从模型到本体,再到核心零部件全部自研,希望把每一个环节都掌握在自己手里。
如今,越来越多企业开始选择后者,背后的原因在于机器人与大语言模型存在明显区别。
聊天机器人完成一次回答,整个任务流基本宣告结束;但具身机器人完成一个动作,真正重要的数据才刚刚产生。
机器人每一次的抓取失败、避障绕行和力度调整,都会形成新的环境数据。这些数据需要瞬间回流到模型继续训练,在极短的时间内部署到机器人验证效果,形成新的数据积累。模型、硬件、控制系统、传感器之间始终保持协同,整个闭环才能持续运转。
任何一个环节脱节,都会影响下一轮迭代效率。
这也是自变量机器人坚持全栈路线的重要逻辑。
除了持续迭代WALL系列模型,自变量机器人还布局机器人本体、灵巧手、关节模组等核心硬件,希望让模型训练、硬件控制和数据回流建立统一体系。而 WALL-WM 的落地应用,进一步将世界模型的 “事件级预测” 能力与真机硬件深度打通。
对全栈体系来说,事件级预测的价值,是让模型、硬件、数据的连接更紧密。机器人围绕任务过程做推理,真实场景里的每一次执行结果,都能直接成为下一轮模型优化的依据。
机器人完成一次搬运任务后,可以围绕整个事件总结经验,而不是记录大量重复画面;面对新的工作环境,也更容易将已有经验迁移到相似任务中,减少重新训练成本。这种“理解事件—预测结果—执行动作”的推理方式,也让机器人更接近人在真实环境中的工作逻辑。
![]()
图源:自变量机器人官网
但模型能力的落地,离不开数据基建的支撑。世界模型需要真实场景不断提供数据,硬件需要保证动作能够稳定复现,控制系统需要保证模型输出能够精准执行,每一次部署后的结果又要重新反馈到模型训练。
为了让这一闭环真正运转,自变量机器人近一年也开始围绕数据基础设施持续布局,包括推出无本体数据采集方案、自动化数据处理平台等,希望进一步提升数据采集效率,缩短模型迭代周期。数据采集、模型训练和部署验证之间的距离越短,模型迭代速度也越快。
![]()
图源:自变量机器人官网
全栈路线的核心价值,本质是掌握数据闭环的主动权。
很多人将全栈理解为“一家公司包揽所有环节”,但从产业发展的角度来看,它更像是在构建一条完整的数据闭环:模型决定机器人如何思考,硬件决定机器人如何行动,真实场景不断产生新的数据,新的数据又推动模型持续进化。整个系统越完整,迭代效率越高,机器人适应复杂环境的能力也越强。
资本市场越来越关注的,也正是这种系统能力。具身智能产业竞争正在逐步从单点技术突破,转向软硬件协同、数据积累和工程化能力的综合比拼。业内越来越多企业开始围绕模型、本体、核心零部件和数据平台展开布局,希望建立持续迭代的竞争壁垒。
不过,模型能够形成闭环,并不意味着商业化也会自然形成闭环。
机器人完成一次精彩演示并不困难,困难的是连续完成成千上万次相同任务,依然保持稳定的成功率、效率和成本控制。当行业竞争开始从实验室走向真实产线,全栈路线也将迎来比模型训练更加复杂的考验。
03
从实验室到真实世界,全栈路线还有几道关?
机器人竞争正在进入新的阶段:模型能力只是入场券,能让机器人稳定完成任务,才是真正的产业考验。
对于具身智能企业而言,模型跑通只是起点。演示视频里的几分钟,可以展示技术突破;机器人进入真实场景后的长期表现,才决定一家企业能否走向规模化。
过去两年,行业里出现了大量令人惊艳的Demo:机器人能够整理衣物、叠毛巾、制作咖啡,甚至完成复杂的双手协作。这些能力证明了具身智能正在快速进步,却并不能直接回答另一个更现实的问题——机器人能否连续完成成千上万次相同任务,并保持稳定的成功率、效率和成本。
两者的核心差距,不是单次成功率,而是长期运行的稳定性与单位任务成本。对于坚持全栈路线的自变量机器人来说:
第一个挑战来自制造能力。模型可以快速迭代,硬件却遵循制造业的规律。从机器人本体、灵巧手到关节模组,每一个零部件都会影响整机表现。一旦进入批量交付阶段,产品一致性、供应链稳定性、装配精度以及成本控制,都将成为影响竞争力的重要因素。全栈意味着拥有更多自主可控能力,也意味着需要承担更多责任和环节控制。
第二个挑战来自商业化路径。目前,具身智能正在形成两条不同的发展路线。一类企业希望打造能够适应更多任务的通用机器人,通过持续积累数据不断提升泛化能力;另一类企业则优先聚焦工业制造、物流分拣、商业服务等垂直场景,用相对标准化的任务率先验证商业模式。
两种路线并没有绝对优劣。
前者拥有更大的长期想象空间,但需要更长的数据积累和工程验证周期;后者更容易建立稳定的商业闭环,也能够更快获得真实场景反馈。对于自变量机器人而言,坚持全栈和通用具身智能路线,意味着需要持续证明模型能力能够转化为真实的商业价值,而不仅停留在技术展示层面。
目前来看,物流搬运、工业操作、商业配送等场景更容易成为具身智能商业化的突破口。原因在于这些任务重复性较高、评价标准相对明确,机器人是否提升效率、降低成本,可以通过实际业务结果验证。
真正复杂的考验,或许还来自社会层面。
不少企业都将C端的家庭服务、养老陪护视为具身智能的重要未来市场,这些场景拥有更广阔的需求,也意味着机器人将长期进入私人生活空间。机器人持续感知环境、记录数据,与老人、儿童保持高频互动,都会带来安全、隐私以及责任边界等新的讨论。
这些问题很难依靠一次模型升级解决。
例如,当机器人因为环境判断失误造成财产损失,责任如何划分;当家庭数据持续用于模型训练,用户如何获得充分的知情权和选择权;当机器人逐渐承担陪护、照护等角色,行业又该建立怎样的安全标准和监管体系。这些问题已经超出了工程范畴,也将在很大程度上影响具身智能进入C端市场的速度。
对于具身智能而言,算法能力决定上限,工程化能力决定落地速度。机器人行业已经走到了一个新的阶段。模型能力仍然重要,但它越来越像一张“入场券”。拉开差距的,将是工程化能力、制造能力、场景验证能力,以及建立用户信任的能力。
04
全栈路线打破模型至上
这场 1816 件 / 小时的分拣挑战,恰恰是具身智能翻过 “模型至上” 一页的最好注脚。
过去行业评判企业实力,看参数大小、看 Demo 惊艳程度、看灵巧手自由度高低。但这一次,自变量用双机械臂加普通夹爪的平实配置,跑出了远超海外同行的效率,还把硬件成本压降了 70%。它传递的信号很明确:具身智能的核心竞争力,已经从 “能不能做出动作”,转向 “能不能低成本、稳定地批量完成任务”。
这份成绩,正是全栈路线的价值兑现。全栈的核心从来不是 “所有零件都自己造”,而是从根源上掌握 “数据采集 - 模型迭代 - 硬件执行” 的闭环主动权。也正因如此,WALL-B 的理解能力、WALL-WM 的事件级推理能力,才能精准落地到普通夹爪的硬件上 —— 不用靠昂贵的灵巧手堆料,靠算法对任务的深度理解补位,就能把模型的 “聪明” 实实在在转化为产线上的效率。
对整个行业来说,这是一个清晰的转折点。模型能力依然重要,但早已从 “决胜壁垒” 变成了 “入场门票”。从理解任务,到工程交付,再到商业化落地,考验企业的从来不是单点技术突破,而是能不能把每一次技术进步,都沉淀成可复制、可规模化的产品能力。
自变量选的全栈路更难走,最终能不能筑起足够深的竞争壁垒,还要靠更多场景、更长时间的验证。但可以确定的是,未来能真正走进工厂、医院、商场,最终走进千家万户的机器人,靠的从来不是一次惊艳的演示,而是成千上万次稳定运行背后,藏着的效率、成本与可靠性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.