网易首页 > 网易号 > 正文 申请入驻

形界智能Rise模型,让我看到了全新的交互

0
分享至


1962 年,MIT 林肯实验室的伊万・萨瑟兰发表了一篇题为《Sketchpad:一个人机交互通信的图形系统》的论文。

里面首次用了 「计算机图形学」这个名词,很久以后人们才发现,这个词定义了我们所看到的,用图标、模块、点击等可视化的互动系统来组织并且呈现信息,完成人机交互的方式。

人和计算机的交互,过去60多年,依然延续着「计算机图形学」开创的很多范式。


但近两年,随着视频模型、世界模型的迭代,似乎更直观、更即时、更加摆脱计算机本身屏幕限制的交互形态,正在诞生。

AI的触手,已经伸进了物理世界,可以和现实中的我们产生连接。

我在想,如果视频不再只是被观看,还可以被进入、可以实时交互,会发生什么?

看到形界智能「Era」系列的原生模型Rise正式发布了,用500ms的端到端响应延迟,让人机交互,有了新的变量。

第一时间测试了一下,给大家介绍介绍。


01全域沉浸,一种全新的视频交互形态

如果把现有的视频生成模型,按交互方式分类,大致可以分成三种。

第一种是离线视频生成。这是比较主流的形态,Seedance 2.5、MiniMax H3等都属于这一类。

交互方式是输入到输出,用户给一个指令,模型按指令生成一段视频。你说什么,它呈现什么。

第二种是实时视频生成。爱诗科技、生数科技往这个方向有一些尝试。

他们把渲染速度做到了实时,你输入 prompt,画面几乎同时出来。可以在一定程度上,支持实时数字人视频通话,还有语音控制视频走向。

速度变了,但输入和输出的映射关系没变。本质还是对提示词的执行,你说什么、它呈现什么,只是会更快。

第三个是全域沉浸式生成。

这是在输入侧增加了一层感知层,模型不再只是被动等待 prompt,而是主动接收用户的实时指令、表情、环境和动作等多模态信号。

输出的内容会基于用户的状态变化而有所不同,不再是 prompt 到结果的单一映射。

前两类,解决的是怎么让视频生成得更快、更好。

现在,形界智能Rise,希望探索的是怎么让用户进入一段视频,现实中的人挥动双手,视频中可以实时发生变化。

到这里,现实和屏幕世界的边界,第一次模糊了。


人和视频、人和计算机的交互,似乎也第一次有了新的味道。

有了摄像头的理解能力,随时随地和虚拟世界里面的物体、人,甚至环境进行互动,很神奇。

02Rise模型,从技术到体验,不一样
特意研究了一下,目前主流的互动视频技术,实际上是两阶段串行系统:

先由一个视频理解模型解析用户的交互信号,生成渲染指令,再由一个视频生成模型根据指令生成画面。

但这存在两个很难绕过去的问题。

第一个是智能上限的问题。

用户的交互信号没办法被生成模型直接 Scaling,理解模型和生成模型各跑各的,Representation 没办法在同一个空间里联合优化。

说白了就是两个模型之间隔着一堵墙,理解侧再聪明,生成侧也接不住。

第二个是延迟的问题。

GenZ 时代的互动内容消费者,能接受的端到端响应耗时平均在 500 毫秒。

但两阶段串行系统从用户动作到画面响应,体感端到端时延在 4 秒左右。

理解模型生成指令要时间,生成模型接收指令再渲染也要时间,两个阶段串起来,4 秒已经算快的了。

4 秒是什么概念?在互动场景里,4 秒的延迟基本等于断联。

做一个动作,等 4 秒才看到反馈,那种沉浸感早就碎了。

这套两阶段的双工视频生成系统,是互动视频技术的中间形态。它代表了上一个时代能触碰的互动体验上限——不是技术做不到更好,是架构决定了天花板就在那里。

形界智能选择了另一条路。

他们把视频理解和视频生成做到一个模型里,在时序上把输出的每一帧和用户摄像头输入的每一帧统一建模。

没有理解模型和生成模型的分立,没有两阶段的串行等待,输入和输出在一个模型里端到端地流动。

这条路难在哪里?难在 Representation 的对齐。

视频理解需要的是语义层面的抽象,视频生成需要的是像素层面的细节,这两套东西要在同一个空间里共同优化,对模型架构和训练方法的要求极高。


但这条路走通之后的好处也是结构性的。

没有了串行等待,端到端延迟被压到了 500 毫秒以内。

这个数字刚好卡在人类感知实时交互的临界点上,超过 500 毫秒,人会感觉到卡顿;低于 500 毫秒,交互是流畅的。

形界智能今天发布的 Rise 模型,是 Era 系列第二个原生全双工视频生成基础模型。

基于约 300 小时的赛车视频的后训练数据,Rise 模拟了高速赛车场景的真实物理引擎反馈。


但真正让我觉得有意思的不是赛车本身,是 Rise 在理解侧展现出来的泛化性。

不需要专业的方向盘控制器。

对着摄像头用任意形状的东西比划:垫子、手机、甚至空手,模型都能理解你的转向意图,实时生成对应的驾驶画面。第一人称可以,第三人称也可以。

也就是说,进入这个虚拟世界的交互成本,被降到了几乎为零。

只要做出日常的真实的动作,模型就能理解你。

这才是这件事最核心的变化。

过去几十年,我们和虚拟内容之间的交互一直需要一层中介。

键盘、鼠标、手柄、方向盘,每一种外设都是一层翻译器,把我们的意图翻译成机器能理解的信号。

但现在,摄像头加上模型的理解能力,让这层翻译器变得多余了。

可以直接用手势、用动作、用任何你觉得自然的方式和虚拟世界沟通。

就像在乔布斯带来iPod、iPhone之前,人们很难想象没有物理按键的手机一样;

今天,也许我们更习惯的手势、动作等等,也可以成为更自然的人和计算机、人与模型的交互方式。

03内容的新定义

我一直在想:视频生成这个赛道,最终的终局是什么?

是生成一段无限长的视频吗?是生成 4K 甚至 8K 的画面吗?是让物理模拟真实到分不清真假吗?

这些都很重要,但肯定都不是终点。

现在的所有视频生成模型都在走一条路径,叫把视频生成得更好、更快。

但它本质都还是在执行 prompt。用户给什么指令,模型出什么结果,中间没有变量。

但有了感知层之后,输出的内容可以基于用户的状态变化而有所不同。

它不再仅仅是 prompt 到结果的一一映射,还可以有更多的智能和现实体验,体现在里面。

这让我想起形界智能上一个模型 Genesis 发布时提出的一个概念,叫体验优先计算。

他们关心的不是这段视频生成得有多快多好,而是用户有没有真正进入其中。

这两个问题的差别,就是两个时代的差别。

从订单逻辑,到现制逻辑,再到实时响应,接下来,人和模型的关系,人和内容的关系,也会发生变化。

Rise 想做的,就是让内容可以根据你的状态实时变化。

人动一下,画面就跟着动一下。换一种方式进入,画面就换一种方式响应。

是不是已经有了点《头号玩家》的样子?

还有一个细节。

Rise 的每一次真实交互,都是模型进化的燃料。

用户交互信号进入模型,模型实时生成体验,用户给出反馈,这些交互视频数据积累下来,又反过来优化模型。

而且这个飞轮的转动速度会比传统的内容平台快得多,因为每一次交互产生的不是静态的数据点,还包含了用户意图、模型响应、用户反馈的完整闭环数据。

我在想,这个「流式理解+流式生成」的双流架构的意义,除了单次体验的提升,更在于它形成了一个新的数据闭环。

Rise 目前跑通的场景是赛车。300 小时的赛车视频数据,让模型学会了高速场景的物理反馈和实时响应。


但这只是开始。

作为一个通用的双流视频模型架构,后续会在其他场景持续释放能力。

如果同样的架构,被应用到虚拟陪伴、互动娱乐、虚拟角色这些场景,事情也会很快就不一样了。

你对着摄像头笑一下,屏幕里的Ta就跟着笑。你皱一下眉头,Ta就问你怎么了。你做一个手势,Ta就知道你想要什么……

生成一个能感知你、理解你、回答你的世界,就好像,对宇宙的所有呼唤,都有了具象的回应。

04一点思考

我不喜欢用颠覆、炸裂这样的词汇,但似乎,能改变世界的模型,一定会先从改变交互体验开始。

当我们和视频的交互和相应有了不同,一种全新的内容形态、消费体验,甚至是虚拟互动的世界,即将开启。

Rise 已经把理解和生成揉进一个模型里,让用户用最自然的方式进入虚拟世界。

这条路肯定难,但似乎跳出了雕花的、重复的漩涡。

了解了一下,创始人王裕鑫,是很年轻有想象力的一位技术大牛。

2023年博士毕业,应届拿了华为、腾讯、字节、快手等多家头部企业的顶尖人才计划,最后选择投身大模型赛道创业。


在元石科技期间,他牵头组建了国内首批 MoE 架构大模型预训练团队,主导了 200B+ MoE 模型的训练工作。

其团队曾被 Django 联创 Simon Willison 评选为 2025 年中国 Top 6 大模型团队之一。

他们是明星团队,但更让我兴奋的,是他们在尝试定义,未来的内容交互范式。

随时随地,和一个虚拟世界里面的物体、人、环境,进行即时互动,产生新的创意和体验。

这可能是未来几年世界模型、视频生成赛道更值得看的方向。

现在,Rise 非常有诚意,没有 waiting list,官网能直接体验。


官网:https://www.frame-x.ai/models/rise?ref=rsh_a77729dy19d2qn03

感兴趣的朋友,抓紧去试试!

用手比划一下,就能感受这种新的交互方式!

也许有一天,我们看到人们都在自己家里,对着空中手舞足蹈,别奇怪,也许那就是更好玩的未来模样……


朋友圈会发一些具体的案例和商业化日常~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

z千年历史老号
2026-09-07 11:43:45
救援人员因为害怕,放下灭火器后跑了!这次真的太丢人了

救援人员因为害怕,放下灭火器后跑了!这次真的太丢人了

走读新生
2026-09-06 23:20:07
星宇股份处罚高管,好像又违反劳动法了

星宇股份处罚高管,好像又违反劳动法了

晶柯喻律
2026-09-07 12:42:36
2-0,2-1!美网8强已出2席,萨巴伦卡17连胜,郑钦文比赛时间出炉

2-0,2-1!美网8强已出2席,萨巴伦卡17连胜,郑钦文比赛时间出炉

侃球熊弟
2026-09-07 03:59:13
“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

新民周刊
2026-09-07 16:55:42
特斯拉中国官宣大降价,实在是太狠了!

特斯拉中国官宣大降价,实在是太狠了!

XCiOS俱乐部
2026-09-07 11:19:28
强烈谴责!八国外长发表联合声明

强烈谴责!八国外长发表联合声明

政知新媒体
2026-09-06 18:31:59
丢人丢到全世界!上海赛车场大火 49 秒生死救援:外国车手冒死救人,官方保障全程拉胯

丢人丢到全世界!上海赛车场大火 49 秒生死救援:外国车手冒死救人,官方保障全程拉胯

魔都姐姐杂谈
2026-09-07 10:06:33
华为时隔六年再次发布高性能芯片

华为时隔六年再次发布高性能芯片

新华社
2026-09-07 15:08:32
万科大批员工发离职贴

万科大批员工发离职贴

地产微资讯
2026-09-07 12:59:12
“我们怎么落到与朝鲜伊朗为伍的地步?”这个问题问得好!

“我们怎么落到与朝鲜伊朗为伍的地步?”这个问题问得好!

廖保平
2026-09-07 08:38:06
华为彻底告别安卓:HarmonyOS 7移除兼容层,纯血鸿蒙走完最后一公里

华为彻底告别安卓:HarmonyOS 7移除兼容层,纯血鸿蒙走完最后一公里

数码Antenna
2026-09-07 11:57:26
压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

狼叔评论
2026-09-07 16:20:13
7个葫芦娃剪掉后第一个清晨:葫芦娃爷爷趴在阳台上打水,葫芦娃没了,流量点没了,现场几乎没人拍了

7个葫芦娃剪掉后第一个清晨:葫芦娃爷爷趴在阳台上打水,葫芦娃没了,流量点没了,现场几乎没人拍了

火山詩话
2026-09-07 05:57:18
突发!华为拿下玛莎拉蒂!

突发!华为拿下玛莎拉蒂!

财经要参
2026-09-07 12:00:03
蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

晓銊就是我
2026-09-07 12:39:23
百万吃播网红“莹莹”去世,仅24岁,知情人曝原因,长期大油大盐

百万吃播网红“莹莹”去世,仅24岁,知情人曝原因,长期大油大盐

裕丰娱间说
2026-09-06 18:18:40
中国的萝卜快跑明明已经跑了4年,可为什么生意越来越少了?

中国的萝卜快跑明明已经跑了4年,可为什么生意越来越少了?

流苏晚晴
2026-09-07 11:52:58
有一种降价叫“现金激励”,特斯拉中国宣布:9月30日前下单提车,Model 3减5000元,Model Y减10000元

有一种降价叫“现金激励”,特斯拉中国宣布:9月30日前下单提车,Model 3减5000元,Model Y减10000元

都市快报橙柿互动
2026-09-07 11:31:58
为什么赛车手敢去救人,救援人员却丢下灭火器逃离?

为什么赛车手敢去救人,救援人员却丢下灭火器逃离?

火山口的普林尼
2026-09-06 23:37:56
2026-09-07 17:55:01
AI异类 incentive-icons
AI异类
从硅谷到中关村,AI信息与测评
252文章数 11关注度
往期回顾 全部

科技要闻

华为Mate XT 2起售价19999元 9月12日开售

头条要闻

"女孩看演唱会被取消低保"引热议 当地人员曾反复劝阻

头条要闻

"女孩看演唱会被取消低保"引热议 当地人员曾反复劝阻

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
教育
健康
房产
数码

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

教育要闻

年仅46岁!北京44中学生志浩老师意外离世:留给学生的最后一句话,成了永远的遗憾

同样是脑梗,为何康复结局大不同?

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

数码要闻

华为FreeBuds 7悦彰耳机正式发布 单只4.3g 售999元起

无障碍浏览 进入关怀版