网易首页 > 网易号 > 正文 申请入驻

形界智能Rise模型,让我看到了全新的交互

0
分享至


1962 年,MIT 林肯实验室的伊万・萨瑟兰发表了一篇题为《Sketchpad:一个人机交互通信的图形系统》的论文。

里面首次用了 「计算机图形学」这个名词,很久以后人们才发现,这个词定义了我们所看到的,用图标、模块、点击等可视化的互动系统来组织并且呈现信息,完成人机交互的方式。

人和计算机的交互,过去60多年,依然延续着「计算机图形学」开创的很多范式。


但近两年,随着视频模型、世界模型的迭代,似乎更直观、更即时、更加摆脱计算机本身屏幕限制的交互形态,正在诞生。

AI的触手,已经伸进了物理世界,可以和现实中的我们产生连接。

我在想,如果视频不再只是被观看,还可以被进入、可以实时交互,会发生什么?

看到形界智能「Era」系列的原生模型Rise正式发布了,用500ms的端到端响应延迟,让人机交互,有了新的变量。

第一时间测试了一下,给大家介绍介绍。


01全域沉浸,一种全新的视频交互形态

如果把现有的视频生成模型,按交互方式分类,大致可以分成三种。

第一种是离线视频生成。这是比较主流的形态,Seedance 2.5、MiniMax H3等都属于这一类。

交互方式是输入到输出,用户给一个指令,模型按指令生成一段视频。你说什么,它呈现什么。

第二种是实时视频生成。爱诗科技、生数科技往这个方向有一些尝试。

他们把渲染速度做到了实时,你输入 prompt,画面几乎同时出来。可以在一定程度上,支持实时数字人视频通话,还有语音控制视频走向。

速度变了,但输入和输出的映射关系没变。本质还是对提示词的执行,你说什么、它呈现什么,只是会更快。

第三个是全域沉浸式生成。

这是在输入侧增加了一层感知层,模型不再只是被动等待 prompt,而是主动接收用户的实时指令、表情、环境和动作等多模态信号。

输出的内容会基于用户的状态变化而有所不同,不再是 prompt 到结果的单一映射。

前两类,解决的是怎么让视频生成得更快、更好。

现在,形界智能Rise,希望探索的是怎么让用户进入一段视频,现实中的人挥动双手,视频中可以实时发生变化。

到这里,现实和屏幕世界的边界,第一次模糊了。


人和视频、人和计算机的交互,似乎也第一次有了新的味道。

有了摄像头的理解能力,随时随地和虚拟世界里面的物体、人,甚至环境进行互动,很神奇。

02Rise模型,从技术到体验,不一样
特意研究了一下,目前主流的互动视频技术,实际上是两阶段串行系统:

先由一个视频理解模型解析用户的交互信号,生成渲染指令,再由一个视频生成模型根据指令生成画面。

但这存在两个很难绕过去的问题。

第一个是智能上限的问题。

用户的交互信号没办法被生成模型直接 Scaling,理解模型和生成模型各跑各的,Representation 没办法在同一个空间里联合优化。

说白了就是两个模型之间隔着一堵墙,理解侧再聪明,生成侧也接不住。

第二个是延迟的问题。

GenZ 时代的互动内容消费者,能接受的端到端响应耗时平均在 500 毫秒。

但两阶段串行系统从用户动作到画面响应,体感端到端时延在 4 秒左右。

理解模型生成指令要时间,生成模型接收指令再渲染也要时间,两个阶段串起来,4 秒已经算快的了。

4 秒是什么概念?在互动场景里,4 秒的延迟基本等于断联。

做一个动作,等 4 秒才看到反馈,那种沉浸感早就碎了。

这套两阶段的双工视频生成系统,是互动视频技术的中间形态。它代表了上一个时代能触碰的互动体验上限——不是技术做不到更好,是架构决定了天花板就在那里。

形界智能选择了另一条路。

他们把视频理解和视频生成做到一个模型里,在时序上把输出的每一帧和用户摄像头输入的每一帧统一建模。

没有理解模型和生成模型的分立,没有两阶段的串行等待,输入和输出在一个模型里端到端地流动。

这条路难在哪里?难在 Representation 的对齐。

视频理解需要的是语义层面的抽象,视频生成需要的是像素层面的细节,这两套东西要在同一个空间里共同优化,对模型架构和训练方法的要求极高。


但这条路走通之后的好处也是结构性的。

没有了串行等待,端到端延迟被压到了 500 毫秒以内。

这个数字刚好卡在人类感知实时交互的临界点上,超过 500 毫秒,人会感觉到卡顿;低于 500 毫秒,交互是流畅的。

形界智能今天发布的 Rise 模型,是 Era 系列第二个原生全双工视频生成基础模型。

基于约 300 小时的赛车视频的后训练数据,Rise 模拟了高速赛车场景的真实物理引擎反馈。


但真正让我觉得有意思的不是赛车本身,是 Rise 在理解侧展现出来的泛化性。

不需要专业的方向盘控制器。

对着摄像头用任意形状的东西比划:垫子、手机、甚至空手,模型都能理解你的转向意图,实时生成对应的驾驶画面。第一人称可以,第三人称也可以。

也就是说,进入这个虚拟世界的交互成本,被降到了几乎为零。

只要做出日常的真实的动作,模型就能理解你。

这才是这件事最核心的变化。

过去几十年,我们和虚拟内容之间的交互一直需要一层中介。

键盘、鼠标、手柄、方向盘,每一种外设都是一层翻译器,把我们的意图翻译成机器能理解的信号。

但现在,摄像头加上模型的理解能力,让这层翻译器变得多余了。

可以直接用手势、用动作、用任何你觉得自然的方式和虚拟世界沟通。

就像在乔布斯带来iPod、iPhone之前,人们很难想象没有物理按键的手机一样;

今天,也许我们更习惯的手势、动作等等,也可以成为更自然的人和计算机、人与模型的交互方式。

03内容的新定义

我一直在想:视频生成这个赛道,最终的终局是什么?

是生成一段无限长的视频吗?是生成 4K 甚至 8K 的画面吗?是让物理模拟真实到分不清真假吗?

这些都很重要,但肯定都不是终点。

现在的所有视频生成模型都在走一条路径,叫把视频生成得更好、更快。

但它本质都还是在执行 prompt。用户给什么指令,模型出什么结果,中间没有变量。

但有了感知层之后,输出的内容可以基于用户的状态变化而有所不同。

它不再仅仅是 prompt 到结果的一一映射,还可以有更多的智能和现实体验,体现在里面。

这让我想起形界智能上一个模型 Genesis 发布时提出的一个概念,叫体验优先计算。

他们关心的不是这段视频生成得有多快多好,而是用户有没有真正进入其中。

这两个问题的差别,就是两个时代的差别。

从订单逻辑,到现制逻辑,再到实时响应,接下来,人和模型的关系,人和内容的关系,也会发生变化。

Rise 想做的,就是让内容可以根据你的状态实时变化。

人动一下,画面就跟着动一下。换一种方式进入,画面就换一种方式响应。

是不是已经有了点《头号玩家》的样子?

还有一个细节。

Rise 的每一次真实交互,都是模型进化的燃料。

用户交互信号进入模型,模型实时生成体验,用户给出反馈,这些交互视频数据积累下来,又反过来优化模型。

而且这个飞轮的转动速度会比传统的内容平台快得多,因为每一次交互产生的不是静态的数据点,还包含了用户意图、模型响应、用户反馈的完整闭环数据。

我在想,这个「流式理解+流式生成」的双流架构的意义,除了单次体验的提升,更在于它形成了一个新的数据闭环。

Rise 目前跑通的场景是赛车。300 小时的赛车视频数据,让模型学会了高速场景的物理反馈和实时响应。


但这只是开始。

作为一个通用的双流视频模型架构,后续会在其他场景持续释放能力。

如果同样的架构,被应用到虚拟陪伴、互动娱乐、虚拟角色这些场景,事情也会很快就不一样了。

你对着摄像头笑一下,屏幕里的Ta就跟着笑。你皱一下眉头,Ta就问你怎么了。你做一个手势,Ta就知道你想要什么……

生成一个能感知你、理解你、回答你的世界,就好像,对宇宙的所有呼唤,都有了具象的回应。

04一点思考

我不喜欢用颠覆、炸裂这样的词汇,但似乎,能改变世界的模型,一定会先从改变交互体验开始。

当我们和视频的交互和相应有了不同,一种全新的内容形态、消费体验,甚至是虚拟互动的世界,即将开启。

Rise 已经把理解和生成揉进一个模型里,让用户用最自然的方式进入虚拟世界。

这条路肯定难,但似乎跳出了雕花的、重复的漩涡。

了解了一下,创始人王裕鑫,是很年轻有想象力的一位技术大牛。

2023年博士毕业,应届拿了华为、腾讯、字节、快手等多家头部企业的顶尖人才计划,最后选择投身大模型赛道创业。


在元石科技期间,他牵头组建了国内首批 MoE 架构大模型预训练团队,主导了 200B+ MoE 模型的训练工作。

其团队曾被 Django 联创 Simon Willison 评选为 2025 年中国 Top 6 大模型团队之一。

他们是明星团队,但更让我兴奋的,是他们在尝试定义,未来的内容交互范式。

随时随地,和一个虚拟世界里面的物体、人、环境,进行即时互动,产生新的创意和体验。

这可能是未来几年世界模型、视频生成赛道更值得看的方向。

现在,Rise 非常有诚意,没有 waiting list,官网能直接体验。


官网:https://www.frame-x.ai/models/rise?ref=rsh_a77729dy19d2qn03

感兴趣的朋友,抓紧去试试!

用手比划一下,就能感受这种新的交互方式!

也许有一天,我们看到人们都在自己家里,对着空中手舞足蹈,别奇怪,也许那就是更好玩的未来模样……


朋友圈会发一些具体的案例和商业化日常~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
75岁大爷与保姆生下儿子,做亲子鉴定后,大爷却被子女们气得心梗

75岁大爷与保姆生下儿子,做亲子鉴定后,大爷却被子女们气得心梗

黄家湖的忧伤
2025-03-06 09:30:21
继续停牌!600825,筹划重大资产重组

继续停牌!600825,筹划重大资产重组

新浪财经
2026-09-07 21:28:59
因为穷听到过哪些让你无法释怀的话?

因为穷听到过哪些让你无法释怀的话?

康富贵碎碎念
2026-09-07 11:42:55
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
中国电网负债3万亿,外媒称百年难回本

中国电网负债3万亿,外媒称百年难回本

梦想的现实
2026-07-01 01:11:56
欧盟市场留给我们的窗口期只剩下16个月。

欧盟市场留给我们的窗口期只剩下16个月。

流苏晚晴
2026-09-02 19:04:44
投资高手,卡斯比NBA生涯赚1800万,如今其风投公司管理8亿资产

投资高手,卡斯比NBA生涯赚1800万,如今其风投公司管理8亿资产

懂球帝
2026-09-07 15:39:08
5999元起,华为Pura X View阔直板手机正式上市

5999元起,华为Pura X View阔直板手机正式上市

IT之家
2026-09-07 16:49:35
华为新三折叠19999元起,性能提升42%

华为新三折叠19999元起,性能提升42%

字节漫游指南
2026-09-07 22:55:12
毁掉孩子最快的方法,就是放任孩子做这4件事……

毁掉孩子最快的方法,就是放任孩子做这4件事……

新东方家庭教育
2026-09-07 14:52:35
无法理解!合工大一新生申请退学,集成电路专业,网友无法理解,本人回应不后悔

无法理解!合工大一新生申请退学,集成电路专业,网友无法理解,本人回应不后悔

育学笔谈
2026-09-07 16:11:35
活捉赖清德不再是口号!美军司令亲口承认:留给台岛的时间不多了

活捉赖清德不再是口号!美军司令亲口承认:留给台岛的时间不多了

无悔的灿烂人生
2026-08-17 20:15:59
日本放狠话了:中国不敢去,我去!

日本放狠话了:中国不敢去,我去!

智先生
2026-09-07 22:31:04
韦世豪称被网暴,妻子:已报警

韦世豪称被网暴,妻子:已报警

南方都市报
2026-09-07 14:33:28
英格兰公开赛首日:常冰玉收琼斯退赛大礼!丁俊晖、赵心童谨防冷门

英格兰公开赛首日:常冰玉收琼斯退赛大礼!丁俊晖、赵心童谨防冷门

球场没跑道
2026-09-07 08:21:16
一场1-2,输球不可怕,可怕的是赛后阿隆索的这番话:让人很揪心

一场1-2,输球不可怕,可怕的是赛后阿隆索的这番话:让人很揪心

林子说事
2026-09-07 09:50:20
郑钦文创造了难以复制的神话,美网历史第一,大满贯历史第二次

郑钦文创造了难以复制的神话,美网历史第一,大满贯历史第二次

南海浪花
2026-09-06 03:00:12
“睡了等于没睡”再添实锤!最新研究:睡眠越碎片化,大脑“痴呆蛋白”堆积越多,助推阿尔茨海默病;且这一脑区紧绷,中老年睡眠更碎

“睡了等于没睡”再添实锤!最新研究:睡眠越碎片化,大脑“痴呆蛋白”堆积越多,助推阿尔茨海默病;且这一脑区紧绷,中老年睡眠更碎

梅斯医学
2026-09-04 07:55:33
戏混子又来嚯嚯央视大剧?演技呆板、台词不清,老戏骨也带不动

戏混子又来嚯嚯央视大剧?演技呆板、台词不清,老戏骨也带不动

青橘罐头
2026-09-07 17:09:28
7岁男孩临终前回光返照,突然指向病房门外:有人

7岁男孩临终前回光返照,突然指向病房门外:有人

民生故事会
2026-09-07 02:25:40
2026-09-07 23:28:49
AI异类 incentive-icons
AI异类
从硅谷到中关村,AI信息与测评
252文章数 11关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

朝鲜新战舰"对阵"美日韩军演 特朗普此前刚向朝鲜示好

头条要闻

朝鲜新战舰"对阵"美日韩军演 特朗普此前刚向朝鲜示好

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

25.99万元起 凯迪拉克全新XT5 PHEV正式上市

态度原创

本地
亲子
手机
数码
艺术

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

亲子要闻

混血宝宝一岁了!爷爷奶奶办周岁宴庆祝,战斗娃嗦长寿面反应绝了

手机要闻

OriginOS 7内测招募:14款机型抢先尝鲜,升级的重心也已清晰!

数码要闻

2026北京摄影周佳能CPS会员摄影展开幕:160幅作品展出

艺术要闻

Denisenko Olga:俄罗斯当代女画家

无障碍浏览 进入关怀版