网易首页 > 网易号 > 正文 申请入驻

ZPedia|视频版 GPT-Live 来了,形界智能发布 Genesis-1.0,面向长时、智能的 AI 互动娱乐基础设施

0
分享至



今年 7 月,OpenAI 发布 GPT-Live。相比过去一问一答式的语音助手,其核心突破不仅在于更自然的拟真音色,更在于把 AI 的交互方式从“回合制”推向了真正的实时对话:模型具备边说边听的全双工能力,支持随时打断,甚至懂得在恰当的时机保持沉默;遇到复杂推理和工具调用时,再把任务交给后台模型处理,而不需要让当前对话停下来。OpenAI 当时披露,每周已经有超过 1.5 亿人通过 Voice、Dictation 等语音功能和 ChatGPT 交互。

这件事带来的一个直观变化是,人开始更愿意和 AI 进行更长时间、更高频率的持续互动。

文字聊天天然是一种“输入—回答”的离散交互,语音则更接近现实中的持续交流。而当交互形式继续从 Voice 走向 Video,问题会再往前一步:AI 不仅要一直听着,还要一直“看着”。

用户正在说话还是已经停下来,脸上的表情是什么,突然挥了挥手还是比了一个心,甚至一句话都没有说,只是移开视线——这些没有进入文字和语音的信息,本身就是人与人交流的一部分。

9 月 18 日,成立不到四个月的形界智能(Frame-X)计划正式发布 Genesis-1.0,并向用户开放体验 24 小时 AI 直播。形界把它定位为一套面向 AI 社交、陪伴和互动娱乐的视频双工模型。

相比今年 7 月在 WAIC 首次亮相的 Genesis,1.0 版本给出了一组更接近产品化的数字:连续生成超过 24 小时,画面行为响应平均 1.5 秒,最快可达到 1.2 秒,支持全身动作,调用价格为每秒 0.003 美元。

放到今天的实时 Avatar 市场里,这组参数已经颇具进攻性。Runway Characters 的 API 单次会话最长为 5 分钟;HeyGen LiveAvatar 根据不同产品层级,单次会话上限从 5 分钟到 60 分钟不等;另一家实时视频公司 Vivix 推出的 A1,则把能力进一步扩展到全身动作与开放世界交互,并持续响应新的用户输入。


图片来源:Frame-X

但 24 小时、1.5 秒这些数字并不是 Genesis-1.0 真正想讲的故事。

形界把一个面向社交的 AI 角色需要具备的基本能力归结成两件事:它能不能一直在,以及它是不是真的看得到你。前者要求模型长期维持一个稳定的角色和世界;后一个问题则更接近真实社交的本质——AI 不仅要听懂用户说了什么,还要持续读取人的表情、动作、姿态乃至沉默,把这些非语言信号一并纳入交互。只有做到这一步,视频才不只是给用户看的输出,而真正成为模型类人感行为输出的另一条通道。


长时一致性大考:24 小时不宕机背后的“世界维持”能力

今天绝大多数 AI 视频仍然是一种有终点的内容。

用户输入一句提示词,模型生成几秒或者几十秒的视频,任务就结束了。但实时交互视频没有天然的终点,它更像一场不会提前写好剧本的直播,用户可能随时改变动作、说一句话、拿起一个物体,甚至突然离开镜头。视频必须根据已经发生的一切实时演算继续向前生成。

这也带来了实时视频最棘手的问题之一——误差累积。

实时视频生成采用 Auto-Regressive(AR)方式连续生成,模型刚刚生成的结果很快会成为下一轮生成的上下文。一次很小的偏差,如果没有被纠正,就可能不断传下去:先是人物五官稍微变化,接着衣服颜色漂移、物体消失、空间结构变形,最后连人物和环境之间原本成立的关系都逐渐失真。

所以,当生成时间从几十秒拉长到几十分钟甚至数小时,真正关键的问题在于画面的一致性——生成到足够久以后,模型还知不知道这个世界现在的确切状态。

Genesis-1.0 此次针对长时误差累积与生成一致性问题进行了专项优化,将业界约 5 分钟级的互动时长,提升至稳定的 24 小时。


图片来源:Frame-X

但 24 小时本身并不是重点。它更像一次压力测试,测试模型在经过成千上万轮连续生成之后,角色身份、场景结构和已经发生过的状态变化能否继续被模型正确继承。

这和大语言模型的长上下文能力有些相似。长上下文的关键并不是简单“读得更长”,而是在经历大量历史以后,仍然知道哪些信息和当前有关。放到视频里,就是运行足够久之后,模型仍要知道谁是谁、东西在哪里、此前发生过什么,以及下一刻有哪些状态要保持连续。

如何解决这一问题,行业正在出现不同的技术路线。

一种典型思路是 3D / Spatial 路线:在视频之外显式保存空间结构、物体状态和历史记忆。世界的结构由一套结构化状态负责维护,而视频模型更像一个翻译器,负责把它渲染成画面。对于游戏、仿真等要求精确空间关系的场景,这是一条非常自然的技术路线。

但形界押注的是另一种选择:让视频模型自己学习和维护世界状态。

它希望人物身份、空间关系和历史变化直接沉淀在模型学习到的视频表征中,而不是随着世界越来越复杂,在模型之外同步增加一套越来越庞大的状态系统。

这背后是一种更彻底的 Scaling 假设:如果世界的结构、状态和变化规律本身可以被视频模型学习,那么随着模型规模、数据规模和训练规模增加,模型能够在同一种表征中不断吸收更复杂的世界知识。相比之下,一旦把大量状态显式放在模型之外,世界复杂度上升时,外部结构化表示也需要同步变得更加复杂。

换句话说,形界希望把“记住世界”也逐渐变成模型能力本身,而不是长期依靠模型之外的一套工程系统兜底。

这当然还不是一场已经有定论的路线之争。显式 3D 状态在许多场景中有不可替代的确定性优势,而一次 24 小时实验也不足以证明视频表征能够解决所有长期记忆问题。

但 Genesis-1.0 至少把这个原本偏研究的问题向前推进了一步:互动视频开始从“不断生成下一段内容”,走向“持续维护一个正在运行的状态”。更值得注意的是它的迭代速度:从今年 7 月 Genesis 在 WAIC 首次公开亮相,到 Genesis-1.0 把连续生成推到 7x24 小时,中间只隔了两个月。


告别“套皮数字人”,端到端行为推理创造真正的“类人感”

不过,对于 Genesis-1.0 来说,长时稳定只是一层地基。如果一个角色能够在屏幕里稳定存在 24 小时,却对屏幕外用户的举动毫无察觉,它仍然只是一张无限延长的动态壁纸。

过去几年,数字人在“长得像人”这件事上经历了飞速的技术迭代。脸、口型、声音乃至微表情越来越逼真,但真正交流几十秒之后,另一种“不像人”的割裂感往往很快出现:它不知道你还没说完,不知道什么时候应该看着你,更不知道你一个没有说出口的动作究竟意味着什么。

因为真正的人际交流从来不限于单纯的语言。

人在对话中会不断观察对方的状态,再决定自己应该倾听、等待、回应还是主动表达;自己的行为又会成为对方下一轮判断的输入。社交本身就是一个持续运行的反馈回路。

这也是 Genesis-1.0 想强调的“类人交互”体验。

视频来源:Frame-X

这些动作本身并不难生成,真正困难的是:用户并没有先告诉模型“接下来请挥手”——行为是由交互本身触发的。

一个更纯粹的测试场景:用户把手放到摄像头前做出数字手势,然后问角色“这个加起来等于多少”。

视频来源:Frame-X

这时候,问题已经不再是简单的动作跟随:模型不仅需要准确感知摄像头里发生了什么,还要结合交互历史,把视觉和语言信息联系起来,再决定下一刻应该给出什么反馈。

形界把这种能力称为“端到端行为推理”。这里的“推理”不必简单等同于大语言模型内部的思维链。更值得关注的是它对应的产品能力:实时视频模型开始从“被动按照指令生成动作”,走向“根据当前场景主动选择行为”。

这和今年 GPT-Live 给语音交互带来的体验颠覆非常相似。

GPT-Live 的自然感并不只来自声音本身,更来自一些行为细节:用户插话时,它能停下来;合适的时候会用很短的回应告诉用户“我还在听”。正是这些看似细小的行为反馈,决定了一段交流是不是像真正的人类对话。

视频模态则把这种要求进一步放大了。

一个真实的人不仅会通过声音表现“我在听”,还会用视线、表情、身体姿态和动作来表达自己的状态。也因此,视频双工面对的并不是一个简单的“语音助手加数字人外壳”问题,而要考虑如何把整套非语言互动也交给模型处理。

8 月,形界与中国科学技术大学等机构联合提出 SemComp-Bench。和传统视频 benchmark 关注画质、运动质量不同,它专门评价模型有没有真正完成用户要求的语义任务,并提出 Outcome Achievement 和 Generation Reliability 两类指标。

当视频只是一种内容时,最重要的问题是“生成得好不好看”;但当视频变成实时互动方式以后,评价标准会多出更关键的一层:它有没有理解你,以及它有没有做出正确的行为。

所以 Genesis-1.0 想建立的“类人感”,不只是一个看起来更逼真的 Avatar,更是一个能够完成倾听、思考、反馈、表达完整交互反应闭环的智能体。


1.5 秒背后,AI 的“反应”和“思考”开始被拆开

类人感还有一个很现实的前提:速度。

你向一个人挥手,对方 4 秒以后才慢慢挥回来,动作即使完全正确,交流仍然会显得怪异。真实社交里的自然感很大程度上来自 timing——什么时候回应,什么时候等待,什么时候保持一个倾听中的表情。

形界此前发布沉浸式视频模型 Rise 时,公开展示过最低 500 毫秒级的端到端交互延迟。其背后的技术主张,是把视频输入、行为理解和画面生成拉进同一个连续时序中,尽量减少独立理解模型与生成模型之间的串行传递。

Genesis-1.0 延续了这条思路。但进入社交场景以后,它还需要处理另一个矛盾:有些反馈必须立刻发生,有些任务却需要更长的计算时间。Genesis-1.0 此次给出的画面行为平均响应时间是 1.5 秒。模型本身会持续感知用户输入,并即时生成角色的动作、表情和画面,维持低延迟感知和生成的闭环;Genesis-1.0-Brain 则负责问答内容、语言风格、MCP 工具调用等更高层的异步规划。


图片来源:Frame-X

这里的核心并不是简单把所有任务都压缩到 1.5 秒以内,而是让“反应”和“思考”运行在两个不同的时间尺度上。当用户抬手打招呼时,角色不应该等一个复杂的大模型完成数秒推理以后才做出动作;但当用户要求它回答复杂问题、调用工具或者完成某项任务时,系统又必须允许更深的推理发生。

如果所有能力被串在一条链路里,任务越复杂,模型越聪明,交互就可能越慢。更合理的方式,是让即时感知和行为生成保持高速运转,同时把需要更多计算时间的智能任务放到另一层异步完成。

有意思的是,GPT-Live 在系统设计上采用了类似的分层思路。OpenAI 的全双工语音模型负责维持实时交流,需要复杂推理或工具使用时,再异步委托后台模型处理,而当前语音流不必因此中断。

但“视频版 GPT-Live”这个说法并不是说 Genesis 与 GPT-Live 使用了相同的技术架构,而是两者都在处理实时 AI 的共同矛盾点:人要求即时反馈,但智能本身需要时间。实时交互时代的产品需要一种新的能力——即使 AI 还在“想”,它也不能在关系层面消失。

视频来源:Frame-X

对于声音,这意味着倾听、停顿和简短回应;对于视频,则意味着眼神、表情、身体动作,以及始终保持“在场”的状态。

这可能比单纯把延迟从 2 秒压到 1 秒更重要。


从文件到软件,视频会成为下一代人与 AI 的交互界面

传统视频模型的交付物通常是一段内容。生成结束,模型的工作也就结束了。但一个社交角色、陪伴对象或者互动世界不止于此。它必须长期存在,持续接受另一个人的输入,并在每一次新的交互之后动态更新自己的状态。

这也是 Genesis-1.0 更大的产品野心。过去,构建一个长期在线的虚拟角色,开发者需要分别处理角色资产、剧情逻辑和各种事件反馈。内容制作和交互逻辑是两个高度依赖人工的割裂系统。生成式 AI 首先改变了前者。形界接下来想做的,是让模型继续吞掉后者。

他们并不只想把一个 AI 角色直接交到用户手里,而是希望把“持续在场、敏锐感知和即时回应”这些能力进一步沉淀为一种可被不同互动产品复用的底层基础设施。社交陪伴是目前最直接的落点,但这套能力同样可以延伸到直播、游戏 NPC、互动娱乐以及其他今天尚未成熟的产品形态中。

当一个模型能够理解用户、持续维持人物和环境状态,并根据交互直接决定下一刻发生什么,开发者得到的就不只是“生成一段视频的 API”,而开始接近一套新的互动内容生产方式——没有冗余系统,“模型即产品”。

但对商业落地而言,这件事最终要落到非常现实的问题上:一个角色能在线多久?用户一个动作以后要等多久?互动能否超越一张会说话的脸?以及当几千、几万名用户每天持续使用时,这套体验在经济上能不能成立?只有这些指标同时过线,实时视频才可能从模型 Demo 变成社交、陪伴、直播和互动娱乐真正可调用的一层基础设施。

形界特别看重社交场景,也正是因为它对这套技术提出的要求最完整。直播允许内容仍然以“主播”为中心,游戏可以预先规定大量交互规则,而社交需要模型真正围绕另一个人不断调整自己的行为——它既考验内容生成,也考验感知、理解和即时反馈。

对于一家刚成立数月的公司,形界没有选择先用很长时间去讲一个宏大的世界模型故事,再慢慢等待技术成熟,而是几乎每一个阶段都拿出能够被实际感知到的成果。Genesis-1.0 就是在这条务实路径上一次明确向产品层的收束:同时解决时长、行为、响应和成本这四个指标。

但技术走到这里以后,问题已经开始不同。

过去,用户打开一个 AI 产品,通常是为了得到一段内容或者一个答案:人输入需求,机器返回结果,交互是离散的。这种受限的信息带宽无法支撑起更加复杂的应用。而社交和陪伴需求是另一种深度关系——一个对象长期存在,精准感知用户现在的状态,并根据双方共同经历的历史持续互动。

文字很难承载这种关系,语音把它向前推了一步,而视频提供了更高的信息带宽。所以 Genesis-1.0 真正押注的,并不只是 AI 视频的下一次升级。它押注的是一种新的交互范式:让视频从 AI 生成的一次性结果,变成人和 AI 之间持续发生的交互本身。

过去的视频模型,往往以“生成完成”为终点。如果这条路线成立,那么下一代互动模型真正重要的竞争力,可能恰恰是:它不再轻易结束。

“无论你什么时候来,她都在。”点击链接进入 Genesis-1.0 直播间,和她打个招呼吧~

https://www.frame-x.ai/models/genesis





特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
现场观众乱喊!郑钦文0-2,20连胜被终结,中国队晋级四强有变数

现场观众乱喊!郑钦文0-2,20连胜被终结,中国队晋级四强有变数

侃球熊弟
2026-09-24 22:16:12
跌光1400亿,“女王”亏麻了

跌光1400亿,“女王”亏麻了

投资家
2026-09-24 21:22:56
北理工美女副教授,被扒了

北理工美女副教授,被扒了

大张的自留地
2026-09-24 15:19:48
张本智和赛后发声:3比0战胜王楚钦是“没想到”的,赛前并不清楚中国队会派出何种阵容

张本智和赛后发声:3比0战胜王楚钦是“没想到”的,赛前并不清楚中国队会派出何种阵容

澎湃新闻
2026-09-24 21:54:04
一夜之间,朝鲜运动员突然面临危机,最坏的结果是在日本“扎根”

一夜之间,朝鲜运动员突然面临危机,最坏的结果是在日本“扎根”

史智文道
2026-09-24 12:08:32
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
彻底怒了!韩国体协会长柳承敏:日本亚运会是我见过办赛水平最差的大赛

彻底怒了!韩国体协会长柳承敏:日本亚运会是我见过办赛水平最差的大赛

新杀猪的秀才
2026-09-24 15:27:42
中东国家已然看清:采购再多的中国先进武器,也难以换来长久安全

中东国家已然看清:采购再多的中国先进武器,也难以换来长久安全

兵卒史
2026-09-24 20:27:00
凌晨大逆转,股市直线暴拉!霍尔木兹海峡,利好来了

凌晨大逆转,股市直线暴拉!霍尔木兹海峡,利好来了

中国基金报
2026-09-25 06:18:36
网友质问樊振东为何未参加亚运会!乒协根本就没想招他 王皓回应

网友质问樊振东为何未参加亚运会!乒协根本就没想招他 王皓回应

念洲
2026-09-25 08:42:58
本周五中秋节,别再说“中秋快乐”了,送你30句高级祝福语,好听不俗套

本周五中秋节,别再说“中秋快乐”了,送你30句高级祝福语,好听不俗套

小谈食刻美食
2026-09-22 17:56:46
国足3球大胜!7战马尔代夫全胜,王子铭戴帽,连刷6大纪录

国足3球大胜!7战马尔代夫全胜,王子铭戴帽,连刷6大纪录

奥拜尔
2026-09-24 21:32:25
3-1,世界第60胜世界第22,53岁卡纳瓦罗率队掀翻伊朗,终结5连败

3-1,世界第60胜世界第22,53岁卡纳瓦罗率队掀翻伊朗,终结5连败

侧身凌空斩
2026-09-24 23:56:01
不回国了?名古屋亚运会出现荒唐的一幕,两名朝鲜成员不愿回家了

不回国了?名古屋亚运会出现荒唐的一幕,两名朝鲜成员不愿回家了

青青衫书生
2026-09-24 12:37:07
任正非回忆:本来以100亿美金卖掉华为,都准备好了,美方企业不买了!估计10年后会山头拼刺刀,那时就开始做备胎计划!网友:天意难违

任正非回忆:本来以100亿美金卖掉华为,都准备好了,美方企业不买了!估计10年后会山头拼刺刀,那时就开始做备胎计划!网友:天意难违

大白聊IT
2026-09-25 01:45:41
亚运会9连冠梦碎!可怕的不是国乒2-3输日本,而是仅靠王楚钦不够

亚运会9连冠梦碎!可怕的不是国乒2-3输日本,而是仅靠王楚钦不够

侃球熊弟
2026-09-24 18:07:12
华人女子入住国外高档酒店 睡到半夜遭黑人强脱衣服; 3女遭多人性侵

华人女子入住国外高档酒店 睡到半夜遭黑人强脱衣服; 3女遭多人性侵

北国向锡安
2026-09-24 10:53:57
王楚钦为何0-3完败,刘国正点评一针见血,网友:单打必须复仇

王楚钦为何0-3完败,刘国正点评一针见血,网友:单打必须复仇

南海浪花
2026-09-24 22:16:11
不靠EUV光刻机也能硬刚苹果!华为麒麟9050 Pro多核反超A17 Pro:差距缩至3年

不靠EUV光刻机也能硬刚苹果!华为麒麟9050 Pro多核反超A17 Pro:差距缩至3年

快科技
2026-09-24 18:56:08
演员赵露思成都甜品店试营业,1份凉面48元,营业仅40分钟后,第一批商品基本售完,有消费者为了吃上一口,排队长达90分钟

演员赵露思成都甜品店试营业,1份凉面48元,营业仅40分钟后,第一批商品基本售完,有消费者为了吃上一口,排队长达90分钟

大风新闻
2026-09-24 17:05:10
2026-09-25 10:07:00
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

男子开车门盗窃未果往油箱倒水被拘 车主获8000元赔偿

头条要闻

男子开车门盗窃未果往油箱倒水被拘 车主获8000元赔偿

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

许嵩宣布与冯禧结婚仅2天,不对劲的一幕出现了

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

游戏
家居
时尚
亲子
旅游

GTA6收藏版400美元贵在哪?一副眼镜就值2200元

家居要闻

2026建博会(广州) 公装联探展交流活动

秋冬最舒适的“豹款”,这样穿才好看!

亲子要闻

大力金刚模玩分享第1033期-吴医生电影版转轮

旅游要闻

53天每周都有活动!世纪公园金秋游园季启幕,秋景也上新了

无障碍浏览 进入关怀版