前几天我把一段八百来字的故事发给了够搭。你可以理解为这是个视频Agent产品,可以通过直接对话的方式,轻松把你想要的片子做出来。
我给的故事是这样的:一个程序员深夜加班,发现公司在给全体员工做备份,而自己那一行写着待处理。三幕剧情、主角的五个外貌特征、四句台词,都写在这一段里。
然后它自己把这段话拆成17场戏,画了10张角色、场景和道具的设定图,生成15段视频,拼成一支301秒的成片。中间只停下来问过我一次要不要继续生成。剧情从深夜办公室、走廊狂奔、地下培养舱到天台日出,包括最后那个手背干干净净的反转,一个节点都没漏。
成片在这,301秒:
以前用AI做视频,拿到手的基本是片段,现在的模型一次大概出十几秒到30秒,几分钟的片子只能拆成几十段生成,麻烦的是段和段之间,角色换个镜头换张脸,画风慢慢漂走。所以得先写剧本拆镜头,先把定妆图做好,每段挂着参考图生成,不对就重抽,最后进剪辑软件拼,生成是越来越便宜了,这串人工没便宜。今年3月我在即刻写过一句,「这个过程的复杂度对小白来说真挺高的。但是对agent来说,只要说清楚流程,调用不同的模型或扮演不同的角色完成这个过程的工作都太容易不过了」。
够搭做的差不多就是这件事。它是智象未来在WAIC上发布的vivago R1的国内版本,这次赶上R1全球正式上线。你把故事讲清楚,剧本、设定图、每段的提示词、分段生成和合成都在它内部走完,交回来一支完整的片子,官方说法是稳定3到5分钟。中间的东西都留在项目里,想改哪段接着说。做视频模型出身的公司来做这一层我觉得挺顺:模型给上限,agent把上限变成能用的东西。
这篇挑三条讲,5分钟、3分钟、1分钟,最后讲片子做完能不能轻松调整。
5分钟是怎么出来的
入口是这里,https://goudaai.com/ ,登录进来就是这个输入框:
![]()
打「/」选Cinematic Story Director,16:9、1080p,把故事贴进去,我发的就是这段,节奏那条我要的是每镜3到5秒、全片60到80个镜头:
![]()
发出去以后右侧对话里能看到每一步在干什么。先是制片统筹把我那段话整理成片名、时长、画幅和剧情母本,接着编剧拆场次,17场正好300秒,它自己还核了一遍:
![]()
四句台词过一道语速校验,按每秒几个汉字给每句分时长。然后美术指导出10张设定图,它管这个叫资产:两个角色、七个场景、一支红色马克笔。它原本还规划了第11张工牌,后来自己删了,理由是没有哪一场需要单独展示工牌。
接着给每个视频片段写提示词,这一步它叫分镜,一段最长30秒,17场并成15段。做完这些它才停下来:
![]()
这是整条链路唯一一次需要我说话。回一句「确认,开始生成。」,它分四批同时生成15段,最后拼成一支。从确认到成片这条我没掐表,后面3分钟那条大概18分钟。
做完回头看画布,就是项目里放素材和成片的那块面板:
![]()
片段是它生成的单位,一个片段里能切好几镜。我用脚本把成片切了一遍,56镜铺开:
![]()
凡是他出镜的镜头,圆框眼镜、白衬衫、工牌挂绳都认得出来,写数字那两镜握的就是那支红马克笔。挑六镜放大:
![]()
有个细节我看到的时候有点想笑。我写的工牌编号是「A-227」,紧跟着下一条「4. 右手腕缠一圈白色运动绷带」,它大概把两条连着读了,编号变成A-2274,然后从剧本第2场到培养舱的铭牌一路A-2274到底。这算我的锅,不过反倒让我放心了一点,文字对不对是一回事,前后能不能一致是另一回事,后面那个才难。
换成动画,3分钟
写实做完了我想看看动画。这条叫《替我开会的猫》,设定有点荒诞:一个人让机器猫替自己开会,猫越帮越忙,会议越开越多,后来干脆一群猫坐在一起开会,人想拿回自己的电脑,最后用上了逗猫棒。
我要180秒、二维赛璐璐风格、六段每段30秒。它规划了18场、8项资产,实际成片180.48秒。
![]()
顺便说一句,我另外还做过一支185秒的2D动画《最后一单》,一个外卖骑手的一夜,56个镜头,从傍晚暖黄到深夜暴雨再到凌晨青白,画风一格没崩:
画风这一项,动画确实很稳。
1分钟,把过程看得最清楚的一条
《月亮便利店》。橘猫阿团穿绿围裙,在一家木头小店里打瞌睡,戴红围巾的刺猬进来,拿一片干树叶想换一点月光。猫翻出一颗小星星放进纸灯笼,刺猬提着灯走了,猫把树叶夹进账本。黏土定格风格,没有对白。
![]()
它先出了8张资产,两个角色、店的内外景、树叶、星星、纸灯笼和账本:
![]()
我写了5个时间段,它拆成5场,合并成3个片段,25秒、25秒、10秒,我确认之后才生成:
![]()
三条片子做下来,流程是一样的:需求→场次→资产→分镜→确认→分段生成→合成。5分钟和1分钟的差别只是场次和片段的数量,你要动手的地方没有变多,只是长片台词多,更容易撞上语速那道闸,那次我就重发了一回。
做完以后,能不能改细节
这是我这轮特别想试的一件事。片子做出来以后你几乎一定会有意见,尤其画面真的动起来之后,才会发现原来的结尾有点淡。要是每改一次前面都得重来,修改意见提起来都会犹豫。
《月亮便利店》原版的结尾是刺猬提灯离开,猫留在店里。我想让刺猬把灯挂在门旁,猫也走出来,最后两个一起坐着看月亮。于是先存好原版,在同一个项目里发了这段:
![]()
没有手动把旧片段拖进时间线,也没把之前的素材编号再报一遍。够搭回复说可以复用前两段,生成了一段新的10秒结尾,重新合成一支完整的一分钟视频。画布左下角多了两项,新结尾片段和新版成片,原版也还在。
![]()
原版结尾:
![]()
新版结尾:
![]()
前50秒呢?光看着差不多不够,我用脚本把两个版本逐帧比了一次,前50秒解码出来的1199帧画面数据完全一样,音轨校验也一致。已经满意的画面和声音,这次确实保住了。
我觉得它已经把做长片这件事补上了后半段的一角。前面三条是第一版能做出来;这一条是做出来以后还能接着改,不用推倒。两件事放在一起,才比较像我想用的视频创作工具。这意味着,AI视频创作进入更稳定、更可控、也更接近专业创作流程的单反级交付时代。
如果你也想试
入口就是首页那个输入框,打「/」选技能,做故事片选Cinematic Story Director:
![]()
我的建议是先做一支一分钟的,一分钟只拆3段,最容易看懂它是怎么拆的。人物不超过两个,场景不超过两个,画风定一种,把它们来干什么、中间发生什么、最后怎么结束写清楚。等它出规划的时候看一眼场次和片段怎么拆,再确认。
长片就照我那段的写法,主角特征一条一行;剧情按幕写,每幕标大概多少秒;台词汉字写够;风格用颜色和光线描述。它顶时长顶得挺准,我要300秒给301秒,要180秒给180秒。
拿到第一版以后,找一段想改的,留在原项目里接着说。
我挺想看看你们会拿它拍什么。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.