这个七月我在纽约。有天下午在中央公园的长椅上歇脚,一只松鼠蹦上来,扒着我的星巴克冰咖啡,嘴都快够到吸管了。我拍下了这张照片。
![]()
这家伙也太像皮克斯电影里的角色了。搁以前,这个念头发个朋友圈就结束了。这次我把照片丢给一个Agent,就是那种你说目标、它自己拆任务自己干活的AI,附了一句话:帮我把松鼠偷抢我饮料喝的场景做成30秒的皮克斯动画。
21分钟后,我拿到了成片。
干活的是LibTV Agent。LibTV本身老读者不陌生,哩布哩布家的专业视频创作平台,3月上线第一天涌进来10万创作者,5月我写过它的团队版。这两个月它一直在憋一个大的:把画布上那套专业创作能力,整个交给一个能对话的Agent。而且这个Agent的能力说实话给了我一些预期之外的惊喜(甚至内容剪辑和加字幕都能动动嘴完成)。
今天,LibTV Agent正式上线,官网:https://www.liblib.tv/
一只松鼠的21分钟
我在Skill商店选了「皮克斯动画广告」。Skill可以理解成一份写给AI的工作说明书,一位导演拍这类片子的步骤和讲究都写在里面。选Skill、传照片、一句话,需求就发出去了。
![]()
Agent认出了松鼠、绿吸管冰饮料、米白托特包,只问我一个问题:横屏还是竖屏。然后给出四个角色方案,我选了戴迷你墨镜的纽约街头松鼠。
![]()
我得说,这个松鼠形象姿态还真挺符合我对街头遇见的纽约人的刻板印象的...而且,似乎也和《疯狂动物城》里的动物形象的品质感很接近。
![]()
真正让我坐直了看的是它的工作方式。饮料、托特包、长椅,每样东西先单独生成一张「资产定妆照」,叫锚点,生成后停下来等我检查,满意才往下走。场景因此变得可控:后面18个镜头里每个元素长什么样,都在这一步定死,而且每一步都有我的判断在里面。
![]()
然后是故事大纲和分镜草图:一格一格的铅笔线稿,每格标着运镜,第一镜是「极端大特写,荷兰角15度倾斜」,把画面故意斜着放、看着莫名紧张的那种拍法。
![]()
这个画面我眼熟。上个月我在LA的奥斯卡电影博物馆,隔着玻璃拍过《杀人回忆》的一整面分镜手稿墙,一格铅笔小画配一行运镜标注,希区柯克那代导演甚至认为分镜画完电影就已经拍完了。没想到一个月后,同一种文档出现在我的画布上,这次是AI画给我的。做的时候可以不看,事后翻出来读,等于上了一堂导演课。
![]()
![]()
两段视频并行生成,配爵士BGM合成。原图里的绿吸管、托特包、连长椅上的金属铭牌都在,星巴克logo在道具定妆照里还原到能直接进广告,参考图的保真度不含糊。合成还有个内置时间线剪辑器,双轨道、字幕、转场都在里面,剪辑不用出平台。
![]()
它在卖什么
先说清这是个什么Agent。过去一年做视频Agent的产品不少,共同的毛病是:生成15秒的漂亮画面很轻松,但一支片子从来不是生成一次就结束的,故事要变成剧本,镜头要编排,角色不能变脸,画面要能返工。大部分Agent做完第一步就把烂摊子还给你,LibTV的做法是把这些活全接下来,一路干到成片交付,专业流程一步没省,只是不再需要你亲手执行。
它分三层:底下是几十个图像视频音频模型,中间是画布,每个镜头都是能单独重跑的节点,最上面是Skill商店,也就是那句主张:Pick a LibTV Skill,选一个Skill,等于请一位专业的AI导演。
商店里每个Skill都有创作者署名和使用人数,我截稿时韦斯安德森电影美学119人在用,古典武侠、女频短剧、拉片复刻都有人上架。广告导演和短剧团队把验证过的工作方法写成文件挂在架上,你调用,他们建自己的AI Studio。 官方还给Skill创作者准备了1000万激励金:一条通过验收的成片Skill按评级给500到2000块,后面还有按真实使用量的长期分成。
![]()
这事我熟。今年四月我开源了女娲.skill(GitHub 26k star),把任何人的思维方式蒸馏成一份SKILL.md文件让AI调用。我一直相信方法论可以写成文件,文件可以被AI执行。 LibTV把同样的逻辑搬到了视频领域,那我最该干的事,就是用它给女娲拍一支宣传片。
给女娲拍片:这次我自带剧本
设定我想了很久:一家「女娲人物蒸馏馆」,大师们被蒸馏成发光胶囊,收藏在前台身后的编号墙里;顾客取号借走一位,拧开胶囊,薄荷绿的学者鬼魂升起来,盘腿悬浮在头顶给你指点。这个设定只有一个Skill配得上:韦斯安德森电影美学。
我把女娲的介绍和四幕剧本粘进对话框,然后看着它变成一个剧组。它按剧本给5个角色各设计了多套造型让我挑,确认后再补成正/侧/背的白底三视图,连半透明的鬼魂都有自己的定妆照;4个场景各出4张候选让我选。
![]()
![]()
13镜分镜表出来我笑了:每个段落交界处它都自动排了「急摇转场」,韦斯安德森的签名动作,我一个字没提。
落版字卡那一镜,它标注「后期叠加,不烧进生成画面」。它知道视频模型渲染文字不可靠。这种细节,像是真在片场干过活的人才会顺手写下的。
中途我说想加少量英文台词,它给6个镜头各补了一句。前台服务员那句是"Capsule No. 7,431. Distillation complete.",编号精确到个位,冷面得很韦斯。
![]()
有个镜头我不满意:门面大全景太静。我点开这个5秒镜头的节点重写提示词,让两位门童镜像走位开门,重生成只花135积分,另外12个镜头一根毛没动。这类产品真正值钱的地方之一,就是返工的颗粒度。
![]()
这套操作靠的是画布的两种视图:故事板视图像资产陈列室,锚点、文档、视频分栏摆开,适合验收;工作流视图是全片几十个节点的连线图,改哪个镜头就点开哪个节点。
![]()
![]()
收尾最有全能管家感:我说「帮我叠加落版字卡和字幕」,它两步走,先ASR自动识别6句台词烧成字幕,再生成腮红粉字卡背景让我四选一合进片尾。合成界面本身也带基础剪辑,裁剪、字幕、转场都能手动微调。
![]()
![]()
最终交付70秒,BGM复古管弦。从一段文字介绍到一支韦斯安德森风格的宣传片,一个晚上,它会出现在女娲仓库的README里。
把我这趟纽约做成Skill
最后验证生态的另一半:普通人能不能把自己的方法上架。
我传了7张实拍照片:渡轮上的自由女神、halal餐车前的背影、剧院区霓虹、楼宇峡谷的粉紫晚霞。告诉它我住在时代广场附近,天天泡在最吵的地方,有天专门坐渡轮出去看自由女神。要一支40秒的影像诗,心情是「这个城市很吵,但从渡轮上回头看它的时候很安静」,旁白要伍迪艾伦的味道。
它写的旁白里有一句「风很大,帽子快飞走了」,是它从我那张渡轮上按住帽子的照片里自己读出来的。
![]()
成片41秒。中途我补了个要求,所有画面统一成16:9横屏,它认出有四个分镜是竖屏照片生成的,只重做这四个,横屏的两个和旁白BGM原样沿用,重新合成。
![]()
最后他给我交付了下面这个影片
然后我说了句「帮我把以上对话总结成skill」。它把这一晚的方法提炼成一个叫「城市影像诗-照片转短片」的个人Skill:简介、使用场景、输出内容自动填好,正文里写了情绪叙事轴、三维素材解构、旁白五段式,第一句居然是理论——「影像诗的核心不是记录事件,而是传递情绪体验」。
![]()
![]()
这个Skill现在躺在我的账户里,可以反复调用。像我这样长期旅居的人,往后每天丢几张照片进去,就能收一支能直接发社交平台的vlog短片。 写了一年多SKILL.md的人看到这一幕是有点感慨的:方法论文件正在变成跨平台的通用资产。
顺带一提,LibTV还有官方CLI,一行指令就能让它进入你的Agent工作流。想试的话,把这句话发给你自己的coding agent就行:
请帮我安装 LibTV CLI Skill:https://liblibai-web-static.liblib.cloud/cli/1.1.1/libtv-cli-skill.zip
![]()
有一件事它替不了你:创意。松鼠那条成立,是因为真有一只松鼠抢过我的咖啡。Skill给你的是执行创意的完整工艺,创意还是你的事。 反过来说,有想法没手艺这个借口,往后不太好使了。
最后
2025年初我在即刻上纠结过要不要坚持做视频,写过一句:「难道视频剪辑对我而言是件很痛苦的事吗?那我不妨想想怎么把这件事变成一个有趣的可以乐在其中的事。」
一年半过去,我没变成剪辑高手,也不需要了。导演们把手艺写成Skill,我挑一个,把故事讲给它听。这个七月我刚好在这件事的两边都站过:女娲那边我是写方法论文件的人,到了LibTV我反过来变成调用别人方法论的了。写方法的人有署名、有使用人数,用方法的人省下学习成本,供需两头都通了。
谢谢你看到这里,不过比起看文章,我觉得你去给自己做个有趣的动画,给自己的产品制作个商业级的宣传片,你会更能感受到现在专业级的AI视频Agent产品到底已经达到什么地步了。
传送门https://www.liblib.tv/
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.