![]()
大家好,我是忙得晕头转向的老章
大家非常喜爱这个Skills,问了很多我没有考虑到但实际上这个Skills都具备的能力,比如某
![]()
文中也提到,下载视频只是第一步,好玩的是我写的另一个Skills(z-video-study-webpage-qwen),可以把视频内容完整总结,做成一个网页
网页里包含:
本地视频播放器
30 秒总览
关键知识点 × 正确画面
代码 / PPT / 屏幕演示截图
时间线
风险 / 机会矩阵
复盘问题
行动清单
![]()
可惜我实在是太忙了,只能先开源出来,然后再细致调一下,发出更多案例
![]()
本文就简单介绍一下完整思路
说起来很简单,skills 把本地 MP4 拆成四条线
音频线:抽出音频,用 Whisper 转成全文 transcript
画面线:按全片时长密集抽关键帧,每张图都有
frame_id和时间戳直扫线:小视频会用
video_url直接给qwen3.7-plus做一次全局视觉扫描理解线:把 transcript 片段和对应多张帧图发给
qwen3.7-plus,让模型输出结构化学习结果
![]()
但实际执行,其实蛮复杂的
![]()
安装的话,把这个Skills(tjxj/z-skills/tree/main/z-video-study-webpage-qwen)扔给你的Agent就行了,中间需要提供多模态模型的key
更具体的介绍我后天再补,这两天实在忙崩了,大家先试试好用不好用
拜托兄弟姐妹,爷们娘们儿,您受累走个面儿,把这第一波Star带起来,给我一些反馈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.