yueying · git:20260909.2935c66 · 2026-09-09 · sha256 35a93ff2ab5e4931
yueying git:20260909.2935c66A
Immutable. This exact content is served forever at /api/v1/blob/35a93ff2ab5e4931.
--- name: yueying description: 让 AI 看视频。用户给出本地视频文件路径或视频链接(B站、YouTube、抖音、小红书等),想要总结、提取信息、答疑、照着教程操作、整理笔记时使用。先用 yueying 命令把视频转成文字稿和关键帧,再读结果完成用户的需求。 --- # 阅影 · 让 AI 看视频 Claude 读不了视频文件,但能读文字和图片。`yueying` 命令把视频拆成:带时间戳的文字稿(平台字幕优先,没有就本地语音识别,支持中英日韩法德俄等多语言)+ 关键帧图片(场景切换处抽帧,左下角烧了编号和时间)+ 九宫格总览图 + 一份 report.md 索引。 ## 步骤 1. 运行(第一次跑语音识别会下载模型,可能要几分钟;长视频识别需要一些时间,耐心等): ``` yueying "<视频路径或链接>" --out "<输出目录>" ``` - 输出目录建议放在当前项目下,如 `./yueying_out/<视频名>`;不传 `--out` 也会用这个默认值。 - 视频里没人说话、只想看画面:加 `--no-asr`。只要文字不要画面:加 `--no-frames`。 - 已知语言可加 `--lang zh` / `--lang en` 等,识别更稳。 - 画面细节多(代码、PPT、操作演示)想看得更密:加 `--interval 2`(每 2 秒抽一帧);默认按时长自动,1 分钟内每 2 秒、10 分钟内每 6 秒、更长每 12 到 20 秒。 - B站 高清或会员视频需要登录:加 `--cookies-from-browser chrome`(或 edge)。 - 机器慢或没显卡:加 `--model small` 换小模型。 2. 用 Read 读输出目录里的 `report.md`。里面有简介、章节、画面总览图清单、关键帧清单、按段落带时间戳的文字稿。 3. 用 Read 看 `grid_01.jpg` 等总览图,快速了解画面走向。需要看清某一刻的细节(代码、PPT、界面操作),再打开 `frames/` 下对应的单帧大图。文字稿和画面靠时间戳对照。 4. 按用户的需求提纯:总结、列步骤、抄代码、回答问题、写笔记。引用视频内容时带上时间点,如「(03:15)」,方便用户回看。 ## 注意 - 语音识别可能把专有名词、代码听错,画面上出现的文字以画面为准。 - 文字稿很长时不必全读,先看章节和画面总览,再按需读对应时间段。 - 如果命令不存在:`pip install yueying` 然后 `yueying --install-skill`;有 NVIDIA 显卡再加 `pip install yueying[cuda]`。