yueying · diff

git:20260908.37378a3 to git:20260909.2935c66

1 added, 0 removed. Audit A to A.

---
name: yueying
description: 让 AI 看视频。用户给出本地视频文件路径或视频链接(B站、YouTube、抖音、小红书等),想要总结、提取信息、答疑、照着教程操作、整理笔记时使用。先用 yueying 命令把视频转成文字稿和关键帧,再读结果完成用户的需求。
---
# 阅影 · 让 AI 看视频
Claude 读不了视频文件,但能读文字和图片。`yueying` 命令把视频拆成:带时间戳的文字稿(平台字幕优先,没有就本地语音识别,支持中英日韩法德俄等多语言)+ 关键帧图片(场景切换处抽帧,左下角烧了编号和时间)+ 九宫格总览图 + 一份 report.md 索引。
## 步骤
1. 运行(第一次跑语音识别会下载模型,可能要几分钟;长视频识别需要一些时间,耐心等):
```
yueying "<视频路径或链接>" --out "<输出目录>"
```
- 输出目录建议放在当前项目下,如 `./yueying_out/<视频名>`;不传 `--out` 也会用这个默认值。
- 视频里没人说话、只想看画面:加 `--no-asr`。只要文字不要画面:加 `--no-frames`。
- 已知语言可加 `--lang zh` / `--lang en` 等,识别更稳。
+ - 画面细节多(代码、PPT、操作演示)想看得更密:加 `--interval 2`(每 2 秒抽一帧);默认按时长自动,1 分钟内每 2 秒、10 分钟内每 6 秒、更长每 12 到 20 秒。
- B站 高清或会员视频需要登录:加 `--cookies-from-browser chrome`(或 edge)。
- 机器慢或没显卡:加 `--model small` 换小模型。
2. 用 Read 读输出目录里的 `report.md`。里面有简介、章节、画面总览图清单、关键帧清单、按段落带时间戳的文字稿。
3. 用 Read 看 `grid_01.jpg` 等总览图,快速了解画面走向。需要看清某一刻的细节(代码、PPT、界面操作),再打开 `frames/` 下对应的单帧大图。文字稿和画面靠时间戳对照。
4. 按用户的需求提纯:总结、列步骤、抄代码、回答问题、写笔记。引用视频内容时带上时间点,如「(03:15)」,方便用户回看。
## 注意
- 语音识别可能把专有名词、代码听错,画面上出现的文字以画面为准。
- 文字稿很长时不必全读,先看章节和画面总览,再按需读对应时间段。
- 如果命令不存在:`pip install yueying` 然后 `yueying --install-skill`;有 NVIDIA 显卡再加 `pip install yueying[cuda]`。