---
name: yueying
description: 让 AI 看视频。用户给出本地视频文件路径或视频链接（B站、YouTube、抖音、小红书等），想要总结、提取信息、答疑、照着教程操作、整理笔记时使用。先用 yueying 命令把视频转成文字稿和关键帧，再读结果完成用户的需求。
---

# 阅影 · 让 AI 看视频

Claude 读不了视频文件，但能读文字和图片。`yueying` 命令把视频拆成：带时间戳的文字稿（平台字幕优先，没有就本地语音识别，支持中英日韩法德俄等多语言）+ 关键帧图片（场景切换处抽帧，左下角烧了编号和时间）+ 九宫格总览图 + 一份 report.md 索引。

## 步骤

1. 运行（第一次跑语音识别会下载模型，可能要几分钟；长视频识别需要一些时间，耐心等）：

   ```
   yueying "<视频路径或链接>" --out "<输出目录>"
   ```

   - 输出目录建议放在当前项目下，如 `./yueying_out/<视频名>`；不传 `--out` 也会用这个默认值。
   - 视频里没人说话、只想看画面：加 `--no-asr`。只要文字不要画面：加 `--no-frames`。
   - 已知语言可加 `--lang zh` / `--lang en` 等，识别更稳。
   - B站 高清或会员视频需要登录：加 `--cookies-from-browser chrome`（或 edge）。
   - 机器慢或没显卡：加 `--model small` 换小模型。

2. 用 Read 读输出目录里的 `report.md`。里面有简介、章节、画面总览图清单、关键帧清单、按段落带时间戳的文字稿。

3. 用 Read 看 `grid_01.jpg` 等总览图，快速了解画面走向。需要看清某一刻的细节（代码、PPT、界面操作），再打开 `frames/` 下对应的单帧大图。文字稿和画面靠时间戳对照。

4. 按用户的需求提纯：总结、列步骤、抄代码、回答问题、写笔记。引用视频内容时带上时间点，如「（03:15）」，方便用户回看。

## 注意

- 语音识别可能把专有名词、代码听错，画面上出现的文字以画面为准。
- 文字稿很长时不必全读，先看章节和画面总览，再按需读对应时间段。
- 如果命令不存在：`pip install yueying` 然后 `yueying --install-skill`；有 NVIDIA 显卡再加 `pip install yueying[cuda]`。
