textbook-parse · git:20260909.b4923cb · 2026-09-09 · sha256 39764ad4c2a4b2b8

textbook-parse git:20260909.b4923cbA

Immutable. This exact content is served forever at /api/v1/blob/39764ad4c2a4b2b8.

---
name: textbook-parse
description: 将课程 PDF 的选定页、章节或整本教材整理为可阅读的数字教材资料,提取正文、公式、图片和页码目录;用于教材解析与原文整理。
---

# 教材解析

交付的是可核对的教材内容。解释、改写和练习属于后续学习任务,解析时保留原文含义和结构。

1. 从本轮要求确定 PDF 页序和处理范围。章节范围结合教材目录确定;选中文字时只整理对应内容。缓存页面不代表整章已经解析。
2. 使用随本 Skill 提供的 scripts/read-pages.mjs 读取原 PDF。通过本轮提供的 Node.js 程序执行,参数为 --pdf 原始教材路径、--start 起始页、--end 结束页、--out 当前课程 outputs 下的本次解析子目录。路径有空格时完整引用。依赖随项目 npm install 安装,不依赖个人 Python 环境。
3. 阅读生成的 source.json 和原页 PNG。正文按原始阅读顺序整理,公式参照原页重建为 LaTeX,核对上下标、求和范围、矩阵和约束方向。源文件存在明显笔误时,保留原文并附校对说明。无法辨认的内容标为“此处待核对”,不要用猜测填满。
4. PDF 内嵌图片可以独立导出;矢量图、表格和未能独立导出的内容保留在原页预览中。将原图与可读图注放在相邻位置,明确“原页预览”与“独立图片”的区别。扫描页没有文字层时,根据实际看清的图像整理;当前 Agent 看不了图像就说明限制。
5. 形成学习资料:处理范围、该范围的内容目录、按页整理的正文与公式、图片及图注、必要的校对说明。区分 PDF 页序和书内页码。整本任务分批读取,正文可分章保存,用总览资料链接各章,不把大量全文挤进一次回答。
6. 在本轮指定的结果文件中写入 markdown 类型资料,正文使用 $...$ 和 $$...$$ 渲染公式,并在相邻的 latex 代码块或文末“公式源码”中提供相同的 LaTeX 代码,保留换行,不把源码变成图片;较多公式按页或编号对应。图片引用课程 outputs 下的实际相对路径,同时保留一份可下载的 .md 正文。简要告诉用户完成了哪些页、哪些部分仍待核对。

解析文件只保存到本轮指定的 outputs。原始 PDF、教材目录和阅读记录由应用维护;本 Skill 不自动覆盖它们。