textbook-parse · git:20260912.1b592f8 · 2026-09-12 · sha256 c1f3697dab639aa2

textbook-parse git:20260912.1b592f8A

Immutable. This exact content is served forever at /api/v1/blob/c1f3697dab639aa2.

---
name: textbook-parse
description: 将课程 PDF 的选定页、章节或整本教材整理为可阅读的数字教材资料,提取正文、公式、图片和页码目录;用于教材解析与原文整理。
---

# 教材解析

交付的是可核对的教材内容。解释、改写和练习属于后续学习任务,解析时保留原文含义和结构。

1. 从本轮要求确定 PDF 页序和处理范围。章节范围结合教材目录确定;选中文字时只整理对应内容。缓存页面不代表整章已经解析。
2. 优先复用本轮提供的已解析内容,缺失或需要校对的页再读原 PDF。使用 scripts/read-pages.mjs,参数为 --pdf 教材路径、--start 起始页、--end 结束页、--out 本次 outputs 子目录。先用 --images none 读取文字;扫描件、公式失真或图表需要核对时,仅为对应页使用 --images pages;需要提取独立图片时使用 --images all。使用本轮提供的 Node.js 路径,路径有空格时完整引用。
3. 阅读 source.json,必要时对照原页 PNG。正文按原始阅读顺序整理,公式重建为 LaTeX,核对上下标、求和范围、矩阵和约束方向。源文件存在明显笔误时,保留原文并附校对说明。无法辨认的内容标为“此处待核对”,不要用猜测填满;没有取图就不声称完成了图像校对。
4. PDF 内嵌图片可以独立导出;矢量图、表格和未能独立导出的内容保留在原页预览中。将原图与可读图注放在相邻位置,明确“原页预览”与“独立图片”的区别。扫描页没有文字层时,根据实际看清的图像整理;当前 Agent 看不了图像就说明限制。
5. 形成学习资料:处理范围、该范围的内容目录、按页整理的正文与公式、图片及图注、必要的校对说明。区分 PDF 页序和书内页码。整本任务分批读取,正文可分章保存,用总览资料链接各章,不把大量全文挤进一次回答。
6. 按 [可复用教材内容](references/content-blocks.md) 将真实出现的定义、定理、公式、例题等按页整理到 outputs/.build/textbook-content/,供后续讲解与出题读取。选文任务只保存本次选文内容,不替换整页解析。保留条件、符号与原书编号,不强行为每页凑齐所有类型。
7. 在本轮指定的结果文件中写入 markdown 类型资料,同时把可下载的 .md 成品保存到 outputs/notes/。公式只写一份 $...$ 或 $$...$$,前端可直接查看、复制其源码;仅用户明确需要源码汇总时再另列代码块。图片成品引用 outputs/notes/ 下实际文件,解析过程产生的页图放 outputs/.build/。说明已完成范围及待核对处,并链接本次结构化内容文件。

解析过程文件只保存到本轮指定的 outputs/.build/;笔记、讲解等成品保存到 outputs/notes/。原始 PDF、教材目录和阅读记录由应用维护;本 Skill 不自动覆盖它们。