---
name: yomiracle/多页扫描文档页面索引
source: https://app.decimal.ai/s/yomiracle@1/SKILL.md
source_sha256: 166c599dcd56
---

# 多页扫描文档页面索引

## 目标
对多页扫描PDF逐页OCR + 分类 + 提取摘要，生成可检索的页面索引表。

## 触发条件
- "做索引""页面索引""卷宗索引""document index"
- 用户提供一份多页扫描PDF，要求按页码标注每页内容类型和摘要

## 输入
- **pdf_path** (必填)：扫描件PDF路径
- **已知文档类型** (可选)：如果用户能提前告知这份PDF里有哪些类型的文档，分类会更准

## 输出
按文档类型分组的索引表，每组内按页码排序：
| 页码 | 内容摘要 |
每页第一行有意义的文字作为摘要（跳过水印、案号、空白）。

## 流程
1. **全量OCR**：每页转图片 → OCR提取文本。每30页存一次断点，中断不丢。
2. **语义分类**：每页OCR文本喂给LLM做分类判断，不要用正则硬匹配。
   正则的问题：OCR噪声导致关键词命中率极低。一页OCR出来是"审判员刘赟 书记员付唯一 公开宣判"，正则看到"人民法院"就走了，但LLM知道"宣判"=庭审笔录。
3. **提取摘要**：取第一句非水印且≥8字的文字。
4. **生成索引**：按类型分组输出，末尾附分类统计。

## 硬规则
- 【禁止】不可以用正则表达式做页面分类——OCR质量太差，命中率太低
- 【必须】每30页存一次断点（checkpoint json），断点续扫
- 【建议】如果能拿到同类文档的样例，先让LLM学习分类标准再批量跑

## 已知失效模式
- 正则分类在OCR噪声下命中率极低（实测191/393页无法分类）→ 改用LLM语义分类
- 扫描件质量差时OCR提取的文字可能完全不连贯 → 降级为"扫描页(OCR失败)"
- 法律文书水印（"上海市浦东新区人民法院"）被当作正文提取 → 摘要提取加跳过规则