Loading skill
Install any skill in seconds. Free to start, no credit card required.
Get Started Free →对多页扫描PDF逐页OCR + 分类 + 提取摘要,生成可检索的页面索引表。
| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-01 | ✗→✓ | ▲ Improved | 48% | 0% |
| case-02 | ✗→✓ | ▲ Improved | 35% | 0% |
| case-03 | ✗→✓ | ▲ Improved | 23% | 0% |
| case-07 | ✗→✓ | ▲ Improved | -9% | 0% |
| case-10 | ✗→✓ | ▲ Improved | -38% | 0% |
对多页扫描PDF逐页OCR + 分类 + 提取摘要,生成可检索的页面索引表。
按文档类型分组的索引表,每组内按页码排序: | 页码 | 内容摘要 | 每页第一行有意义的文字作为摘要(跳过水印、案号、空白)。
正则的问题:OCR噪声导致关键词命中率极低。一页OCR出来是"审判员刘赟 书记员付唯一 公开宣判",正则看到"人民法院"就走了,但LLM知道"宣判"=庭审笔录。
Other measured skills in the registry, with their headline benchmark lift.