# PDF 文字与表格定位提取

用 pdfplumber 按页提取 PDF 的文字、表格与元数据，把页码和源文件关联到输出数据。

用途：AI 技能

分类：文档与办公

许可：MIT

原版名称：pdf-extraction

来源：https://github.com/claude-office-skills/skills

公开页面：https://xwtx.zbidea.cn/discover/skills/AS-016

继续使用：https://xwtx.zbidea.cn#/skills/AS-016

## 准备资料
- 有文本层的PDF
- 页码范围与表格识别需求

## 目标输出
- 带页码的文本或Markdown
- 提取表格CSV/JSON
- 异常页清单

## 运行条件与边界
- 本地 AI 可执行Python
- pdfplumber
- 扫描件OCR需另备OCR工具
- 上游是代码示例工作流，无独立脚本
- 扫描PDF不因文字提取流程自动成为可OCR资料

