AI 技能 / AS-016
PDF 文字与表格定位提取
用 pdfplumber 按页提取 PDF 的文字、表格与元数据,把页码和源文件关联到输出数据。
查看技能与中文使用包浏览同类资源准备什么
- 有文本层的PDF
- 页码范围与表格识别需求
可以得到什么
- 带页码的文本或Markdown
- 提取表格CSV/JSON
- 异常页清单
运行条件与使用边界
- 本地 AI 可执行Python
- pdfplumber
- 扫描件OCR需另备OCR工具
- 上游是代码示例工作流,无独立脚本
- 扫描PDF不因文字提取流程自动成为可OCR资料
来源与许可
- 用途分类
- 文档与办公
- 开源项目
- pdf-extraction
- 许可
- MIT
- 固定提交
- 9c4c7d5cd2813a8936bf2c9fdb174ea883b85a11
选择资源后,按交付详情下载文件和说明,交给支持所需能力的 AI 继续修改。素材使用、第三方依赖与项目托管分别按对应说明办理。