首页 > 资讯 > 后端开发 > Python >python pdfplumber库批量提取pdf表格数据转换为excel

599

分享到

python pdfplumber库批量提取pdf表格数据转换为excel

2024-04-02 19:04:59 599人浏览独家记忆

Python 官方文档：入门教程 => 点击学习

摘要

目录需求一、实现效果图二、pdfplumber 库三、代码实现1、导入相关包2、读取 pdf , 并获取 pdf 的页数3、提取单个 pdf 文件，保存成 excel4、提取文件夹下

需求

想要提取 pdf 的数据，保存到 excel 中。虽然是可以直接利用 WPS 将 pdf 文件输出成 excel，但这个功能是收费的，而且如果将大量pdf转excel的时候，手动去输出是非常耗时的。我们可以利用 python 的三方工具库 pdfplumber 快速完成这个功能。

一、实现效果图

二、pdfplumber 库

pdfplumber 是一个开源 Python 工具库-，可以方便地获取 pdf 的各种信息，包括文本、表格、图表、尺寸等。完成我们本文的需求，主要使用 pdfplumber 提取 pdf 表格数据。

安装命令

pip install pdfplumber

三、代码实现

1、导入相关包

import pdfplumber
import pandas as pd

2、读取 pdf , 并获取 pdf 的页数

pdf = pdfplumber.open("/Users/wangwangyuqing/Desktop/1.pdf")
pages = pdf.pages

3、提取单个 pdf 文件，保存成 excel

if len(pages) &gt; 1:
    tables = []
    for each in pages:
        table = each.extract_table()
        tables.extend(table)
else:
    tables = each.extract_table()
data = pd.DataFrame(tables[1:], columns=tables[0])
data
data.to_excel("/Users/wangwangyuqing/Desktop/1.xlsx", index=False)

4、提取文件夹下多个 pdf 文件，保存成 excel

import os
import glob
path = r'/Users/wangwangyuqing/Desktop/pdf文件'
for f in glob.glob(os.path.join(path, "*.pdf")):
    res = save_pdf_to_excel(f)
    print(res)
def save_pdf_to_excel(path):
    #     print('文件名为：',path.split('/')[-1].split('.')[0] + '.xlsx')
    pdf = pdfplumber.open(path)
    pages = pdf.pages
    if len(pages) &gt; 1:
        tables = []
        for each in pages:
            table = each.extract_table()
            tables.extend(table)
    else:
        tables = each.extract_table()
    data = pd.DataFrame(tables[1:], columns=tables[0])
    file_name = path.split('/')[-1].split('.')[0] + '.xlsx'
    data.to_excel("/Users/wangwangyuqing/Desktop/data/{}".fORMat(file_name), index=False)
    return '保存成功！'

小结

python 中还有很多库可以处理 pdf，比如 PyPDF2、pdfminer 等，本文选择pdfplumber 的原因在于能轻松访问有关 PDF 的所有详细信息，包括作者、来源、日期等，并且用于提取文本和表格的方法灵活可定制。大家可以根据手头数据需求，再去解锁 pdfplumber 的更多用法。

以上就是python pdfplumber库批量提取pdf表格数据转换为excel的详细内容，更多关于python pdfplumber库pdf转换excel的资料请关注编程网其它相关文章！

您可能感兴趣的文档:

--结束END--

本文标题: python pdfplumber库批量提取pdf表格数据转换为excel

本文链接: https://lsjlt.com/news/118909.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

python pdfplumber库批量提取pdf表格数据转换为excel

目录

需求

一、实现效果图

二、pdfplumber 库

三、代码实现

1、导入相关包

2、读取 pdf , 并获取 pdf 的页数

3、提取单个 pdf 文件，保存成 excel

4、提取文件夹下多个 pdf 文件，保存成 excel

小结

python pdfplumber库批量提取pdf表格数据转换为excel

通过Python的pdfplumber库提取pdf中表格数据

python用pdfplumber提取pdf表格数据并保存到excel文件中

python读取json数据还原表格批量转换成html

python-将excel表格中的数据转化为json数据格式

phpcsv怎么将数据源文件转换为excel表格

用Matlab将ORL人脸数据库的pgm格式批量转换为jpg格式

Python从一个Excel表格提取数据填到另一个表格

php怎么导出数据库的数据并转为excel表格

php如何导出数据库的数据并转为excel表格

利用Java怎么将excel表格批量导入到数据库

如何利用Python提取pdf中的表格数据(附实战案例)

用Python进行栅格数据的分区统计和批量提取

Python实现将数据库一键导出为Excel表格的实例

利用MySQL原数据信息批量转换指定库数据表生成Hive建表语句

怎么用Python进行栅格数据的分区统计和批量提取

python分析数据的方法是什么

如何使用Python实现抽奖小程序

python copy函数的作用是什么

python ffmpeg模块怎么安装和使用

python进程池创建队列的方法是什么

python无法运行文件的原因有哪些

python can't open file报错怎么解决

python keyerror错误怎么解决

python字符串处理与应用的方法有哪些

python全局变量如何定义