Python利用pdfplumber實(shí)現(xiàn)讀取PDF寫入Excel
一、Python操作PDF 13大庫(kù)對(duì)比
PDF(Portable Document Format)是一種便攜文檔格式,便于跨操作系統(tǒng)傳播文檔。PDF文檔遵循標(biāo)準(zhǔn)格式,因此存在很多可以操作PDF文檔的工具,Python自然也不例外。
Python操作PDF模塊對(duì)比圖如下:

本文主要介紹pdfplumber專注PDF內(nèi)容提取,例如文本(位置、字體及顏色等)和形狀(矩形、直線、曲線),還有解析表格的功能。
二、pdfplumber模塊
其他幾個(gè) Python 庫(kù)幫助用戶從 PDF 中提取信息。作為一個(gè)廣泛的概述,pdfplumber它通過(guò)結(jié)合以下功能將自己與其他 PDF 處理庫(kù)區(qū)分開來(lái):
- 輕松訪問(wèn)有關(guān)每個(gè) PDF 對(duì)象的詳細(xì)信息
- 用于提取文本和表格的更高級(jí)別、可自定義的方法
- 緊密集成的可視化調(diào)試
- 其他有用的實(shí)用功能,例如通過(guò)裁剪框過(guò)濾對(duì)象 1.
1.安裝
cmd控制臺(tái)輸入:
pip install pdfplumber
導(dǎo)包:
import pdfplumber
案例PDF截圖(兩頁(yè)未截全):

2. 加載PDF
讀取PDF代碼:pdfplumber.open("路徑/文件名.pdf", password = "test", laparams = { "line_overlap": 0.7 })
參數(shù)解讀:
password:要加載受密碼保護(hù)的 PDF,請(qǐng)傳遞password關(guān)鍵字參數(shù)laparams:要將布局分析參數(shù)設(shè)置為pdfminer.six的布局引擎,請(qǐng)傳遞laparams關(guān)鍵字參數(shù)
案例代碼:
import pdfplumber
with pdfplumber.open("./1.pdf") as pdf:
print(pdf)
print(type(pdf))
輸出結(jié)果:
<pdfplumber.pdf.PDF object at 0x000001A56C323DC0>
<class 'pdfplumber.pdf.PDF'>
3. pdfplumber.PDF類
pdfplumber.PDF類表示單個(gè) PDF,并具有兩個(gè)主要屬性:
| 屬性 | 說(shuō)明 |
|---|---|
| .metadata | 從PDF的Info中獲取元數(shù)據(jù)鍵 /值對(duì)字典。 通常包括“ CreationDate”,“ ModDate”,“ Producer”等 |
| .pages | 返回一個(gè)包含pdfplumber.Page實(shí)例的列表,每一個(gè)實(shí)例代表PDF每一頁(yè)的信息 |
1. 讀取PDF文檔信息(.metadata):
import pdfplumber
with pdfplumber.open("./1.pdf") as pdf:
print(pdf.metadata)
運(yùn)行結(jié)果:
{'Author': 'wangwangyuqing', 'Comments': '', 'Company': '', 'CreationDate': "D:20220330113508+03'35'", 'Creator': 'WPS 文字', 'Keywords': '', 'ModDate': "D:20220330113508+03'35'", 'Producer': '', 'SourceModified': "D:20220330113508+03'35'", 'Subject': '', 'Title': '', 'Trapped': 'False'}
2. 輸出總頁(yè)數(shù)
import pdfplumber
with pdfplumber.open("./1.pdf") as pdf:
print(len(pdf.pages))
運(yùn)行結(jié)果:
2
4. pdfplumber.Page類
pdfplumber.Page類是pdfplumber整個(gè)的核心,大多數(shù)操作都圍繞這個(gè)類進(jìn)行操作,它具有以下幾個(gè)屬性:
| 屬性 | 說(shuō)明 |
|---|---|
| .page_number | 順序頁(yè)碼,從1第一頁(yè)開始,從第二頁(yè)開始2,依此類推 |
| .width | 頁(yè)面的寬度 |
| .height | 頁(yè)面的高度 |
| .objects/.chars/.lines/.rects/.curves/.figures/.images | 這些屬性中的每一個(gè)都是一個(gè)列表,每個(gè)列表包含一個(gè)字典,用于嵌入頁(yè)面上的每個(gè)此類對(duì)象。有關(guān)詳細(xì)信息,請(qǐng)參閱下面的“對(duì)象” |
常用方法如下:
| 方法名 | 說(shuō)明 |
|---|---|
| .extract_text() | 用來(lái)提頁(yè)面中的文本,將頁(yè)面的所有字符對(duì)象整理為的那個(gè)字符串 |
| .extract_words() | 返回的是所有的單詞及其相關(guān)信息 |
| .extract_tables() | 提取頁(yè)面的表格 |
| .to_image() | 用于可視化調(diào)試時(shí),返回PageImage類的一個(gè)實(shí)例 |
| .close() | 默認(rèn)情況下,Page對(duì)象緩存其布局和對(duì)象信息,以避免重新處理它。但是,在解析大型 PDF 時(shí),這些緩存的屬性可能需要大量?jī)?nèi)存。您可以使用此方法刷新緩存并釋放內(nèi)存 |
方法名說(shuō)明.extract_text()用來(lái)提頁(yè)面中的文本,將頁(yè)面的所有字符對(duì)象整理為的那個(gè)字符串.extract_words()返回的是所有的單詞及其相關(guān)信息.extract_tables()提取頁(yè)面的表格.to_image() 用于可視化調(diào)試時(shí),返回PageImage類的一個(gè)實(shí)例.close()默認(rèn)情況下,Page對(duì)象緩存其布局和對(duì)象信息,以避免重新處理它。但是,在解析大型 PDF 時(shí),這些緩存的屬性可能需要大量?jī)?nèi)存。您可以使用此方法刷新緩存并釋放內(nèi)存。
1. 讀取第一頁(yè)寬度、高度等信息
import pdfplumber
with pdfplumber.open("./1.pdf") as pdf:
first_page = pdf.pages[0] # pdfplumber.Page對(duì)象的第一頁(yè)
# 查看頁(yè)碼
print('頁(yè)碼:', first_page.page_number)
# 查看頁(yè)寬
print('頁(yè)寬:', first_page.width)
# 查看頁(yè)高
print('頁(yè)高:', first_page.height)
運(yùn)行結(jié)果:
頁(yè)碼: 1
頁(yè)寬: 595.3
頁(yè)高: 841.9
2. 讀取文本第一頁(yè)
import pdfplumber
with pdfplumber.open("./1.pdf") as pdf:
first_page = pdf.pages[0] # pdfplumber.Page對(duì)象的第一頁(yè)
text = first_page.extract_text()
print(text)
運(yùn)行結(jié)果:
店鋪名 價(jià)格 銷量 地址
小罐茶旗艦店 449 474 安徽
零趣食品旗艦店 6.9 60000 福建
天貓超市 1304 3961 上海
天貓超市 139 25000 上海
天貓超市 930 692 上海
天貓超市 980 495 上海
天貓超市 139 100000 上海
三只松鼠旗艦店 288 25000 安徽
紅小廚旗艦店 698 1767 北京
三只松鼠旗艦店 690 15000 安徽
一統(tǒng)領(lǐng)鮮旗艦店 1098 1580 上海
新大猩食品專營(yíng)
9.8 7000 湖南
.......
艦店
蟹納旗艦店 498 1905 上海
三只松鼠堅(jiān)果at茶 188 35000 安徽
嘉禹滬曉旗艦店 598 1517 上海
3. 讀取表格第一頁(yè)
import pdfplumber
import xlwt
with pdfplumber.open("1.pdf") as pdf:
page_one = pdf.pages[0] # PDF第一頁(yè)
table_1 = page_one.extract_table() # 讀取表格數(shù)據(jù)
# 1. 創(chuàng)建Excel表對(duì)象
workbook = xlwt.Workbook(encoding='utf8')
# 2. 新建sheet表
worksheet = workbook.add_sheet('Sheet1')
# 3. 自定義列名
col1 = table_1[0]
# print(col1)# ['店鋪名', '價(jià)格', '銷量', '地址']
# 4. 將列屬性元組col寫進(jìn)sheet表單中第一行
for i in range(0, len(col1)):
worksheet.write(0, i, col1[i])
# 5. 將數(shù)據(jù)寫進(jìn)sheet表單中
for i in range(0, len(table_1[1:])):
data = table_1[1:][i]
for j in range(0, len(col1)):
worksheet.write(i + 1, j, data[j])
# 6. 保存文件分兩種格式
workbook.save('test.xls')
運(yùn)行結(jié)果:

三、實(shí)戰(zhàn)操作
1. 提取單個(gè)PDF全部頁(yè)數(shù)
測(cè)試代碼:
import pdfplumber
import xlwt
with pdfplumber.open("1.pdf") as pdf:
# 1. 把所有頁(yè)的數(shù)據(jù)存在一個(gè)臨時(shí)列表中
item = []
for page in pdf.pages:
text = page.extract_table()
for i in text:
item.append(i)
# 2. 創(chuàng)建Excel表對(duì)象
workbook = xlwt.Workbook(encoding='utf8')
# 3. 新建sheet表
worksheet = workbook.add_sheet('Sheet1')
# 4. 自定義列名
col1 = item[0]
# print(col1)# ['店鋪名', '價(jià)格', '銷量', '地址']
# 5. 將列屬性元組col寫進(jìn)sheet表單中第一行
for i in range(0, len(col1)):
worksheet.write(0, i, col1[i])
# 6. 將數(shù)據(jù)寫進(jìn)sheet表單中
for i in range(0, len(item[1:])):
data = item[1:][i]
for j in range(0, len(col1)):
worksheet.write(i + 1, j, data[j])
# 7. 保存文件分兩種格式
workbook.save('test.xls')
運(yùn)行結(jié)果(上面得沒(méi)截全):

2. 批量提取多個(gè)PDF文件

測(cè)試代碼:
import pdfplumber
import xlwt
import os
# 一、獲取文件下所有pdf文件路徑
file_dir = r'E:\Python學(xué)習(xí)\pdf文件'
file_list = []
for files in os.walk(file_dir):
# print(files)
# ('E:\\Python學(xué)習(xí)\\pdf文件', [],
# ['1.pdf', '1的副本.pdf', '1的副本10.pdf', '1的副本11.pdf', '1的副本2.pdf', '1的副本3.pdf', '1的副本4.pdf', '1的副本5.pdf', '1的副本6.pdf',
# '1的副本7.pdf', '1的副本8.pdf', '1的副本9.pdf'])
for file in files[2]:
# 以. 進(jìn)行分割如果后綴為PDF或pdf就拼接地址存入file_list
if file.split(".")[1] == 'pdf' or file.split(".")[1] == 'PDF':
file_list.append(file_dir + '\\' + file)
# 二、存入Excel
# 1. 把所有PDF文件的所有頁(yè)的數(shù)據(jù)存在一個(gè)臨時(shí)列表中
item = []
for file_path in file_list:
with pdfplumber.open(file_path) as pdf:
for page in pdf.pages:
text = page.extract_table()
for i in text:
item.append(i)
# 2. 創(chuàng)建Excel表對(duì)象
workbook = xlwt.Workbook(encoding='utf8')
# 3. 新建sheet表
worksheet = workbook.add_sheet('Sheet1')
# 4. 自定義列名
col1 = item[0]
# print(col1)# ['店鋪名', '價(jià)格', '銷量', '地址']
# 5. 將列屬性元組col寫進(jìn)sheet表單中第一行
for i in range(0, len(col1)):
worksheet.write(0, i, col1[i])
# 6. 將數(shù)據(jù)寫進(jìn)sheet表單中
for i in range(0, len(item[1:])):
data = item[1:][i]
for j in range(0, len(col1)):
worksheet.write(i + 1, j, data[j])
# 7. 保存文件分兩種格式
workbook.save('test.xls')
運(yùn)行結(jié)果(12個(gè)文件,一個(gè)文件50行總共600行):

以上就是Python利用pdfplumber實(shí)現(xiàn)讀取PDF寫入Excel的詳細(xì)內(nèi)容,更多關(guān)于Python pdfplumber讀取PDF寫入Excel的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!
- Python使用PyPDF2庫(kù)實(shí)現(xiàn)向PDF文件中插入內(nèi)容
- Python利用PyPDF2庫(kù)實(shí)現(xiàn)輕松提取PDF文本
- Python使用PyPDF2?Pillow庫(kù)來(lái)將PDF文件轉(zhuǎn)圖片
- PyPDF2讀取PDF文件內(nèi)容保存到本地TXT實(shí)例
- 解決pyPdf和pyPdf2在合并pdf時(shí)出現(xiàn)異常的問(wèn)題
- Python實(shí)現(xiàn)PyPDF2處理PDF文件的方法示例
- Python中使用pypdf2合并、分割、加密pdf文件的代碼詳解
- Python使用pdfplumber庫(kù)高效解析PDF文件
- Python利用pdfplumber庫(kù)提取pdf中表格數(shù)據(jù)
- python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中
- python使用PyPDF2 和 pdfplumber操作PDF文件
相關(guān)文章
詳解解Django 多對(duì)多表關(guān)系的三種創(chuàng)建方式
本文主要介紹了詳解解Django 多對(duì)多表關(guān)系的三種創(chuàng)建方式,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2021-08-08
關(guān)于Python網(wǎng)絡(luò)爬蟲requests庫(kù)的介紹
這篇文章主要介紹了關(guān)于Python網(wǎng)絡(luò)爬蟲requests庫(kù),而很多時(shí)候這些數(shù)據(jù)存儲(chǔ)在網(wǎng)頁(yè)中,手動(dòng)下載需要花費(fèi)的時(shí)間太長(zhǎng),這時(shí)候我們就需要網(wǎng)絡(luò)爬蟲幫助我們自動(dòng)爬取這些數(shù)據(jù),需要的朋友可以參考下2023-04-04
Python基于stuck實(shí)現(xiàn)scoket文件傳輸
這篇文章主要介紹了Python基于stuck實(shí)現(xiàn)scoket文件傳輸,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-04-04
pandas DataFrame索引行列的實(shí)現(xiàn)
這篇文章主要介紹了pandas DataFrame索引行列的實(shí)現(xiàn),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2019-06-06
使用Python自動(dòng)化Microsoft Excel和Word的操作方法
這篇文章主要介紹了使用Python自動(dòng)化Microsoft Excel和Word,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2021-04-04
淺析關(guān)于Keras的安裝(pycharm)和初步理解
Keras 是一個(gè)用 Python 編寫的高級(jí)神經(jīng)網(wǎng)絡(luò) API,它能夠以 TensorFlow, CNTK, 或者 Theano 作為后端運(yùn)行。這篇文章給大家介紹Keras的安裝(pycharm)和初步理解,感興趣的朋友一起看看吧2020-10-10
基于python編寫監(jiān)控系統(tǒng)各項(xiàng)資源的腳本
這篇文章主要為大家詳細(xì)介紹了如何編寫一個(gè)python腳本,實(shí)現(xiàn)監(jiān)控網(wǎng)絡(luò)的流量、CPU使用率、內(nèi)存使用率和磁盤使用情況,感興趣的小伙伴可以了解下2023-11-11
Python數(shù)據(jù)庫(kù)的連接實(shí)現(xiàn)方法與注意事項(xiàng)
這篇文章主要介紹了Python數(shù)據(jù)庫(kù)的連接實(shí)現(xiàn)方法與注意事項(xiàng),需要的朋友可以參考下2016-02-02

