Python利用pdfplumber庫提取pdf中表格數據
一、pdfplumber庫是什么?
pdfplumber是一個用于從PDF文檔中提取文本和表格數據的Python庫。它可以幫助用戶輕松地從PDF文件中提取有用的信息,例如表格、文本、元數據等。pdfplumber庫的特點包括:簡單易用、速度快、支持多種PDF文件格式、支持從多個頁面中提取數據等。pdfplumber庫還提供了一些方便的方法來處理提取的數據,例如排序、過濾和格式化等。它是一個非常有用的工具,特別是在需要從大量PDF文件中提取數據時。
二、安裝pdfplumber庫
pip install pdfplumber
三、查看pdfplumber庫版本
pip show pdfplumber
Name: pdfplumber
Version: 0.9.0
Summary: Plumb a PDF for detailed information about each char, rectangle, and line.
Home-page: https://github.com/jsvine/pdfplumber
Author: Jeremy Singer-Vine
Author-email: jsvine@gmail.com
License:
Requires: pdfminer.six, Pillow, Wand
Required-by:
四、提取pdf中表格數據
1.引入庫
import pdfplumber
2.定義pdf文件路徑
local = '/Users/kkstar/Downloads/'
3.打開pdf文件
with pdfplumber.open(local+"demo_table.pdf") as pdf:

4.獲取pdf文件中的頁數
num_pages = len(pdf.pages)
5.遍歷每一頁
for page_num in range(num_pages):
6.獲取當前頁內容
page = pdf.pages[page_num]
7.提取表格數據
table = page.extract_table(table_settings={
"vertical_strategy": "lines",
"horizontal_strategy": "lines",
"intersection_x_tolerance": 15,
"intersection_y_tolerance": 15
})8.輸出表格數據
for row in table:
print(row)9.效果
['username', 'nickname', 'article']
['weixin_38093452', '空空 star', '130889268']
['weixin_38093452', '空空 star', '130852811']
['weixin_38093452', '空空 star', '130815851']
Process finished with exit code 0
到此這篇關于Python利用pdfplumber庫提取pdf中表格數據的文章就介紹到這了,更多相關Python提取pdf表格數據內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!
相關文章
使用Python開發(fā)個京東上搶口罩的小實例(僅作技術研究學習使用)
這篇文章主要介紹了使用Python開發(fā)個京東上搶口罩的小實例(僅作技術研究學習使用),需要的朋友可以參考下2020-03-03
python makedirs() 遞歸創(chuàng)建目錄
os.makedirs()函數用于在Python中遞歸地創(chuàng)建目錄,支持設置權限和處理目錄已存在的情況,下面就來具體介紹一下,感興趣的可以了解一下2024-12-12
Python 中 and, or, &, |, ^ 
這篇文章主要介紹了Python 中 and, or, &, |, ^ 的使用小結,本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友參考下吧2024-01-01
基于SQLAlchemy實現操作MySQL并執(zhí)行原生sql語句
這篇文章主要介紹了基于SQLAlchemy實現操作MySQL并執(zhí)行原生sql語句,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下2020-06-06

