最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

 更新時(shí)間:2022年07月22日 15:58:03   作者:一位代碼  
在實(shí)際研究中我們經(jīng)常需要獲取大量數(shù)據(jù),而這些數(shù)據(jù)很大一部分以pdf表格的形式呈現(xiàn),如公司年報(bào)、發(fā)行上市公告等,下面這篇文章主要給大家介紹了關(guān)于利用python提取pdf表格數(shù)據(jù)并保存到excel文件中的相關(guān)資料,需要的朋友可以參考下

pdfplumber操作pdf文件

python開源庫pdfplumber,可以較為方便地獲取pdf的各種信息,包含pdf的基本信息(作者、創(chuàng)建時(shí)間、修改時(shí)間…)及表格、文本、圖片等信息,基本可以滿足較為簡單的格式轉(zhuǎn)換功能。

一、pdfplumber安裝及導(dǎo)入

跟其他包一樣,支持使用pip安裝,安裝命令:

pip install pdfplumber

安裝成功后,可直接用import導(dǎo)入,導(dǎo)入命令:

import pdfplumber

二、pdfplumber基礎(chǔ)使用

1、基礎(chǔ)知識(shí)

(1)pdfplumber有2個(gè)基礎(chǔ)類

PDF和Page,PDF用來處理整個(gè)文檔,Page用來處理整個(gè)頁面。

用法簡介
pdfplumber.PDF.metadata,獲取pdf基礎(chǔ)信息,返回字典格式,包含作者、創(chuàng)建時(shí)間等。 .pages,返回pdfplumber.Page實(shí)例的列表,每一個(gè)實(shí)例包含pdf每一頁的信息
pdfplumber.Pagepdfplumber核心功能,對(duì)PDF的大部分操作都是基于這個(gè)類,包括提取文本、表格等

(2)pdfplumber讀取pdf文件方式

pdfplumber.open(‘文件路徑’),返回pdfplumber.PDF類的實(shí)例。

如果pdf有密碼,加入password參數(shù):

pdfplumber.open(‘文件路徑’,password=‘密碼’)

2、獲取pdf基礎(chǔ)信息

讀取pdf文件,并輸出pdf文件的基礎(chǔ)信息

import pdfplumber
# 打開pdf文件,有密碼加入password參數(shù)
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata  # pdf的基礎(chǔ)信息
page_con = len(pdf_info.pages)  # 獲取pdf的總頁數(shù)
print('pdf文件的基礎(chǔ)信息:\n', meta_data)
print('pdf共%s頁' % page_con)

3、pdfplumber提取表格數(shù)據(jù)

提取表格數(shù)據(jù)主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。

用以下pdf文檔,作為演示文檔。

(1)extract_tables()方法

輸出文檔所有表格,返回一個(gè)嵌套列表,其結(jié)構(gòu)層次為table-row-cell。如:

#extract_tables()用法
with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件
    page_one = pdf_info.pages[0]  # 選擇第一頁
    page_one_table =page_one.extract_tables()  # 獲取pdf文檔第一頁的所有表格數(shù)據(jù)
    for row in page_one_table:
       print('第一頁的表格數(shù)據(jù):', row)


(2)、extact_table()方法

不會(huì)返回文檔的所有表格,僅返回行數(shù)最多的表格數(shù)據(jù),如存在多個(gè)行數(shù)相等的表格,則默認(rèn)輸出頂部表格數(shù)據(jù)。返回的數(shù)據(jù)結(jié)構(gòu)層次為row-cell,表格的每一行都為一個(gè)單獨(dú)的列表,列表中的元素即為原表格的各個(gè)單元格的數(shù)據(jù)。如:

# extract_table()用法
with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件
    page_one = pdf_info.pages[0]  # 選擇第一頁
    page_one_table = page_one.extract_table()
    for row in page_one_table:
        print(row)

三、提取pdf表格數(shù)據(jù)并保存到excel中

完整版,提取pdf表格數(shù)據(jù)并保存到excel中

import pdfplumber
from openpyxl import Workbook

class PDF(object):
    def __init__(self, file_path):
        self.pdf_path = file_path
        # 讀取pdf文件
        try:
            self.pdf_info = pdfplumber.open(self.pdf_path)
            print('讀取文件完成!')
        except Exception as e:
            print('讀取文件失?。?, e)

    # 打印pdf的基本信息、返回字典,作者、創(chuàng)建時(shí)間、修改時(shí)間/總頁數(shù)
    def get_pdf(self):
        pdf_info = self.pdf_info.metadata
        pdf_page = len(self.pdf_info.pages)
        print('pdf共%s頁' % pdf_page)
        print("pdf文件基本信息:\n", pdf_info)
        self.close_pdf()

    # 提取表格數(shù)據(jù),并保存到excel中
    def get_table(self):
        wb = Workbook()  # 實(shí)例化一個(gè)工作簿對(duì)象
        ws = wb.active  # 獲取第一個(gè)sheet
        con = 0
        try:
            # 獲取每一頁的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]]
            for page in self.pdf_info.pages:
                for table in page.extract_tables():
                    for row in table:
                        # 對(duì)每個(gè)單元格的字符進(jìn)行簡單清洗處理
                        row_list = [cell.replace('\n', ' ') if cell else '' for cell in row]
                        ws.append(row_list)  # 寫入數(shù)據(jù)
                con += 1
                print('---------------分割線,第%s頁---------------' % con)
        except Exception as e:
            print('報(bào)錯(cuò):', e)
        finally:
            wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx')
            print('寫入完成!')
            self.close_pdf()

    # 關(guān)閉文件
    def close_pdf(self):
        self.pdf_info.close()

if __name__ == "__main__":
    file_path = input('請(qǐng)輸入pdf文件路徑:')
    pdf_info = PDF(file_path)
    # pdf_info.get_pdf() # 打印pdf基礎(chǔ)信息
    # 提取pdf表格數(shù)據(jù)并保存到excel中,文件保存到跟pdf同一文件路徑下
    pdf_info.get_table()

總結(jié)

到此這篇關(guān)于python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中的文章就介紹到這了,更多相關(guān)python提取pdf數(shù)據(jù)保存excel內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python 實(shí)現(xiàn)在一張圖中繪制一個(gè)小的子圖方法

    python 實(shí)現(xiàn)在一張圖中繪制一個(gè)小的子圖方法

    今天小編就為大家分享一篇python 實(shí)現(xiàn)在一張圖中繪制一個(gè)小的子圖方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2019-07-07
  • Python Numpy運(yùn)行報(bào)錯(cuò):IndexError: too many indices for array的分析及解決

    Python Numpy運(yùn)行報(bào)錯(cuò):IndexError: too many in

    在使用Numpy進(jìn)行數(shù)組操作時(shí),經(jīng)常會(huì)遇到各種錯(cuò)誤,其中,IndexError: too many indices for array是一種常見的錯(cuò)誤,它通常發(fā)生在嘗試使用一個(gè)過多維度的索引來訪問一個(gè)較低維度的數(shù)組時(shí),本文介紹了Python Numpy報(bào)錯(cuò)的解決辦法,需要的朋友可以參考下
    2024-07-07
  • Python常用基礎(chǔ)模塊之os.path模塊詳解

    Python常用基礎(chǔ)模塊之os.path模塊詳解

    這篇文章主要介紹了Python常用基礎(chǔ)模塊之os.path模塊詳解,os模塊的子模塊os.path 是專門用于進(jìn)行路徑操作的模塊,常用的路徑操作主要有判斷目錄是否存在、創(chuàng)建目錄、刪除目錄和遍歷目錄等,需要的朋友可以參考下
    2023-08-08
  • Python split() 函數(shù)拆分字符串將字符串轉(zhuǎn)化為列的方法

    Python split() 函數(shù)拆分字符串將字符串轉(zhuǎn)化為列的方法

    今天小編就為大家分享一篇Python split() 函數(shù)拆分字符串將字符串轉(zhuǎn)化為列的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2019-07-07
  • Python如何限制輸入的數(shù)范圍

    Python如何限制輸入的數(shù)范圍

    在Python中,我們可以使用多種方法來限制用戶輸入的數(shù)值范圍,今天通過實(shí)例代碼給大家分享Python限制輸入的數(shù)范圍,感興趣的朋友一起看看吧
    2024-05-05
  • python文件處理詳解

    python文件處理詳解

    這篇文章主要介紹了Python 處理文件的幾種方式,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-10-10
  • TensorFlow深度學(xué)習(xí)之實(shí)現(xiàn)合并與分割的示例代碼

    TensorFlow深度學(xué)習(xí)之實(shí)現(xiàn)合并與分割的示例代碼

    這篇文章主要為大家詳細(xì)介紹了TensorFlow中實(shí)現(xiàn)合并與分割的四位函數(shù)以及它們的用法,文中的示例代碼講解詳細(xì),感興趣的小伙伴可以了解一下
    2023-07-07
  • Python基礎(chǔ)之?dāng)?shù)據(jù)類型知識(shí)匯總

    Python基礎(chǔ)之?dāng)?shù)據(jù)類型知識(shí)匯總

    今天帶大家復(fù)習(xí)一下Python基礎(chǔ)知識(shí),文中對(duì)數(shù)據(jù)類型相關(guān)知識(shí)做了詳細(xì)的匯總,對(duì)剛?cè)腴Tpython的小伙伴很有幫助喲,需要的朋友可以參考下
    2021-05-05
  • Python可視化庫之HoloViews的使用教程

    Python可視化庫之HoloViews的使用教程

    本文主要為大家介紹了Python中一個(gè)優(yōu)秀的可視化庫—HoloViews,不僅能實(shí)現(xiàn)一些常見的統(tǒng)計(jì)圖表繪制,而且其還擁有Matplotlib、Seaborn等庫所不具備的交互效果,快跟隨小編一起了解一下吧
    2022-02-02
  • 利用Pandas讀取表格行數(shù)據(jù)判斷是否相同的方法

    利用Pandas讀取表格行數(shù)據(jù)判斷是否相同的方法

    這篇文章主要給大家介紹了關(guān)于利用Pandas讀取表格行數(shù)據(jù)判斷是否相同的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-03-03

最新評(píng)論

温州市| 日喀则市| 偏关县| 乐都县| 名山县| 孝感市| 张掖市| 河南省| 田阳县| 德保县| 鹤峰县| 苍溪县| 连城县| 郧西县| 巨鹿县| 永和县| 夹江县| 海阳市| 永年县| 观塘区| 那曲县| 兴义市| 陆河县| 邹平县| 八宿县| 大方县| 玉田县| 巫溪县| 富源县| 黄骅市| 大安市| 华池县| 平山县| 鹤山市| 永康市| 英吉沙县| 余姚市| 鹿泉市| 建始县| 辽阳市| 自治县|