最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

用Python將PDF文件轉存為圖片的實現(xiàn)方法

 更新時間:2024年04月21日 10:02:45   作者:以山河作禮。  
在Python中,將PDF文件轉換為圖片格式使用專門的庫來處理PDF文檔,并將其每一頁導出為常見的圖像格式,這可以通過PyMuPDF庫中的fitz模塊或pdf2image庫實現(xiàn),本文給大家介紹了用Python將PDF文件轉存為圖片的方法,需要的朋友可以參考下

一·摘要

在Python中,將PDF文件轉換為圖片格式使用專門的庫來處理PDF文檔,并將其每一頁導出為常見的圖像格式。這可以通過PyMuPDF庫中的fitz模塊或pdf2image庫實現(xiàn),其中每個庫都提供了將PDF頁面渲染成位圖的方法。一旦頁面被轉換成圖像,就可以使用Pillow庫(即PIL庫的一個分支)將這些圖像保存為PNG或JPEG文件。此過程不僅支持將包含文本和圖形的PDF頁面精確地轉換為圖像,而且還可以處理批量轉換,使得整個轉換過程可以自動化完成,非常適合需要從PDF中提取圖像內容以用于報告、演示或網(wǎng)頁發(fā)布的場景。

二·原理

在Python中將PDF文件轉存為圖片的過程通常依賴于渲染引擎,該引擎能夠解析PDF文檔的結構和內容,并將其轉換成像素數(shù)據(jù),即圖像。

原理如下:

  1. 解析PDF:使用庫(如PyMuPDFpdf2image)來讀取PDF文件。這些庫內部使用PDF解析器來理解PDF文件的結構,包括文本、圖像、向量圖形和頁面布局信息。

  2. 頁面渲染:庫中的渲染引擎會處理PDF頁面上的每個元素,如文字、線條和嵌入的圖像,并將它們轉換為可在屏幕上顯示的像素數(shù)據(jù)。對于PyMuPDF,get_pixmap()方法負責這個渲染過程;對于pdf2image,convert_from_path()方法則用于將整個PDF頁面渲染成圖像。

  3. 圖像保存:一旦PDF頁面被渲染成位圖,就可以使用像Pillow這樣的圖像處理庫將其保存為常見的圖像格式(如PNG或JPEG)。這個過程涉及到設置圖像的分辨率、顏色深度和壓縮級別。

  4. 循環(huán)處理:因為PDF文件可能包含多個頁面,所以上述過程需要對每一頁進行重復,直到所有頁面都被轉換成了對應的圖像文件。

  5. 結果驗證:轉換完成后,需要檢查生成的圖像以確保它們準確地反映了原PDF頁面的內容和布局。

這個過程不僅能夠將PDF中的文本和矢量圖形轉換為像素圖像,還能夠處理其中嵌入的圖像和圖表。通過適當?shù)脑O置,可以調整輸出圖像的質量、大小和格式,以適應不同的用途和需求。

三·流程

將PDF文件轉換為圖片的流程可以分為以下幾個步驟:

  1. 安裝庫:首先,需要安裝Python庫來處理PDF和圖像。常用的庫包括PyMuPDF(也稱為fitz)和pdf2image。可以使用pip命令進行安裝,例如:pip install PyMuPDFpip install pdf2image

  2. 導入庫:在Python腳本中,導入所需的庫。對于PyMuPDF,導入fitz模塊;對于pdf2image,導入pdf2image模塊。

  3. 讀取PDF文件:使用庫提供的方法打開PDF文件。對于PyMuPDF,可以使用fitz.open()方法打開PDF文件;對于pdf2image,可以使用convert_from_path()方法打開PDF文件。

  4. 渲染PDF頁面:遍歷PDF的每一頁,并將其渲染為圖像。對于PyMuPDF,可以使用page.get_pixmap()方法將每一頁渲染成位圖;對于pdf2image,可以使用convert_from_path()方法將整個PDF頁面渲染成圖像。

  5. 保存圖像:將渲染得到的圖像保存到本地文件系統(tǒng)中??梢允褂肞illow庫(即PIL庫的一個分支)的save()方法來保存圖像。

  6. 循環(huán)處理:對PDF中的每一頁重復步驟4和5,直到所有頁面都轉換為圖像。

  7. 處理完畢:確保所有圖像都已正確保存,并在需要時進行任何后續(xù)處理,如調整大小、裁剪或格式轉換。

四·實戰(zhàn)演示

因工作中的某些奇葩要求,需要將PDF文件的每頁內容轉存成按順序編號的圖片。用第三方軟件或者在線轉換也可以,但批量操作還是Python方便,所謂搞定辦公自動化,Python出山,一統(tǒng)天下;Python出征,寸草不生。

這里先導入fitz庫,用于將PDF文件的頁面提取成像素信息(圖片)。再導入glob庫,用于獲取后綴為".pdf"的文件的文件名。os庫可新建文件夾

#批量將PDF文件轉為圖片
import fitz
import glob
import os

image_path = "圖片\\" #存放圖片的文件夾
PDFfiles = glob.glob("PDF文件\\*.pdf") #獲取所有pdf文件的文件名
for PDFfile in PDFfiles: #遍歷所有PDF文件
    PDFdoc = fitz.open(PDFfile) #讀取PDF文件
    folder_name = PDFfile.split("\\")[-1].split(".")[0] #按源文件名新建文件夾
    for pg in range(PDFdoc.pageCount): #根據(jù)PDF的頁數(shù),按頁提取圖片        
        page = PDFdoc[pg]
        #增強圖片分辨率
        zoom_x = 3 #水平方向
        zoom_y = 3 #垂直方向
        mat = fitz.Matrix(zoom_x, zoom_y) 
        pix = page.getPixmap(matrix=mat)  
        #按原PDF名稱新建文件夾并按順序保存圖片
        if not os.path.exists(image_path+folder_name):#判斷文件夾是否已存在
            os.makedirs(image_path+folder_name)#不存在則新建,存在就跳過這行
        pix.writeImage(image_path+folder_name + "\\{}.png".format(str(pg+1))) #按PDF中的頁面順序命名并保存圖片

以上,我們先將所有待處理的PDF文件放入“PDF文件夾”,然后通過glob.glob(“PDF文件\*.pdf”)搜索并抓取所有以".pdf"為后綴的文件,并存入變量PDFfiles中。

結果如下所示:

PDFfiles

然后,遍歷PDFfiles中的所有PDF文件,使用fitz.open()讀取。fitz.open()用于創(chuàng)建PDF文件中頁面的像素映射(pixel maps),即用像素來表示頁面信息。然后按PDF文件名命名一個新的文件夾,以便儲存圖片。比如給“收貨記錄.pdf”文件建一個名字為“收貨記錄”的文件夾,專門儲存關于它的頁面的圖片。隨后用for循環(huán),根據(jù)PDF的頁數(shù),按頁提取圖片。將每頁的信息存入page變量,它的type 是fitz.fitz.Page,即一頁像素文件。為了讓圖片看起來更清晰,需要增強圖片的分辨率,設定圖片水平及垂直方向的增強倍數(shù),傳入Matrix。Matrix用于提升即將保存的圖片的分辨率,分辨率的提升倍數(shù)為zoom_x與zoom_y的乘積。倍數(shù)越大,圖片越清晰,當然占用空間也越大。這個參數(shù)可根據(jù)實際要求調整。然后將Matrix存入mat,傳入getPixmap()。getPixmap()用于控制圖片分辨率、色域(比如生成灰度圖像或帶有減色方案的圖像)、透明度、旋轉、鏡像、移位、剪切等。由于其它都不需要專門設定,所以只增強其分辨率。

一頁圖片處理好后,就需要保存圖片了。先通過os.path.exists判斷一下需要的文件夾是否存在,若不存在就通過os.makedirs創(chuàng)建。然后用pix.writeImage按頁碼編號寫入并保存圖片。

以上就是用Python將PDF文件轉存為圖片的方法的詳細內容,更多關于Python PDF文件轉圖片的資料請關注腳本之家其它相關文章!

相關文章

  • Django CSRF跨站請求偽造防護過程解析

    Django CSRF跨站請求偽造防護過程解析

    這篇文章主要介紹了Django CSRF跨站請求偽造防護過程解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2019-07-07
  • Python實現(xiàn)隨機森林算法的示例代碼

    Python實現(xiàn)隨機森林算法的示例代碼

    隨機森林的英文是 Random Forest,英文簡寫是 RF,也是常用的人工智能算法,本文為大家介紹了Python實現(xiàn)隨機森林算法的示例代碼,希望對大家有所幫助
    2023-06-06
  • 一篇文章帶你了解python中的typing模塊和類型注解

    一篇文章帶你了解python中的typing模塊和類型注解

    這篇文章主要為大家詳細介紹了python中的類型注解,使用typing模塊,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2022-02-02
  • python使用__slots__讓你的代碼更加節(jié)省內存

    python使用__slots__讓你的代碼更加節(jié)省內存

    如果要限制添加的屬性,例如,Student類只允許添加 name、gender和score 這3個屬性,就可以利用Python的一個特殊的slots來實現(xiàn)。這篇文章主要給大家介紹了關于python如何使用__slots__讓你的代碼更加節(jié)省內存的相關資料,需要的朋友可以參考下
    2018-09-09
  • Python?IO文件管理的具體使用

    Python?IO文件管理的具體使用

    我們可以使用python來操作文件,比如讀取文件內容、寫入新的內容等,本文主要介紹了Python?IO文件管理的具體使用,文中通過示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2022-03-03
  • python框架中flask知識點總結

    python框架中flask知識點總結

    這篇文章給大家分享了關于學習python框架中flask知識點的總結內容,有興趣的朋友們可以學習下。
    2018-08-08
  • Matplotlib實戰(zhàn)之堆疊面積圖繪制詳解

    Matplotlib實戰(zhàn)之堆疊面積圖繪制詳解

    堆疊面積圖和面積圖都是用于展示數(shù)據(jù)隨時間變化趨勢的統(tǒng)計圖表,但它們的特點有所不同,堆疊面積圖既能看到各數(shù)據(jù)系列的走勢,又能看到整體的規(guī)模,下面我們就來看看如何繪制堆疊面積圖吧
    2023-08-08
  • python如何查找列表中元素的位置

    python如何查找列表中元素的位置

    這篇文章主要介紹了python如何查找列表中元素的位置,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-05-05
  • pycharm配置anaconda環(huán)境時找不到python.exe的兩種解決辦法

    pycharm配置anaconda環(huán)境時找不到python.exe的兩種解決辦法

    如果你在Anaconda中創(chuàng)建了虛擬環(huán)境,但是無法找到python.exe,可能是因為虛擬環(huán)境的Python路徑?jīng)]有添加到系統(tǒng)環(huán)境變量中,這篇文章主要給大家介紹了關于pycharm配置anaconda環(huán)境時找不到python.exe的兩種解決辦法,需要的朋友可以參考下
    2024-07-07
  • Python實現(xiàn)將多個文件的名稱或后綴名由大寫改為小寫

    Python實現(xiàn)將多個文件的名稱或后綴名由大寫改為小寫

    這篇文章主要介紹了如何基于Python語言實現(xiàn)將多個文件的名稱或后綴名由大寫字母修改為小寫,文中的示例代碼講解詳細,感興趣的可以了解下
    2023-09-09

最新評論

银川市| 于都县| 全州县| 赣州市| 上思县| 巨鹿县| 微博| 镇原县| 措勤县| 茶陵县| 庆安县| 锦屏县| 林州市| 苗栗县| 昌邑市| 房产| 布拖县| 蚌埠市| 佛学| 永修县| 错那县| 金华市| 天柱县| 荃湾区| 句容市| 青岛市| 子洲县| 阳城县| 扬中市| 芜湖县| 奉新县| 邻水| 甘泉县| 皮山县| 贵南县| 白河县| 蒙自县| 永宁县| 蕉岭县| 西和县| 湘西|