Python實(shí)現(xiàn)常用文本內(nèi)容提取
一、引言
在日常工作和學(xué)習(xí)中,我們經(jīng)常需要從PDF、Word文檔中提取文本,例如為了數(shù)據(jù)分析和文本處理等。如果手動(dòng)進(jìn)行這些操作,不僅費(fèi)時(shí)費(fèi)力,而且容易出錯(cuò)。因此,編寫(xiě)一個(gè)文本內(nèi)容提取變得尤為重要。本文將介紹如何使用Python編寫(xiě)一個(gè)文本內(nèi)容提取,該工具可以從PDF、Word文檔中提取文本。
二、文本內(nèi)容提取的原理
文本內(nèi)容提取的核心原理是遍歷指定目錄下的所有文件,根據(jù)文件類型(PDF或Word)使用相應(yīng)的庫(kù)提取文本,然后將提取的文本保存到指定目錄。在這個(gè)過(guò)程中,我們需要考慮以下幾個(gè)問(wèn)題:
如何遍歷指定目錄下的所有文件?
如何根據(jù)文件類型提取文本?
如何保存提取的文本?
接下來(lái),我們將分別介紹這三個(gè)問(wèn)題的解決方案。
三、文本內(nèi)容提取的設(shè)計(jì)
在設(shè)計(jì)文本內(nèi)容提取時(shí),我們需要考慮以下幾個(gè)方面的內(nèi)容:
用戶界面:為了方便用戶使用,我們可以設(shè)計(jì)一個(gè)簡(jiǎn)單的命令行界面,讓用戶可以輸入目錄、輸出目錄等參數(shù)。
文件遍歷:我們需要編寫(xiě)一個(gè)文件遍歷,用于遍歷指定目錄下的所有文件。
文本提?。何覀冃枰帉?xiě)一個(gè)文本提取,用于根據(jù)文件類型提取文本。
文本保存:我們需要編寫(xiě)一個(gè)文本保存,用于將提取的文本保存到指定目錄。
四、文本內(nèi)容提取的實(shí)現(xiàn)
接下來(lái),我們將詳細(xì)介紹文本內(nèi)容提取的實(shí)現(xiàn)過(guò)程。為了方便起見(jiàn),我們將使用Python編寫(xiě)這個(gè)工具。
1.用戶界面
我們可以使用Python的argparse庫(kù)來(lái)設(shè)計(jì)一個(gè)簡(jiǎn)單的命令行界面。界面包括以下幾個(gè)部分:
目錄參數(shù):讓用戶指定需要提取文本的文件所在的目錄。
輸出目錄參數(shù):讓用戶指定提取的文本保存到的目錄。
2.文件遍歷
我們可以使用Python的os庫(kù)來(lái)遍歷指定目錄下的所有文件。具體實(shí)現(xiàn)如下:
import os
def traverse_dir(dir_path):
file_list = []
for root, dirs, files in os.walk(dir_path):
for file in files:
file_list.append(os.path.join(root, file))
return file_list
3.文本提取
對(duì)于PDF文件,我們可以使用Python的PyPDF2庫(kù)來(lái)提取文本。具體實(shí)現(xiàn)如下:
import PyPDF2
def extract_text_from_pdf(pdf_path, output_path):
with open(pdf_path, 'rb') as file:
pdf_reader = PyPDF2.PdfFileReader(file)
for page_num in range(pdf_reader.numPages):
page = pdf_reader.getPage(page_num)
text = page.extractText()
with open(output_path, 'a', encoding='utf-8') as output_file:
output_file.write(text)
對(duì)于Word文檔,我們可以使用Python的python-docx庫(kù)來(lái)提取文本。具體實(shí)現(xiàn)如下:
from docx import Document
def extract_text_from_docx(docx_path, output_path):
doc = Document(docx_path)
text = []
for para in doc.paragraphs:
text.append(para.text)
with open(output_path, 'a', encoding='utf-8') as output_file:
output_file.write('\n'.join(text))
4.文本保存
我們可以使用Python的os.path.join()函數(shù)來(lái)保存提取的文本。具體實(shí)現(xiàn)如下:
import os
def save_text(text, output_path):
with open(output_path, 'w', encoding='utf-8') as output_file:
output_file.write(text)
五、完整代碼示例
import argparse
import os
import PyPDF2
from docx import Document
def traverse_dir(dir_path):
file_list = []
for root, dirs, files in os.walk(dir_path):
for file in files:
file_list.append(os.path.join(root, file))
return file_list
def extract_text_from_pdf(pdf_path, output_path):
with open(pdf_path, 'rb') as file:
pdf_reader = PyPDF2.PdfFileReader(file)
for page_num in range(pdf_reader.numPages):
page = pdf_reader.getPage(page_num)
text = page.extractText()
with open(output_path, 'a', encoding='utf-8') as output_file:
output_file.write(text)
def extract_text_from_docx(docx_path, output_path):
doc = Document(docx_path)
text = []
for para in doc.paragraphs:
text.append(para.text)
with open(output_path, 'a', encoding='utf-8') as output_file:
output_file.write('\n'.join(text))
def save_text(text, output_path):
with open(output_path, 'w', encoding='utf-8') as output_file:
output_file.write(text)
def main():
parser = argparse.ArgumentParser(description="文本內(nèi)容提取")
parser.add_argument("directory", help="指定目錄")
parser.add_argument("output_directory", help="指定輸出目錄")
args = parser.parse_args()
dir_path = args.directory
output_dir = args.output_directory
file_list = traverse_dir(dir_path)
for file_path in file_list:
if file_path.lower().endswith(('.pdf')):
extract_text_from_pdf(file_path, output_dir)
elif file_path.lower().endswith(('.docx', '.doc')):
extract_text_from_docx(file_path, output_dir)
if __name__ == "__main__":
main()
以上就是Python實(shí)現(xiàn)常用文本內(nèi)容提取的詳細(xì)內(nèi)容,更多關(guān)于Python文本內(nèi)容提取的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!
相關(guān)文章
Python使用plt.boxplot() 參數(shù)繪制箱線圖
這篇文章主要介紹了Python使用plt.boxplot() 參數(shù)繪制箱線圖 ,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-06-06
基于Python實(shí)現(xiàn)大文件分割和命名腳本過(guò)程解析
這篇文章主要介紹了基于Python實(shí)現(xiàn)大文件分割和命名腳本過(guò)程解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2019-09-09
Pytorch+PyG實(shí)現(xiàn)GraphConv過(guò)程示例詳解
這篇文章主要為大家介紹了Pytorch+PyG實(shí)現(xiàn)GraphConv過(guò)程示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-04-04
pd.DataFrame中的幾種索引變換的實(shí)現(xiàn)
本文主要介紹了pd.DataFrame中的幾種索引變換的實(shí)現(xiàn),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2022-06-06
python中Matplotlib實(shí)現(xiàn)繪制3D圖的示例代碼
本篇文章主要介紹了python中Matplotlib實(shí)現(xiàn)繪制3D圖的示例代碼,具有一定的參考價(jià)值,有興趣的可以了解一下2017-09-09
python發(fā)送json參數(shù)的實(shí)例代碼
在寫(xiě)腳本的過(guò)程中,除了發(fā)送form表單參數(shù)之外,我們還會(huì)發(fā)送json格式的參數(shù)。那么碰見(jiàn)json格式要怎么發(fā)送呢,這篇我們來(lái)解決這個(gè)問(wèn)題,需要的朋友可以參考下2019-10-10

