最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實(shí)現(xiàn)常用文本內(nèi)容提取

 更新時(shí)間:2025年03月23日 15:26:24   作者:擁抱AI  
在日常工作和學(xué)習(xí)中,我們經(jīng)常需要從PDF、Word文檔中提取文本,本文將介紹如何使用Python編寫(xiě)一個(gè)文本內(nèi)容提取工具,有需要的小伙伴可以參考下

一、引言

在日常工作和學(xué)習(xí)中,我們經(jīng)常需要從PDF、Word文檔中提取文本,例如為了數(shù)據(jù)分析和文本處理等。如果手動(dòng)進(jìn)行這些操作,不僅費(fèi)時(shí)費(fèi)力,而且容易出錯(cuò)。因此,編寫(xiě)一個(gè)文本內(nèi)容提取變得尤為重要。本文將介紹如何使用Python編寫(xiě)一個(gè)文本內(nèi)容提取,該工具可以從PDF、Word文檔中提取文本。

二、文本內(nèi)容提取的原理

文本內(nèi)容提取的核心原理是遍歷指定目錄下的所有文件,根據(jù)文件類型(PDF或Word)使用相應(yīng)的庫(kù)提取文本,然后將提取的文本保存到指定目錄。在這個(gè)過(guò)程中,我們需要考慮以下幾個(gè)問(wèn)題:

如何遍歷指定目錄下的所有文件?

如何根據(jù)文件類型提取文本?

如何保存提取的文本?

接下來(lái),我們將分別介紹這三個(gè)問(wèn)題的解決方案。

三、文本內(nèi)容提取的設(shè)計(jì)

在設(shè)計(jì)文本內(nèi)容提取時(shí),我們需要考慮以下幾個(gè)方面的內(nèi)容:

用戶界面:為了方便用戶使用,我們可以設(shè)計(jì)一個(gè)簡(jiǎn)單的命令行界面,讓用戶可以輸入目錄、輸出目錄等參數(shù)。

文件遍歷:我們需要編寫(xiě)一個(gè)文件遍歷,用于遍歷指定目錄下的所有文件。

文本提?。何覀冃枰帉?xiě)一個(gè)文本提取,用于根據(jù)文件類型提取文本。

文本保存:我們需要編寫(xiě)一個(gè)文本保存,用于將提取的文本保存到指定目錄。

四、文本內(nèi)容提取的實(shí)現(xiàn)

接下來(lái),我們將詳細(xì)介紹文本內(nèi)容提取的實(shí)現(xiàn)過(guò)程。為了方便起見(jiàn),我們將使用Python編寫(xiě)這個(gè)工具。

1.用戶界面

我們可以使用Python的argparse庫(kù)來(lái)設(shè)計(jì)一個(gè)簡(jiǎn)單的命令行界面。界面包括以下幾個(gè)部分:

目錄參數(shù):讓用戶指定需要提取文本的文件所在的目錄。

輸出目錄參數(shù):讓用戶指定提取的文本保存到的目錄。

2.文件遍歷

我們可以使用Python的os庫(kù)來(lái)遍歷指定目錄下的所有文件。具體實(shí)現(xiàn)如下:

import os
def traverse_dir(dir_path):
    file_list = []
    for root, dirs, files in os.walk(dir_path):
        for file in files:
            file_list.append(os.path.join(root, file))
    return file_list

3.文本提取

對(duì)于PDF文件,我們可以使用Python的PyPDF2庫(kù)來(lái)提取文本。具體實(shí)現(xiàn)如下:

import PyPDF2
def extract_text_from_pdf(pdf_path, output_path):
    with open(pdf_path, 'rb') as file:
        pdf_reader = PyPDF2.PdfFileReader(file)
        for page_num in range(pdf_reader.numPages):
            page = pdf_reader.getPage(page_num)
            text = page.extractText()
            with open(output_path, 'a', encoding='utf-8') as output_file:
                output_file.write(text)

對(duì)于Word文檔,我們可以使用Python的python-docx庫(kù)來(lái)提取文本。具體實(shí)現(xiàn)如下:

from docx import Document
def extract_text_from_docx(docx_path, output_path):
    doc = Document(docx_path)
    text = []
    for para in doc.paragraphs:
        text.append(para.text)
    with open(output_path, 'a', encoding='utf-8') as output_file:
        output_file.write('\n'.join(text))

4.文本保存

我們可以使用Python的os.path.join()函數(shù)來(lái)保存提取的文本。具體實(shí)現(xiàn)如下:

import os
def save_text(text, output_path):
    with open(output_path, 'w', encoding='utf-8') as output_file:
        output_file.write(text)

五、完整代碼示例

import argparse
import os
import PyPDF2
from docx import Document
def traverse_dir(dir_path):
    file_list = []
    for root, dirs, files in os.walk(dir_path):
        for file in files:
            file_list.append(os.path.join(root, file))
    return file_list
def extract_text_from_pdf(pdf_path, output_path):
    with open(pdf_path, 'rb') as file:
        pdf_reader = PyPDF2.PdfFileReader(file)
        for page_num in range(pdf_reader.numPages):
            page = pdf_reader.getPage(page_num)
            text = page.extractText()
            with open(output_path, 'a', encoding='utf-8') as output_file:
                output_file.write(text)
def extract_text_from_docx(docx_path, output_path):
    doc = Document(docx_path)
    text = []
    for para in doc.paragraphs:
        text.append(para.text)
    with open(output_path, 'a', encoding='utf-8') as output_file:
        output_file.write('\n'.join(text))
def save_text(text, output_path):
    with open(output_path, 'w', encoding='utf-8') as output_file:
        output_file.write(text)
def main():
    parser = argparse.ArgumentParser(description="文本內(nèi)容提取")
    parser.add_argument("directory", help="指定目錄")
    parser.add_argument("output_directory", help="指定輸出目錄")
    args = parser.parse_args()
    dir_path = args.directory
    output_dir = args.output_directory
    file_list = traverse_dir(dir_path)
    for file_path in file_list:
        if file_path.lower().endswith(('.pdf')):
            extract_text_from_pdf(file_path, output_dir)
        elif file_path.lower().endswith(('.docx', '.doc')):
            extract_text_from_docx(file_path, output_dir)
if __name__ == "__main__":
    main()

以上就是Python實(shí)現(xiàn)常用文本內(nèi)容提取的詳細(xì)內(nèi)容,更多關(guān)于Python文本內(nèi)容提取的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • Python使用plt.boxplot() 參數(shù)繪制箱線圖

    Python使用plt.boxplot() 參數(shù)繪制箱線圖

    這篇文章主要介紹了Python使用plt.boxplot() 參數(shù)繪制箱線圖 ,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-06-06
  • 基于Python實(shí)現(xiàn)大文件分割和命名腳本過(guò)程解析

    基于Python實(shí)現(xiàn)大文件分割和命名腳本過(guò)程解析

    這篇文章主要介紹了基于Python實(shí)現(xiàn)大文件分割和命名腳本過(guò)程解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-09-09
  • 詳解Python3中的迭代器和生成器及其區(qū)別

    詳解Python3中的迭代器和生成器及其區(qū)別

    本篇將介紹Python3中的迭代器與生成器,描述可迭代與迭代器關(guān)系,并實(shí)現(xiàn)自定義類的迭代器模式。非常具有實(shí)用價(jià)值,需要的朋友可以參考下
    2018-10-10
  • Pytorch+PyG實(shí)現(xiàn)GraphConv過(guò)程示例詳解

    Pytorch+PyG實(shí)現(xiàn)GraphConv過(guò)程示例詳解

    這篇文章主要為大家介紹了Pytorch+PyG實(shí)現(xiàn)GraphConv過(guò)程示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-04-04
  • Pyqt5自適應(yīng)布局實(shí)例

    Pyqt5自適應(yīng)布局實(shí)例

    今天小編就為大家分享一篇Pyqt5自適應(yīng)布局實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2019-12-12
  • pd.DataFrame中的幾種索引變換的實(shí)現(xiàn)

    pd.DataFrame中的幾種索引變換的實(shí)現(xiàn)

    本文主要介紹了pd.DataFrame中的幾種索引變換的實(shí)現(xiàn),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2022-06-06
  • Python郵箱API發(fā)送郵件的方法和步驟

    Python郵箱API發(fā)送郵件的方法和步驟

    Python是一種功能強(qiáng)大的編程語(yǔ)言,可以用來(lái)發(fā)送電子郵件,使用Python發(fā)送郵件可以通過(guò)郵箱API來(lái)實(shí)現(xiàn),aoksend將介紹使用Python郵箱API發(fā)送郵件的方法和步驟,需要的朋友可以參考下
    2024-04-04
  • Python如何判斷字符串是否僅包含數(shù)字

    Python如何判斷字符串是否僅包含數(shù)字

    在用Python進(jìn)行數(shù)據(jù)處理的時(shí)候,經(jīng)常會(huì)遇到DataFrame中的某一列本應(yīng)該是數(shù)值類型,但由于數(shù)據(jù)不規(guī)范導(dǎo)致在字段中夾雜了非數(shù)值類型,本文就介紹了Python如何判斷字符串是否僅包含數(shù)字,感興趣的可以了解一下
    2022-03-03
  • python中Matplotlib實(shí)現(xiàn)繪制3D圖的示例代碼

    python中Matplotlib實(shí)現(xiàn)繪制3D圖的示例代碼

    本篇文章主要介紹了python中Matplotlib實(shí)現(xiàn)繪制3D圖的示例代碼,具有一定的參考價(jià)值,有興趣的可以了解一下
    2017-09-09
  • python發(fā)送json參數(shù)的實(shí)例代碼

    python發(fā)送json參數(shù)的實(shí)例代碼

    在寫(xiě)腳本的過(guò)程中,除了發(fā)送form表單參數(shù)之外,我們還會(huì)發(fā)送json格式的參數(shù)。那么碰見(jiàn)json格式要怎么發(fā)送呢,這篇我們來(lái)解決這個(gè)問(wèn)題,需要的朋友可以參考下
    2019-10-10

最新評(píng)論

华宁县| 南昌县| 凤台县| 牟定县| 若尔盖县| 剑川县| 琼结县| 古丈县| 高唐县| 兴国县| 左贡县| 新宁县| 天长市| 永靖县| 林周县| 许昌市| 乌兰察布市| 左云县| 遵义县| 大丰市| 大荔县| 长乐市| 轮台县| 永福县| 尚志市| 万山特区| 金寨县| 绥德县| 穆棱市| 宜川县| 瑞昌市| 奉节县| 滦南县| 东海县| 宣恩县| 康乐县| 乌海市| 铅山县| 阳山县| 台北市| 赤城县|