Python實現(xiàn)HTML文件或字符串轉換為純文本TXT
1. 引言
在數(shù)據(jù)處理、內容提取、網(wǎng)頁歸檔等任務中,經(jīng)常需要將 HTML 轉換為純文本 TXT。常見需求包括去除 HTML 標簽,保留文本內容,保留段落、列表等基本結構。
本文將介紹如何用 Python 和 Free Spire.Doc 庫完成 HTML 到 TXT 的轉換。
2. 轉換原理
HTML 轉 TXT 的本質是解析 HTML 文檔對象模型(DOM),提取其中的文本節(jié)點,再按需要的格式輸出。
常用方法有兩類:
- 純解析器(如
BeautifulSoup、lxml):快速、輕量,但需要自己處理換行和縮進。 - 文檔模型類庫(如 Free Spire.Doc):加載 HTML 到文檔對象,再導出為 TXT,結構保留更好。
3. 環(huán)境準備
安裝 Free Spire.Doc for Python:
pip install Spire.Doc.free
注意點擊查看免費版的限制
4. 基本實現(xiàn)
4.1 HTML 文件 → TXT 文件
下面是一個將 HTML 文件轉換為 TXT 文本的簡單示例:
from spire.doc import *
from spire.doc.common import *
# 加載HTML文件
document = Document()
document.LoadFromFile("E:\input.html", FileFormat.Html, XHTMLValidationType.none)
# 另存為TXT文件
document.SaveToFile("Html文件轉TXT.txt", FileFormat.Txt)
document.Close()
核心代碼:
LoadFromFile():加載 HTML 文件。FileFormat.Html表示文件格式為 HTML。SaveToFile():將文檔保存為 TXT 格式。FileFormat.Txt表示保存為純文本。
輸出結果:

4.2 HTML 字符串 → TXT 文件
若 HTML 內容已在內存中(如接口返回、爬蟲抓取結果),可使用該方法:
from spire.doc import *
from spire.doc.common import *
# 指定HTML字符串
sample_html = """
<html>
<head><title>示例頁面</title></head>
<body>
<h1>歡迎來到我的網(wǎng)站</h1>
<p>這是一個段落文本。</p>
<ul>
<li>項目1</li>
<li>項目2</li>
<li>項目3</li>
</ul>
</body>
</html>
"""
# 創(chuàng)建文檔
document = Document()
# 在段落中插入字符串
section = document.AddSection()
section.AddParagraph().AppendHTML(sample_html)
# 另存為TXT
document.SaveToFile("Html字符串轉TXT.txt", FileFormat.Txt)
document.Close()
輸出結果:

5. 注意事項
- 格式保留:轉換后的 TXT 會保留 HTML 的段落結構(換行、列表等),但不保留顏色、字體等樣式。
- 性能:對于超大型 HTML 文件,建議分段處理以避免內存占用過高。
- 復雜 HTML:對于包含大量 JavaScript、CSS 或復雜布局的 HTML,建議先用對文件進行預處理再轉換。
使用 Free Spire.Doc for Python 轉換 HTML 到 TXT 非常方便,只需幾行代碼即可完成,并且能夠較好地保留原有的文本結構。相比正則表達式或簡單的標簽剝離方法,這種方式更穩(wěn)定可靠。
到此這篇關于Python實現(xiàn)HTML文件或字符串轉換為純文本TXT的文章就介紹到這了,更多相關Python HTML轉TXT內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!
相關文章
基于Python的ABAQUS參數(shù)化建模教程(最新推薦)
ABAQUS是廣泛應用于多個工程領域的非線性有限元分析軟件,參數(shù)化建模通過定義變量和規(guī)則,可以自動化創(chuàng)建和修改模型,提高建模效率和精度,本文給大家介紹基于Python的ABAQUS參數(shù)化建模教程,感興趣的朋友一起看看吧2025-11-11

