詳解如何用Java去除HTML標(biāo)簽
在我平時(shí)的工作中,偶爾會(huì)用 Java 做一些解析HTML的工作。有的時(shí)候我需要?jiǎng)h除所有的HTML標(biāo)簽,只保留純文字內(nèi)容。這個(gè)問(wèn)題在做過(guò)一些爬蟲(chóng)工作的朋友來(lái)說(shuō)很簡(jiǎn)單。下面來(lái)說(shuō)說(shuō),我們平時(shí)使用到的集中解析的方法。
使用正則表達(dá)式
通過(guò)爬蟲(chóng)爬到的HTML內(nèi)容,從程序角度來(lái)講,就是一個(gè)字符串。我們可以對(duì)其按照純文本處理的方式來(lái)處理。
我們?cè)谧鑫谋咎幚淼臅r(shí)候,第一個(gè)想到的就是正則表達(dá)式。從一個(gè)字符串中刪除HTML,對(duì)于正則來(lái)說(shuō),還是比較簡(jiǎn)單的。畢竟還是有固定的格式,比如“<...>”。
我們常用的的正則就是 <[^>]> 或者 <.*?> 。
我們?cè)谑褂谜齽t的時(shí)候,需要注意的是正則默認(rèn)是貪婪匹配。也就是說(shuō),正則表達(dá)式 <.*> 能夠匹配到更多的HTML內(nèi)容,而不是單個(gè)標(biāo)簽。
現(xiàn)在,讓我們測(cè)試一下它是否能從HTML源中刪除標(biāo)簽。
正則測(cè)試刪除標(biāo)簽1
在我們測(cè)試刪除HTML標(biāo)簽之前,首先讓我們創(chuàng)建一個(gè)HTML例子,例如example1.html。
<!DOCTYPE?html> <html> <head> ????<title>這是標(biāo)題</title> </head> <body> ????<p> ????????如果應(yīng)用程序X沒(méi)有啟動(dòng),可能的原因是<br/> ????????1.?<a? rel="external nofollow" >Maven</a>沒(méi)有安裝<br/> ????????2.?磁盤(pán)空間不足<br/> ????????3.?內(nèi)存不足 ????</p> </body> </html>
現(xiàn)在,讓我們寫(xiě)一個(gè)測(cè)試,用String.replaceAll()來(lái)刪除HTML標(biāo)簽。
String?html?=?...?//?load?example1.html
String?result?=?html.replaceAll("<[^>]`>",?"");
System.out.println(result);
如果我們運(yùn)行這個(gè)測(cè)試方法,我們會(huì)看到結(jié)果。
這是標(biāo)題
如果應(yīng)用程序X沒(méi)有啟動(dòng),可能的原因是
1.Maven沒(méi)有安裝
2.磁盤(pán)空間不足
3.沒(méi)有足夠的內(nèi)存
輸出結(jié)果保留了剝離后的HTML的空白處。我們?cè)谔幚硖崛〉奈谋緯r(shí),可以很容易地刪除或跳過(guò)這些空行或空白處。
正則測(cè)試刪除標(biāo)簽2
我們剛才已經(jīng)看到了,通過(guò)使用Regex來(lái)刪除HTML標(biāo)簽是非常簡(jiǎn)單。但是粗暴的使用這種方法會(huì)有很多問(wèn)題,我們不能預(yù)測(cè)最終的結(jié)果會(huì)是怎么樣的。
例如,一個(gè)HTML文檔可能有<script>或<style>標(biāo)簽,而我們可能不希望在結(jié)果中出現(xiàn)它們的內(nèi)容。
此外,<script>、<style>、甚至是<body>標(biāo)簽中的文本可能包含 <或 >字符。如果是這種情況,我們的正則方法可能會(huì)出錯(cuò)。
現(xiàn)在,讓我們看看另一個(gè)例子,比如example2.html。
<!DOCTYPE?HTML> <html> <head> ????<title>這是標(biāo)題</title> </head> <script> ????//?some?js?function </script> <body> ????<p> ????????如果應(yīng)用程序X沒(méi)有啟動(dòng),可能的原因是<br/> ????????1.?<a ????????????id="link" ???????????? rel="external nofollow" > ????????????Maven ????????????</a>?沒(méi)有安裝<br/> ????????2.?磁盤(pán)空間不足?(<1G)?<br/> ????????3.?內(nèi)存不足(<64MB)<br/> ????</p> </body> </html>
現(xiàn)在我們有一個(gè)<script>標(biāo)簽和 <字符在<body>標(biāo)簽內(nèi)。
如果我們對(duì)example2.html使用同樣的方法,我們會(huì)得到如下內(nèi)容。
這是標(biāo)題
// some js function
如果應(yīng)用程序X沒(méi)有啟動(dòng),可能的原因是
1.
Maven
沒(méi)有安裝
2. 磁盤(pán)空間不足 (
3. 內(nèi)存不足(
顯然,由于"<"字符的存在,我們丟失了一些文本。所以正則在處理文本的時(shí)候并不是萬(wàn)能的。我們可以使用一些 HTML 解析器來(lái)做這些比較復(fù)雜的場(chǎng)景。
使用Jsoup
Jsoup 是一個(gè)流行的HTML解析庫(kù),如果想要從一個(gè)HTML文檔中提取文本,我們可以簡(jiǎn)單地調(diào)用Jsoup.parse(htmlString).text()。
在項(xiàng)目中使用的時(shí)候,我們首先需要添加 jsoup 的依賴(lài)庫(kù),我們這里就通過(guò)maven的方式引入。
<dependency> ????<groupId>org.jsoup</groupId> ????<artifactId>jsoup</artifactId> ????<version>1.14.3</version> </dependency>
我們用 example2.html來(lái)測(cè)試一下。
String?html?=?...?//?load?example2.html System.out.println(Jsoup.parse(html).text());
如果我們讓這個(gè)方法運(yùn)行,它就會(huì)打印出來(lái)。
這是標(biāo)題 如果應(yīng)用程序X沒(méi)有啟動(dòng),可能的原因是 1.Maven沒(méi)有安裝 2.沒(méi)有足夠的(<1G)磁盤(pán)空間 3.沒(méi)有足夠的(<64MB)內(nèi)存
從輸出結(jié)果可知,Jsoup已經(jīng)成功地從HTML文檔中提取了文本。另外,<script>元素中的文本已經(jīng)被忽略了。
此外,默認(rèn)情況下,Jsoup會(huì)刪除所有的文本格式和空白處,比如換行符。
使用HTMLCleaner
HTMLCleaner 也是一個(gè)HTML解析庫(kù)。
首先,我們需要在pom.xml中添加HTMLCleaner 依賴(lài)。
<dependency> ????<groupId>net.sourceforge.htmlcleaner</groupId> ????<artifactId>htmlcleaner</artifactId> ????<version>2.25</version> </dependency>
我們可以設(shè)置[各種參數(shù)](http://htmlcleaner.sourceforge.net/parameters.php)來(lái)控制HTMLCleaner的解析行為。我們?cè)谶@里使用HTMLCleaner在解析example2.html時(shí)跳過(guò)<script>元素。
String?html?=?...?//?load?example2.html
CleanerProperties?props?=?new?CleanerProperties();
props.setPruneTags("script");
String?result?=?new?HtmlCleaner(props).clean(html).getText().toString();
System.out.println(result);
運(yùn)行一下,HTMLCleaner將產(chǎn)生這樣的輸出。
這是標(biāo)題
如果應(yīng)用程序X沒(méi)有啟動(dòng),可能的原因是:
1.Maven沒(méi)有安裝
2.沒(méi)有足夠的(<1G)磁盤(pán)空間
3.內(nèi)存不足(<64MB)
我們可以看到,<script>元素中的內(nèi)容被忽略了, <br/>標(biāo)簽轉(zhuǎn)換為提取的文本中的換行符。另外, HTMLCleaner 保留了HTML的空白內(nèi)容。
總結(jié)
在這篇文章中,我們學(xué)習(xí)了幾種去除HTML的方法,我們需要注意的是,正則在文本處理的過(guò)程中并不是萬(wàn)能的。
到此這篇關(guān)于詳解如何用Java去除HTML標(biāo)簽的文章就介紹到這了,更多相關(guān)Java去除HTML標(biāo)簽內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
java項(xiàng)目依賴(lài)包選擇具體實(shí)現(xiàn)類(lèi)示例介紹
這篇文章主要為大家介紹了java項(xiàng)目依賴(lài)包選擇具體實(shí)現(xiàn)類(lèi)示例介紹,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2022-12-12
JSON.toJSONString()方法在Java中的使用方法及應(yīng)用場(chǎng)景
這篇文章主要給大家介紹了關(guān)于JSON.toJSONString()方法在Java中的使用方法及應(yīng)用場(chǎng)景,JSON.toJSONString是將對(duì)象轉(zhuǎn)化為Json字符串,文中通過(guò)代碼介紹的非常詳細(xì),需要的朋友可以參考下2024-04-04
Java中Lambda表達(dá)式和函數(shù)式接口的使用和特性
Java Lambda表達(dá)式是一種函數(shù)式編程的特性,可簡(jiǎn)化匿名內(nèi)部類(lèi)的寫(xiě)法,與函數(shù)式接口搭配使用,實(shí)現(xiàn)代碼簡(jiǎn)潔、可讀性高、易于維護(hù)的特點(diǎn),適用于集合操作、多線(xiàn)程編程等場(chǎng)景2023-04-04
vue+springboot讀取git的markdown文件并展示功能
Markdown-it 是一個(gè)用于解析和渲染 Markdown 標(biāo)記語(yǔ)言的 JavaScript 庫(kù),使用 Markdown-it,你可以將 Markdown 文本解析為 HTML 輸出,并且可以根據(jù)需要添加功能、擴(kuò)展語(yǔ)法或修改解析行為,本文介紹vue+springboot讀取git的markdown文件并展示,感興趣的朋友一起看看吧2024-01-01
springboot+vue實(shí)現(xiàn)阿里云oss上傳的示例代碼
文件上傳是常用的功能,本文主要介紹了springboot+vue實(shí)現(xiàn)阿里云oss上傳的示例代碼,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2024-06-06
SpringBoot使用@valid進(jìn)行參數(shù)校驗(yàn)的流程步驟
SpringBoot 提供了一種方便的方式來(lái)進(jìn)行參數(shù)校驗(yàn):使用 Hibernate Validator,Spring Boot 提供了一種方便的方式來(lái)進(jìn)行參數(shù)校驗(yàn):使用 Hibernate Validator,所以本文給大家介紹了SpringBoot使用@valid進(jìn)行參數(shù)校驗(yàn)的流程步驟,需要的朋友可以參考下2023-09-09

