Python爬蟲使用bs4方法實現(xiàn)數(shù)據(jù)解析
聚焦爬蟲:
爬取頁面中指定的頁面內(nèi)容。
編碼流程:
- 1.指定url
- 2.發(fā)起請求
- 3.獲取響應(yīng)數(shù)據(jù)
- 4.數(shù)據(jù)解析
- 5.持久化存儲
數(shù)據(jù)解析分類:
- 1.bs4
- 2.正則
- 3.xpath (***)
數(shù)據(jù)解析原理概述:
解析的局部的文本內(nèi)容都會在標簽之間或者標簽對應(yīng)的屬性中進行存儲
1.進行指定標簽的定位
2.標簽或者標簽對應(yīng)的屬性中存儲的數(shù)據(jù)值進行提?。ń馕觯?/p>
bs4進行數(shù)據(jù)解析數(shù)據(jù)解析的原理:
1.標簽定位
2.提取標簽、標簽屬性中存儲的數(shù)據(jù)值
bs4數(shù)據(jù)解析的原理:
1.實例化一個BeautifulSoup對象,并且將頁面源碼數(shù)據(jù)加載到該對象中
2.通過調(diào)用BeautifulSoup對象中相關(guān)的屬性或者方法進行標簽定位和數(shù)據(jù)提取
環(huán)境安裝:
pip install bs4 -i https://pypi.tuna.tsinghua.edu.cn/simple
pip install lxml -i https://pypi.tuna.tsinghua.edu.cn/simple
實例化BeautifulSoup對象步驟:
from bs4 import BeautifulSoup
對象的實例化:
1.將本地的html文檔中的數(shù)據(jù)加載到該對象中
fp = open('./test.html','r',encoding='utf-8')
soup = BeautifulSoup(fp,'lxml')
2.將互聯(lián)網(wǎng)上獲取的頁面源碼加載到該對象中(常用方法,推薦)
page_text = response.text
soup = BeatifulSoup(page_text,'lxml')
提供的用于數(shù)據(jù)解析的方法和屬性:
soup.tagName:返回的是文檔中第一次出現(xiàn)的tagName對應(yīng)的標簽
soup.find():
find('tagName'):等同于soup.div
1.屬性定位:
soup.find('div',class_/id/attr='song')
soup.find_all('tagName'):返回符合要求的所有標簽(列表)
select:
select('某種選擇器(id,class,標簽...選擇器)'),返回的是一個列表。
2.層級選擇器:
soup.select('.tang > ul > li > a'):>表示的是一個層級
soup.select('.tang > ul a'):空格表示的多個層級
3.獲取標簽之間的文本數(shù)據(jù):
soup.a.text/string/get_text()
text/get_text():可以獲取某一個標簽中所有的文本內(nèi)容
string:只可以獲取該標簽下面直系的文本內(nèi)容
4.獲取標簽中屬性值:
soup.a['href']
案例:爬取三國演義小說所有的章節(jié)標題和章節(jié)內(nèi)容代碼如下:
import requests
from bs4 import BeautifulSoup
if __name__ == "__main__":
#對首頁的頁面數(shù)據(jù)進行爬取
headers = {
'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.121 Safari/537.36'
}
url = 'http://www.shicimingju.com/book/sanguoyanyi.html'
page_text = requests.get(url=url,headers=headers).text
#在首頁中解析出章節(jié)的標題和詳情頁的url
#實例化BeautifulSoup對象,需要將頁面源碼數(shù)據(jù)加載到該對象中
soup = BeautifulSoup(page_text,'lxml')
#解析章節(jié)標題和詳情頁的url
li_list = soup.select('.book-mulu > ul > li')
fp = open('./sanguo.txt','w',encoding='utf-8')
for li in li_list:
title = li.a.string
detail_url = 'http://www.shicimingju.com'+li.a['href']
#對詳情頁發(fā)起請求,解析出章節(jié)內(nèi)容
detail_page_text = requests.get(url=detail_url,headers=headers).text
#解析出詳情頁中相關(guān)的章節(jié)內(nèi)容
detail_soup = BeautifulSoup(detail_page_text,'lxml')
div_tag = detail_soup.find('div',class_='chapter_content')
#解析到了章節(jié)的內(nèi)容
content = div_tag.text
fp.write(title+':'+content+'\n')
print(title,'爬取成功?。?!')
運行結(jié)果:


以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。
相關(guān)文章
在SQLite-Python中實現(xiàn)返回、查詢中文字段的方法
今天小編就為大家分享一篇在SQLite-Python中實現(xiàn)返回、查詢中文字段的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2019-07-07
Python深度學(xué)習(xí)實戰(zhàn)PyQt5布局管理項目示例詳解
本文具體介紹基本的水平布局、垂直布局、柵格布局、表格布局和進階的嵌套布局和容器布局,最后通過案例帶小白創(chuàng)建一個有型的圖形布局窗口2021-10-10
python2.7無法使用pip的解決方法(安裝easy_install)
下面小編就為大家分享一篇python2.7無法使用pip的解決方法(安裝easy_install),具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2018-04-04
使用Scrapy框架爬取網(wǎng)頁并保存到Mysql的實現(xiàn)
本文主要介紹了使用Scrapy框架爬取網(wǎng)頁并保存到Mysql的實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2022-07-07
TensorFlow通過文件名/文件夾名獲取標簽,并加入隊列的實現(xiàn)
今天小編就為大家分享一篇TensorFlow通過文件名/文件夾名獲取標簽,并加入隊列的實現(xiàn),具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-02-02
Pycharm插件(Grep Console)自定義規(guī)則輸出顏色日志的方法
這篇文章主要介紹了Pycharm插件(Grep Console)自定義規(guī)則輸出顏色日志的方法,本文通過圖文并茂的形式給大家介紹的非常詳細,對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下2020-05-05

