最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲的兩套解析方法和四種爬蟲實(shí)現(xiàn)過(guò)程

 更新時(shí)間:2018年07月20日 08:14:39   作者:Python火火  
本文想針對(duì)某一網(wǎng)頁(yè)對(duì) python 基礎(chǔ)爬蟲的兩大解析庫(kù)( BeautifulSoup 和 lxml )和幾種信息提取實(shí)現(xiàn)方法進(jìn)行分析,及同一網(wǎng)頁(yè)爬蟲的四種實(shí)現(xiàn)方式,需要的朋友參考下吧

對(duì)于大多數(shù)朋友而言,爬蟲絕對(duì)是學(xué)習(xí) python 的最好的起手和入門方式。因?yàn)榕老x思維模式固定,編程模式也相對(duì)簡(jiǎn)單,一般在細(xì)節(jié)處理上積累一些經(jīng)驗(yàn)都可以成功入門。本文想針對(duì)某一網(wǎng)頁(yè)對(duì)  python 基礎(chǔ)爬蟲的兩大解析庫(kù)(  BeautifulSoup 和  lxml )和幾種信息提取實(shí)現(xiàn)方法進(jìn)行分析,以開  python 爬蟲之初見。

基礎(chǔ)爬蟲的固定模式

筆者這里所談的基礎(chǔ)爬蟲,指的是不需要處理像異步加載、驗(yàn)證碼、代理等高階爬蟲技術(shù)的爬蟲方法。一般而言,基礎(chǔ)爬蟲的兩大請(qǐng)求庫(kù) urllib 和  requests 中  requests 通常為大多數(shù)人所鐘愛,當(dāng)然  urllib 也功能齊全。兩大解析庫(kù)  BeautifulSoup 因其強(qiáng)大的  HTML 文檔解析功能而備受青睞,另一款解析庫(kù)  lxml 在搭配  xpath 表達(dá)式的基礎(chǔ)上也效率提高。就基礎(chǔ)爬蟲來(lái)說(shuō),兩大請(qǐng)求庫(kù)和兩大解析庫(kù)的組合方式可以依個(gè)人偏好來(lái)選擇。

筆者喜歡用的爬蟲組合工具是:

  • requests +  BeautifulSoup
  • requests +  lxml

同一網(wǎng)頁(yè)爬蟲的四種實(shí)現(xiàn)方式

筆者以騰訊新聞首頁(yè)的新聞信息抓取為例。

首頁(yè)外觀如下:

 

比如說(shuō)我們想抓取每個(gè)新聞的標(biāo)題和鏈接,并將其組合為一個(gè)字典的結(jié)構(gòu)打印出來(lái)。首先查看 HTML 源碼確定新聞標(biāo)題信息組織形式。

 

可以目標(biāo)信息存在于 em 標(biāo)簽下  a 標(biāo)簽內(nèi)的文本和  href 屬性中??芍苯永?nbsp; requests 庫(kù)構(gòu)造請(qǐng)求,并用  BeautifulSoup 或者  lxml 進(jìn)行解析。

方式一: requests +  BeautifulSoup +  select css選擇器

 # select method
 import requests
 from bs4 import BeautifulSoup
 headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'} 
 url = 'http://news.qq.com/' 
 Soup = BeautifulSoup(requests.get(url=url, headers=headers).text.encode("utf-8"), 'lxml')
 em = Soup.select('em[class="f14 l24"] a')
 for i in em:
   title = i.get_text()
   link = i['href']
   print({'標(biāo)題': title, 
 '鏈接': link
   })

很常規(guī)的處理方式,抓取效果如下:

 

方式二: requests +  BeautifulSoup +  find_all 進(jìn)行信息提取

 # find_all method
 import requests
 from bs4 import BeautifulSoup
 headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'}
 url = 'http://news.qq.com/'
 Soup = BeautifulSoup(requests.get(url=url, headers=headers).text.encode("utf-8"), 'lxml') 
 em = Soup.find_all('em', attrs={'class': 'f14 l24'})for i in em:
   title = i.a.get_text()
   link = i.a['href']
   print({'標(biāo)題': title,
      '鏈接': link
   })

同樣是 requests +  BeautifulSoup 的爬蟲組合,但在信息提取上采用了  find_all 的方式。效果如下:

 

方式三: requests +  lxml/etree +  xpath 表達(dá)式

 # lxml/etree method
 import requests
 from lxml import etree 
 headers = {  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'}
 url = 'http://news.qq.com/'
 html = requests.get(url = url, headers = headers)
 con = etree.HTML(html.text)
 title = con.xpath('//em[@class="f14 l24"]/a/text()')
 link = con.xpath('//em[@class="f14 l24"]/a/@href')
 for i in zip(title, link):
   print({'標(biāo)題': i[0],
 '鏈接': i[1]
   })

使用 lxml 庫(kù)下的  etree 模塊進(jìn)行解析,然后使用  xpath 表達(dá)式進(jìn)行信息提取,效率要略高于  BeautifulSoup +  select 方法。這里對(duì)兩個(gè)列表的組合采用了  zip 方法。python學(xué)習(xí)交流群:125240963效果如下:

 

方式四: requests +  lxml/html/fromstring +  xpath 表達(dá)式

 # lxml/html/fromstring method
 import requests
 import lxml.html as HTML 
 headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'}
 url = 'http://news.qq.com/'
 con = HTML.fromstring(requests.get(url = url, headers = headers).text)
 title = con.xpath('//em[@class="f14 l24"]/a/text()')
 link = con.xpath('//em[@class="f14 l24"]/a/@href')
 for i in zip(title, link):
   print({'標(biāo)題': i[0],'鏈接': i[1]
   })

跟方法三類似,只是在解析上使用了 lxml 庫(kù)下的  html.fromstring 模塊。抓取效果如下:

 

很多人覺得爬蟲有點(diǎn)難以掌握,因?yàn)橹R(shí)點(diǎn)太多,需要懂前端、需要python熟練、還需要懂?dāng)?shù)據(jù)庫(kù),更不用說(shuō)正則表達(dá)式、XPath表達(dá)式這些。其實(shí)對(duì)于一個(gè)簡(jiǎn)單網(wǎng)頁(yè)的數(shù)據(jù)抓取,不妨多嘗試幾種抓取方案,舉一反三,也更能對(duì)python爬蟲有較深的理解。長(zhǎng)此以往,對(duì)于各類網(wǎng)頁(yè)結(jié)構(gòu)都有所涉獵,自然經(jīng)驗(yàn)豐富,水到渠成。

總結(jié)

以上所述是小編給大家介紹的Python爬蟲的兩套解析方法和四種爬蟲實(shí)現(xiàn)過(guò)程,希望對(duì)大家有所幫助,如果大家有任何疑問(wèn)請(qǐng)給我留言,小編會(huì)及時(shí)回復(fù)大家的。在此也非常感謝大家對(duì)腳本之家網(wǎng)站的支持!

相關(guān)文章

  • pytorch 多分類問(wèn)題,計(jì)算百分比操作

    pytorch 多分類問(wèn)題,計(jì)算百分比操作

    這篇文章主要介紹了pytorch 多分類問(wèn)題,計(jì)算百分比操作,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-07-07
  • Python輕松搞定視頻剪輯重復(fù)性工作問(wèn)題

    Python輕松搞定視頻剪輯重復(fù)性工作問(wèn)題

    這篇文章主要介紹了Python輕松搞定視頻剪輯重復(fù)性工作問(wèn)題,大家做視頻剪輯的時(shí)候,還在重復(fù)性工作嗎?今天,小編來(lái)教大家如何利用Python幫你搞定這些重復(fù)性的剪輯工作,需要的朋友可以參考一下
    2021-12-12
  • PyTorch中的拷貝與就地操作詳解

    PyTorch中的拷貝與就地操作詳解

    這篇文章主要給大家介紹了關(guān)于PyTorch中拷貝與就地操作的相關(guān)資料,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2020-12-12
  • python Requsets下載開源網(wǎng)站的代碼(帶索引 數(shù)據(jù))

    python Requsets下載開源網(wǎng)站的代碼(帶索引 數(shù)據(jù))

    這篇文章主要介紹了python Requsets下載開源網(wǎng)站的代碼(帶索引 數(shù)據(jù)),本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-04-04
  • Python使用到第三方庫(kù)PyMuPDF圖片與pdf相互轉(zhuǎn)換

    Python使用到第三方庫(kù)PyMuPDF圖片與pdf相互轉(zhuǎn)換

    今天為大家介紹個(gè)比較簡(jiǎn)單的Python第三方庫(kù)PyMuPDF進(jìn)行圖片和pdf之間的相互轉(zhuǎn)換,以下就是利用PyMuPDF進(jìn)行pdf與圖片之間的互轉(zhuǎn)
    2019-05-05
  • python基于pexpect庫(kù)自動(dòng)獲取日志信息

    python基于pexpect庫(kù)自動(dòng)獲取日志信息

    這篇文章主要介紹了python基于pexpect庫(kù)自動(dòng)獲取日志信息的方法,幫助大家更好的利用python高效辦公,感興趣的朋友可以了解下
    2021-02-02
  • 使用python實(shí)現(xiàn)希爾、計(jì)數(shù)、基數(shù)基礎(chǔ)排序的代碼

    使用python實(shí)現(xiàn)希爾、計(jì)數(shù)、基數(shù)基礎(chǔ)排序的代碼

    希爾排序是一個(gè)叫希爾的數(shù)學(xué)家提出的一種優(yōu)化版本的插入排序。這篇文章主要介紹了使用python實(shí)現(xiàn)希爾、計(jì)數(shù)、基數(shù)基礎(chǔ)排序,需要的朋友可以參考下
    2019-12-12
  • python實(shí)現(xiàn)批量下載新浪博客的方法

    python實(shí)現(xiàn)批量下載新浪博客的方法

    這篇文章主要介紹了python實(shí)現(xiàn)批量下載新浪博客的方法,涉及Python頁(yè)面抓取的相關(guān)實(shí)現(xiàn)技巧,需要的朋友可以參考下
    2015-06-06
  • python基礎(chǔ)之遞歸函數(shù)

    python基礎(chǔ)之遞歸函數(shù)

    這篇文章主要介紹了python遞歸函數(shù),實(shí)例分析了Python中返回一個(gè)返回值與多個(gè)返回值的方法,需要的朋友可以參考下
    2021-10-10
  • 在Python程序和Flask框架中使用SQLAlchemy的教程

    在Python程序和Flask框架中使用SQLAlchemy的教程

    SQLAlchemy為Python程序與SQL語(yǔ)句之間建立了映射,是Python操作數(shù)據(jù)庫(kù)的利器,這里我們將來(lái)看在Python程序和Flask框架中使用SQLAlchemy的教程,需要的朋友可以參考下
    2016-06-06

最新評(píng)論

运城市| 西乌| 封开县| 水富县| 山阴县| 阿坝| 固原市| 扎鲁特旗| 崇明县| 康马县| 武陟县| 广昌县| 广南县| 克拉玛依市| 万安县| 苏尼特右旗| 二连浩特市| 静宁县| 娱乐| 海南省| 岳池县| 壶关县| 汶上县| 西宁市| 萝北县| 苍梧县| 石嘴山市| 兴宁市| 平度市| 通州区| 封开县| 丽水市| 定州市| 全椒县| 蚌埠市| 罗山县| 荣昌县| 东安县| 延吉市| 衡水市| 华坪县|