最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python 用Redis簡單實(shí)現(xiàn)分布式爬蟲的方法

 更新時(shí)間:2017年11月23日 09:52:36   作者:zhou_1997  
本篇文章主要介紹了Python 用Redis簡單實(shí)現(xiàn)分布式爬蟲的方法,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧

Redis通常被認(rèn)為是一種持久化的存儲(chǔ)器關(guān)鍵字-值型存儲(chǔ),可以用于幾臺(tái)機(jī)子之間的數(shù)據(jù)共享平臺(tái)。

連接數(shù)據(jù)庫

注意:假設(shè)現(xiàn)有幾臺(tái)在同一局域網(wǎng)內(nèi)的機(jī)器分別為Master和幾個(gè)Slaver

Master連接時(shí)host為localhost即本機(jī)的ip

_db = redis.Reds(host='localhost', port=6379, db=0)

Slaver連接時(shí)的host也為Master的ip,端口port和數(shù)據(jù)庫db不寫時(shí)為默認(rèn)值6379、0

_db = redis.Redis(host='192.168.235.80')

Redis含列表、集合,字符串等幾種數(shù)據(jù)結(jié)構(gòu),具體詳細(xì)的幾種數(shù)據(jù)結(jié)構(gòu)的操作命令可查看Redis官網(wǎng)http://redis.io/commands,下面是對(duì)集合進(jìn)行操作的一些命令

_db.sadd(key, *values) # 插入指定values到集合中并返回新插入的的值的數(shù)量
_db.spop(self.key) # 隨機(jī)從集合中的得到一個(gè)元素將其從集合中刪除并作為返回值返回
_db.smembers(self.key) # 返回集合的所有元素
_db.delete(key) # 刪除整個(gè)集合, 成功返回1, 失敗返回0
_db.srandmember(self.key) # 從集合中隨機(jī)選取一個(gè)元素作為返回
_db.sismember(self.key, value) # 判斷指定value是否在本集合中,成功返回1,失敗返回0

例如,Master可利用redis將url上傳到數(shù)據(jù)庫

for i in range(20): # 將需爬取的糗事百科前20頁的url并存入urls集合
  url = 'http://www.qiushibaike.com/hot/page/%d/' % (i + 1)
  _db.sadd('urls', url) # 將url插入關(guān)鍵字urls集合中,若url已存在則不再插入

進(jìn)而Master和Slaver可從數(shù)據(jù)庫里獲取url

url = _db.spop('urls') # 隨機(jī)從urls集合中取出一個(gè)url返回并將其刪去

同理,Master可利用上面的方法將其他一些共用的資源上傳到數(shù)據(jù)庫,Slaver就可從數(shù)據(jù)庫下載需要的東西。下面是一個(gè)完整的例子

# coding=utf-8
import urllib2
import re
import time
import redis

headers = {'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Ubuntu Chromium/49.0.2623.108 Chrome/49.0.2623.108 Safari/537.36'}
job_redis = redis.Redis(host='192.168.235.80') # host為主機(jī)的IP,port和db為默認(rèn)值


class Clawer(object):

  identity = 'master' # 或slaver

  def __init__(self):
    if self.identity == 'master':
      for i in range(20): # 將需爬取的糗事百科前20頁的url并存入urls集合
        url = 'http://www.qiushibaike.com/hot/page/%d/' % (i + 1)
        job_redis.sadd('urls', url)
    self.main()

  def get_content(self):
    """
    從糗事百科中獲取故事
    :return: 故事列表
    """
    stories = []
    content_pattern = re.compile('<div class="content">([\w\W]*?)</div>([\w\W]*?)class="stats"') # 匹配故事內(nèi)容(第一空)和是否含有圖片(第二空)的模板
    pattern = re.compile('<.*?>') # 匹配包括括號(hào)及括號(hào)內(nèi)無關(guān)內(nèi)容的模板
    url = job_redis.spop('urls')
    while url: # 當(dāng)數(shù)據(jù)庫還存在網(wǎng)頁url,取出一個(gè)并爬取
      try:
        request = urllib2.Request(url, headers=headers)
        response = urllib2.urlopen(request)
        text = response.read()
      except urllib2.URLError, e: # 若出現(xiàn)網(wǎng)頁讀取錯(cuò)誤捕獲并輸出
        if hasattr(e, "reason"):
          print e.reason
      content = re.findall(content_pattern, text) # 獲取含模板內(nèi)容的列表
      for x in content:
        if "img" not in x[1]: # 過濾含圖片的故事
          x = re.sub(pattern, '', x[0])
          x = re.sub('\n', '', x)
          stories.append(x)
      url = job_redis.spop('urls')
      time.sleep(3)

    return stories

  def main(self):
    self.get_content()

if __name__ == '__main__':
  Clawer()

將此代碼在幾臺(tái)機(jī)器同時(shí)運(yùn)行,調(diào)節(jié)其身份為master或slaver,做到簡單的分布式爬蟲

以上就是本文的全部內(nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python?如何實(shí)現(xiàn)批量轉(zhuǎn)換視頻音頻的采樣率

    Python?如何實(shí)現(xiàn)批量轉(zhuǎn)換視頻音頻的采樣率

    這篇文章主要分享一個(gè)python代碼,可以將多個(gè)視頻中的音頻轉(zhuǎn)化為相同采樣率的視頻,具有一定的學(xué)習(xí)價(jià)值,感興趣的小伙伴可以了解一下
    2021-11-11
  • FP-growth算法發(fā)現(xiàn)頻繁項(xiàng)集——構(gòu)建FP樹

    FP-growth算法發(fā)現(xiàn)頻繁項(xiàng)集——構(gòu)建FP樹

    常見的挖掘頻繁項(xiàng)集算法有兩類,一類是Apriori算法,另一類是FP-growth。Apriori通過不斷的構(gòu)造候選集、篩選候選集挖掘出頻繁項(xiàng)集,需要多次掃描原始數(shù)據(jù),當(dāng)原始數(shù)據(jù)較大時(shí),磁盤I/O次數(shù)太多,效率比較低下
    2021-06-06
  • python線程安全及多進(jìn)程多線程實(shí)現(xiàn)方法詳解

    python線程安全及多進(jìn)程多線程實(shí)現(xiàn)方法詳解

    這篇文章主要介紹了python線程安全及多進(jìn)程多線程實(shí)現(xiàn)方法詳解,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-09-09
  • 5 分鐘讀懂Python 中的 Hook 鉤子函數(shù)

    5 分鐘讀懂Python 中的 Hook 鉤子函數(shù)

    這篇文章主要介紹了5 分鐘掌握 Python 中的 Hook 鉤子函數(shù),本文通過實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-12-12
  • tensorflow 獲取變量&打印權(quán)值的實(shí)例講解

    tensorflow 獲取變量&打印權(quán)值的實(shí)例講解

    今天小編就為大家分享一篇tensorflow 獲取變量&打印權(quán)值的實(shí)例講解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-06-06
  • pygame庫實(shí)現(xiàn)俄羅斯方塊小游戲

    pygame庫實(shí)現(xiàn)俄羅斯方塊小游戲

    這篇文章主要為大家詳細(xì)介紹了pygame庫實(shí)現(xiàn)俄羅斯方塊小游戲,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2019-10-10
  • Python二進(jìn)制轉(zhuǎn)化為十進(jìn)制數(shù)學(xué)算法詳解

    Python二進(jìn)制轉(zhuǎn)化為十進(jìn)制數(shù)學(xué)算法詳解

    這篇文章主要介紹了Python二進(jìn)制轉(zhuǎn)化為十進(jìn)制數(shù)學(xué)算法,同時(shí)在這里也給大家分享一個(gè)好用的內(nèi)置函數(shù)map(),需要的朋友可以參考下
    2023-01-01
  • 淺談python中copy和deepcopy中的區(qū)別

    淺談python中copy和deepcopy中的區(qū)別

    Python學(xué)習(xí)過程中會(huì)遇到許多問題,最近對(duì)copy和deepcopy略感困惑,下面對(duì)其進(jìn)行解答,需要的朋友可以參考。
    2017-10-10
  • python tiktoken的簡介、安裝、使用方法

    python tiktoken的簡介、安裝、使用方法

    tiktoken是OpenAI于近期開源的Python第三方模塊,該模塊主要實(shí)現(xiàn)了tokenizer的BPE(Byte pair encoding)算法,并對(duì)運(yùn)行性能做了極大的優(yōu)化,本文將介紹python tiktoken的簡介、安裝、使用方法,感興趣的朋友跟隨小編一起看看吧
    2023-10-10
  • ubuntu17.4下為python和python3裝上pip的方法

    ubuntu17.4下為python和python3裝上pip的方法

    今天小編就為大家分享一篇ubuntu17.4下為python和python3裝上pip的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-06-06

最新評(píng)論

集贤县| 西盟| 长治市| 佛坪县| 塘沽区| 临猗县| 金山区| 太和县| 林口县| 抚宁县| 安阳县| 泰州市| 武山县| 南投县| 昌都县| 南丹县| 舒兰市| 永寿县| 昭觉县| 宁海县| 平利县| 汝州市| 宽城| 茌平县| 科技| 静宁县| 龙海市| 镇巴县| 梅河口市| 阜平县| 济宁市| 瓦房店市| 谢通门县| 云南省| 察哈| 东海县| 梁平县| 刚察县| 海林市| 新建县| 炎陵县|