最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python打造爬蟲代理池過程解析

 更新時間:2019年08月15日 10:49:42   作者:Summer哥  
這篇文章主要介紹了python打造爬蟲代理池過程解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下

最近在使用爬蟲爬取數(shù)據(jù)時,經(jīng)常會返回403代碼,大致意思是該IP訪問過于頻繁,被限制訪問。限制IP訪問網(wǎng)站最常用的反爬手段了,其實破解也很容易,就是在爬取網(wǎng)站是使用代理即可,這個IP被限制了,就使用其他的IP。對于高大上的公司來說,他們基本都使用收費的代理,基本不會有什么問題,比較穩(wěn)定。像我這樣的矮矬窮,肯定是用不起收費的代理。一般都是使用國內(nèi)免費的代理,網(wǎng)上也有很多提供免費的代理。

很多人都是從網(wǎng)上爬取一批免費的代理IP,存放在存儲媒介中,例如excel文件或者數(shù)據(jù)庫。定時維護代理,保證代理可用。這個做法有個缺點,有些機器上并沒有裝有excel或者mysql、redis等數(shù)據(jù)庫,這就導致了的代理池無法正常使用。

我之前是做java開發(fā)的,經(jīng)常會把一些常用的數(shù)據(jù)放在ArrayList中,使用起來非常方便,效率高,因此借鑒之前在java方面的經(jīng)驗,將代理IP爬取下來存放在list列表中中,將list列表當做一個代理池,經(jīng)常維護這個池里的代理。

我經(jīng)常爬取免費代理的網(wǎng)站xicidaili swei360等,這些免費的代理足夠我使用了,能夠應(yīng)付大多數(shù)的爬蟲工作。爬取過程需要用到requests和pyquery庫,沒有安裝的同學自行安裝。

首先介紹下爬取xicidaili網(wǎng)站的過程, 要先定義一個方法用于抓取xicidaili網(wǎng)站的,參數(shù)有兩個,一個是url,另外一個是要爬取代理網(wǎng)頁的頁數(shù),也就是要爬幾頁,方法如下:

def get_xicidaili_proxy(url,page):
  for i in range(1,page):
    headers = {
      "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}
    response = requests.get(url + str(i), headers=headers)

    html = response.text
    doc = pq(html)
    ip_list = doc('#ip_list')('tr:gt(0)').items()
    for item in ip_list:
      ip = item.find('td:nth-child(2)').text()
      port = item.find('td:nth-child(3)').text()
      http_type = item.find('td:nth-child(6)').text()
      proxy_ip = http_type + "://" + ip + ":" + port
      if http_type == 'HTTP':
        http_proxy_pool.append(proxy_ip)
      elif http_type == 'HTTPS':
        https_proxy_pool.append(proxy_ip)
      # print(proxy_ip)

定義了http_proxy_pool和https_proxy_pool兩個list變量,用于存儲http類型和https類型的代理。 使用PyQuery根據(jù)css偽選擇器提取出ip,端口和http類型信息,并按照http:// + ip+port的方式組合成一個字符串,存儲在已經(jīng)定義好的http_proxy_tool和https_proxy_pool變量中。

爬取swei360網(wǎng)站代理的方法就不貼出來了,原理和爬取xicidaili網(wǎng)站是一樣的。

一個代理在使用之前要判斷是否可用,我們使用request的get請求的返回代碼判斷代理是否可用,返回200,就說明代理可用,返回其他的代碼就表示代理不可用,代碼如下:

def detect_proxy(test_url,http_type,proxy):
  headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}
  proxy={
    http_type : proxy
  }
  try:
    response = requests.get(test_url,proxies=proxy,headers=headers)
    if response.status_code in [200]:
      print('代理可用',proxy)
      return True
    else:
      print('代理不可用', proxy);
      delete_proxy(http_type,proxy)
      return False
  except(requests.exceptions.ProxyError,RequestException):
    print('代理不可用', proxy)
    delete_proxy(http_type, proxy)
    return False

定義了detect_proxy方法用于檢測代理是否可用,有三個參數(shù),分別是測試網(wǎng)址,代理類型(http和https)和代理IP。當requests的請求返回200代碼時,就表示該代理可用,返回True,否則就是不可用,返回False。當遇到request異常或者其他的錯誤也認為代理不可用,返回False。對于不可用的代理,要從代理池中刪除。

從代理池中獲取代理時,我們使用的是從代理池中隨機返回一個代理,這樣就避免經(jīng)常使用一個代理,從而遭到拒絕訪問。代碼如下:

def get_https_proxy():
  proxy_ip = random.choice(https_proxy_pool)
  return proxy_ip

def get_http_proxy():
  proxy_ip = random.choice(http_proxy_pool)
  return proxy_ip

為了保證代理的可用,當檢測到一個代理不可用時,要及時的清理掉。就是從http_proxy_pool和https_proxy_pool列表中刪除。

一個簡單的爬蟲代理池已經(jīng)搭建好,總結(jié)下爬蟲代理池搭建的過程:

  • 從免費的代理網(wǎng)站上爬取代理信息,存放在列表中。
  • 提供從代理池中隨機獲取代理的方法。http類型的網(wǎng)站要使用http類型的代理,https類型的網(wǎng)站要使用https類型的代理,因此分別提供獲取http和https類型代理的方法。
  • 提供檢測代理是否可用的方法,代理可用返回True,不可用返回False。
  • 提供刪除代理的方法。

這個代理池其實相當?shù)暮唵?,有一個弊端就是在檢測代理是否可用時,如果返回的不是200代碼就認為代理不可用,返回其他代碼的情況有很多,例如網(wǎng)絡(luò)不可用、測試網(wǎng)站不可訪問等。比較好的做法是給每個代理設(shè)置一個分值,例如10分,如果檢測到不可用就減1,當分數(shù)為0時,就確定該代理不可用,直接從代理池中移除。檢測到代理可用,就將分數(shù)設(shè)為10分。

這種做法給每個檢測到不可用代理一個改邪歸正的機會,不至于一刀切的拋棄掉。

以上就是本文的全部內(nèi)容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • python numpy數(shù)組的索引和切片的操作方法

    python numpy數(shù)組的索引和切片的操作方法

    NumPy 是一個 Python 包。 它代表 “Numeric Python”。它是一個由多維數(shù)組對象和用于處理數(shù)組的例程集合組成的庫。這篇文章主要介紹了python numpy 數(shù)組的索引和切片,需要的朋友可以參考下
    2018-10-10
  • Python?itertools中accumulate函數(shù)用法及使用運用詳細講解

    Python?itertools中accumulate函數(shù)用法及使用運用詳細講解

    這篇文章主要介紹了Python的itertools庫中的accumulate函數(shù),該函數(shù)可以計算累積和或通過指定函數(shù)進行累積運算,文中通過代碼將用法介紹的非常詳細,需要的朋友可以參考下
    2025-02-02
  • python包管理工具pip全面解析

    python包管理工具pip全面解析

    這篇文章主要為大家介紹了python包管理工具pip的全面解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2023-12-12
  • Python如何讀取表頭在中間行的CSV

    Python如何讀取表頭在中間行的CSV

    Pandas是一個非常強大的數(shù)據(jù)處理庫,可以方便地讀取、處理和寫入CSV文件,下面我們就來看看Python如何使用Pandas讀取表頭在中間行的CSV吧
    2024-11-11
  • 詳解Python字符串對象的實現(xiàn)

    詳解Python字符串對象的實現(xiàn)

    本文介紹了 python 內(nèi)部是如何管理字符串對象,以及字符串查找操作是如何實現(xiàn)的,感興趣的小伙伴們可以參考一下
    2015-12-12
  • 在Python 中實現(xiàn)圖片加框和加字的方法

    在Python 中實現(xiàn)圖片加框和加字的方法

    今天小編就為大家分享一篇在Python 中實現(xiàn)圖片加框和加字的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01
  • Python+opencv+pyaudio實現(xiàn)帶聲音屏幕錄制

    Python+opencv+pyaudio實現(xiàn)帶聲音屏幕錄制

    今天小編就為大家分享一篇Python+opencv+pyaudio實現(xiàn)帶聲音屏幕錄制,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12
  • Python中字典的setdefault()方法教程

    Python中字典的setdefault()方法教程

    在學習python字典操作方法時,感覺setdefault()方法,比字典的其它基本操作方法更難理解的同學比較多,所以想著總結(jié)以下,下面這篇文章主要給大家介紹了Python中字典的setdefault()方法,需要的朋友可以參考借鑒,下面來一起看看吧。
    2017-02-02
  • python plt如何保存為emf圖像

    python plt如何保存為emf圖像

    這篇文章主要介紹了python plt如何保存為emf圖像問題,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2023-09-09
  • Python多線程Threading、子線程與守護線程實例詳解

    Python多線程Threading、子線程與守護線程實例詳解

    這篇文章主要介紹了Python多線程Threading、子線程與守護線程,結(jié)合實例形式詳細分析了Python多線程Threading、子線程與守護線程相關(guān)概念、原理、用法與操作注意事項,需要的朋友可以參考下
    2020-03-03

最新評論

南投县| 远安县| 息烽县| 曲阳县| 淮南市| 来安县| 利津县| 兴义市| 凤翔县| 新营市| 水富县| 谢通门县| 揭东县| 广水市| 东台市| 岱山县| 嘉鱼县| 乌审旗| 清水县| 宜城市| 图片| 甘孜县| 长岛县| 宽甸| 三穗县| 仙游县| 大化| 蕲春县| 凉山| 天全县| 陈巴尔虎旗| 织金县| 嘉荫县| 冷水江市| 利辛县| 乌苏市| 东明县| 瑞丽市| 淮北市| 宜都市| 金川县|