超簡(jiǎn)單的scrapy實(shí)現(xiàn)ip動(dòng)態(tài)代理與更換ip的方法實(shí)現(xiàn)
簡(jiǎn)單實(shí)現(xiàn)ip代理,為了不賣(mài)廣告,
請(qǐng)自行準(zhǔn)備一個(gè)ip代理的平臺(tái)
例如我用的這個(gè)平臺(tái),每次提取10個(gè)ip

從上面可以看到數(shù)據(jù)格式是文本,換行是\r\n,訪問(wèn)鏈接之后大概就是長(zhǎng)這樣的,scrapy里面的ip需要加上前綴http://
例如:http://117.95.41.21:34854

OK,那現(xiàn)在已經(jīng)準(zhǔn)備好了ip了,先給你們屢一下思路。
ip池和計(jì)數(shù)器放在setting文件
第一次請(qǐng)求的時(shí)候要填滿ip池,所以在爬蟲(chóng)文件的start_requests函數(shù)下手
更換ip的地方是middlewares的下載器中間件類的process_request函數(shù),因?yàn)槊總€(gè)請(qǐng)求發(fā)起前都會(huì)經(jīng)過(guò)這個(gè)函數(shù)
首先是setting文件,其實(shí)就是加兩句代碼
count = {'count': 0}
ipPool = []
還有就是開(kāi)啟下載器中間件,注意是下面那個(gè)download的類,中間件的process_request函數(shù)的時(shí)候才能生效

下載器中間件的process_request函數(shù),進(jìn)行ip代理和固定次數(shù)更還ip代理池
# 記得導(dǎo)包
from 你的項(xiàng)目.settings import ipPool, count
import random
import requests
def process_request(self, request, spider):
# 隨機(jī)選中一個(gè)ip
ip = random.choice(ipPool)
print('當(dāng)前ip', ip, '-----', count['count'])
# 更換request的ip----------這句是重點(diǎn)
request.meta['proxy'] = ip
# 如果循環(huán)大于某個(gè)值,就清理ip池,更換ip的內(nèi)容
if count['count'] > 50:
print('-------------切換ip------------------')
count['count'] = 0
ipPool.clear()
ips = requests.get('你的ip獲取的地址')
for ip in ips.text.split('\r\n'):
ipPool.append('http://' + ip)
# 每次訪問(wèn),計(jì)數(shù)器+1
count['count'] += 1
return None
最后就是爬蟲(chóng)文件的start_requests函數(shù),就是第一次發(fā)請(qǐng)求前要先填滿ip池的ip
# 記得導(dǎo)包
from 你的項(xiàng)目.settings import ipPool
import random
import requests
def start_requests(self):
# 第一次請(qǐng)求發(fā)起前先填充一下ip池
ips = requests.get('你的ip獲取的地址')
for ip in ips.text.split('\r\n'):
ipPool.append('http://' + ip)
簡(jiǎn)單的ip代理以及固定次數(shù)就更換ip池就完成了
到此這篇關(guān)于超簡(jiǎn)單的scrapy實(shí)現(xiàn)ip動(dòng)態(tài)代理與更換ip的方法實(shí)現(xiàn)的文章就介紹到這了,更多相關(guān)scrapy ip動(dòng)態(tài)代理與更換ip內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
分享十個(gè)Python提高工作效率的自動(dòng)化腳本
在這個(gè)自動(dòng)化時(shí)代,我們有很多重復(fù)無(wú)聊的工作要做。 想想這些你不再需要一次又一次地做的無(wú)聊的事情,讓它自動(dòng)化,讓你的生活更輕松。本文分享了10個(gè)Python自動(dòng)化腳本,希望對(duì)大家有所幫助2022-10-10
使用Python設(shè)置Excel單元格數(shù)字的顯示格式
Python語(yǔ)言可以幫助我們靈活設(shè)置Excel單元格的數(shù)字格式,保證數(shù)據(jù)的一致性與專業(yè)標(biāo)準(zhǔn),本文將介紹如何使用Python對(duì)Excel工作表中單元格的數(shù)字格式進(jìn)行設(shè)置,文中通過(guò)代碼示例介紹的非常詳細(xì),需要的朋友可以參考下2024-06-06
Python寫(xiě)一個(gè)簡(jiǎn)單的api接口的實(shí)現(xiàn)
本文主要介紹了Python寫(xiě)一個(gè)簡(jiǎn)單的api接口的實(shí)現(xiàn),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2023-02-02
python是先運(yùn)行metaclass還是先有類屬性解析
這篇文章主要為大家介紹了python是先運(yùn)行metaclass還是先有類屬性的問(wèn)題原理解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-05-05
python paramiko遠(yuǎn)程服務(wù)器終端操作過(guò)程解析
這篇文章主要介紹了python paramiko遠(yuǎn)程服務(wù)器終端操作過(guò)程解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2019-12-12
一篇文章搞懂Python反斜杠的相關(guān)問(wèn)題
這篇文章主要給大家介紹了如何通過(guò)一篇文章搞懂Python反斜杠的相關(guān)問(wèn)題,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2021-03-03
python查找特定名稱文件并按序號(hào)、文件名分行打印輸出的方法
這篇文章主要介紹了python查找特定名稱文件并按序號(hào)、文件名分行打印輸出的方法,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2020-04-04
python實(shí)現(xiàn)代理服務(wù)功能實(shí)例
本文分析了代理服務(wù)的原理,并使用PYTHON實(shí)現(xiàn)了一個(gè)簡(jiǎn)單的代理服務(wù)功能供大家參考使用2013-11-11

