最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python爬蟲框架scrapy下載中間件的編寫方法

 更新時間:2022年03月25日 09:00:10   作者:S++  
這篇文章主要介紹了python爬蟲框架scrapy下載中間件,在每一個scrapy工程中都有一個名為 middlewares.py 的文件,這個就是中間件文件,本文通過示例代碼給大家介紹的非常詳細,需要的朋友參考下吧

下載中間件

在每一個scrapy工程中都有一個名為 middlewares.py 的文件,這個就是中間件文件
其中下載中間件的類為 XxxDownloaderMiddleware
其中有這么幾個方法

def process_request(self, request, spider):
return None
def process_response(self, request, response, spider):
return response
def process_exception(self, request, exception, spider):
pass

process_request

這個方法是用來攔截請求的,我們可以將UA偽裝寫在這個方法中。
UA池這個屬性需要自己編寫

def process_request(self, request, spider):
        # UA偽裝,從UA池隨機一個
        request.headers['User-Agent'] = random.choice(self.user_agent_list)
        return None

process_response

這個方法是用來攔截響應的,我們可以在這里篡改響應數(shù)據。
如果我們將selenium和scrapy結合就可以請求那些動態(tài)加載的數(shù)據了。

 def process_response(self, request, response, spider):
        # 瀏覽器對象
        bro = spider.bro
        # 參數(shù)spider是爬蟲對象
        # 挑選出指定響應對象進行篡改url->request->response
        bro.get(request.url)
        page_text = bro.page_source  # 包含了動態(tài)加載的數(shù)據
        # 針對定位到的response篡改
        # 實例化新的響應對象(包含動態(tài)加載的數(shù)據)
        response = HtmlResponse(url=bro.current_url, body=page_text, encoding='utf-8', request=request)
        return response

在爬蟲文件中需要預先創(chuàng)建selenium的瀏覽器對象

import scrapy
from selenium import webdriver
from selenium.webdriver.chrome.service import Service
from selenium.webdriver import ChromeOptions

class XxxSpider(scrapy.Spider):
    name = 'xxx'
    # allowed_domains = ['www.xxx.com']
    start_urls = ['……']
    def __init__(self):
        service = Service('/Users/soutsukyou/PyCharm_Workspace/網絡爬蟲/study_selenium/chromedriver')
        chrome_options = ChromeOptions()
        # 規(guī)避檢測
        chrome_options.add_experimental_option('excludeSwitches', ['enable-automation'])
        # 實例化瀏覽器
        self.bro = webdriver.Chrome(service=service, options=chrome_options)

process_exception

這是用來攔截發(fā)生異常的請求對象,一般我們可以在這里寫代理ip。
兩個代理ip池屬性需要自己編寫

 def process_exception(self, request, exception, spider):
        # 可以設置代理ip
        if request.url.split(':')[0] == 'http':
            request.meta['proxy'] = 'http://'+random.choice(self.PROXY_http)
        if request.url.split(':')[0] == 'https':
            request.meta['proxy'] = 'https://'+random.choice(self.PROXY_https)
        # 重新請求發(fā)送
        return request

其它

我們需要在settings.py中開啟下載中間件才能使其生效

# Enable or disable downloader middlewares
# See https://docs.scrapy.org/en/latest/topics/downloader-middleware.html
DOWNLOADER_MIDDLEWARES = {
   'xxx.middlewares.XxxDownloaderMiddleware': 543,
}

到此這篇關于python爬蟲框架scrapy下載中間件的編寫方法的文章就介紹到這了,更多相關python scrapy中間件內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • 使用Pygal庫創(chuàng)建可縮放的矢量圖表的操作方法

    使用Pygal庫創(chuàng)建可縮放的矢量圖表的操作方法

    在本文中,我們探討了如何使用Pygal庫創(chuàng)建可縮放的矢量圖表,首先,我們介紹了Pygal的基本概念和安裝方法,然后通過多個示例演示了如何創(chuàng)建各種類型的圖表,包括折線圖、柱狀圖、餅圖、散點圖、雷達圖和地圖等,需要的朋友可以參考下
    2024-05-05
  • Python中進行表單處理的方法詳解

    Python中進行表單處理的方法詳解

    這篇文章主要為大家詳細介紹了Python中進行表單處理的方法,分別是利用Flask和Flask-WTF處理表單,文中的示例代碼講解詳細,感興趣的小伙伴可以了解一下
    2023-12-12
  • 改進Django中的表單的簡單方法

    改進Django中的表單的簡單方法

    這篇文章主要介紹了改進Django中的表單的簡單方法,Django是Python重多人氣框架中最著名的一個,需要的朋友可以參考下
    2015-07-07
  • Python使用sax模塊解析XML文件示例

    Python使用sax模塊解析XML文件示例

    這篇文章主要介紹了Python使用sax模塊解析XML文件,結合實例形勢分析了Python使用sax模塊針對xml文件進行讀取、解析、內容處理等相關操作技巧,需要的朋友可以參考下
    2019-04-04
  • python可擴展的Blender 3D插件開發(fā)匯總

    python可擴展的Blender 3D插件開發(fā)匯總

    這篇文章主要為大家介紹了python可擴展的Blender 3D插件開發(fā)匯總,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2023-09-09
  • python創(chuàng)建列表和向列表添加元素的實現(xiàn)方法

    python創(chuàng)建列表和向列表添加元素的實現(xiàn)方法

    下面小編就為大家分享一篇python創(chuàng)建列表和向列表添加元素的實現(xiàn)方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2017-12-12
  • Python記錄numpy.empty()函數(shù)引發(fā)的問題及解決

    Python記錄numpy.empty()函數(shù)引發(fā)的問題及解決

    這篇文章主要介紹了Python記錄numpy.empty()函數(shù)引發(fā)的問題及解決方案,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-03-03
  • Pycharm導入anaconda環(huán)境的教程圖解

    Pycharm導入anaconda環(huán)境的教程圖解

    這篇文章主要介紹了Pycharm導入anaconda環(huán)境的教程,本文通過圖文并茂的形式給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-07-07
  • Python讀取Excel表格,并同時畫折線圖和柱狀圖的方法

    Python讀取Excel表格,并同時畫折線圖和柱狀圖的方法

    今天小編就為大家分享一篇Python讀取Excel表格,并同時畫折線圖和柱狀圖的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-10-10
  • 如何利用python實現(xiàn)詞頻統(tǒng)計功能

    如何利用python實現(xiàn)詞頻統(tǒng)計功能

    詞頻統(tǒng)計用途很廣泛,比如我們統(tǒng)計某篇文章中的用詞頻率,網絡熱點詞匯,再比如起名排行榜呀、熱門旅游景點排行榜呀什么的,其實也都可以套用,這篇文章主要給大家介紹了關于如何利用python實現(xiàn)詞頻統(tǒng)計功能的相關資料,需要的朋友可以參考下
    2021-10-10

最新評論

宁南县| 迭部县| 安丘市| 泾源县| 板桥市| 定安县| 商城县| 三门县| 琼中| 子洲县| 盐山县| 大新县| 穆棱市| 泽普县| 龙川县| 容城县| 宿州市| 普定县| 中西区| 临朐县| 南昌市| 涡阳县| 牙克石市| 兴山县| 宣化县| 清苑县| 崇礼县| 巴青县| 阿拉善盟| 明星| 永春县| 渝中区| 惠来县| 老河口市| 隆德县| 丘北县| 武穴市| 芦山县| 望江县| 社会| 托克逊县|