最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python實戰(zhàn)scrapy操作cookie爬取博客涉及browsercookie

 更新時間:2021年11月13日 16:40:56   作者:夢想橡皮擦  
這篇文章主要為大家介紹了python實戰(zhàn)scrapy操作cookie爬取博客涉及browsercookie,下面來學習一下 scrapy 操作 Cookie來爬取博客吧

browsercookie 知識鋪墊

第一個要了解的知識點是使用 browsercookie 獲取瀏覽器 cookie ,該庫使用命令 pip install browsercookie 安裝即可。

接下來獲取 firefox 瀏覽器的 cookie,不使用 chrome 谷歌瀏覽器的原因是在 80 版本之后,其 cookie 的加密方式進行了修改,所以使用 browsercookie 模塊會出現(xiàn)如下錯誤

win32crypt must be available to decrypt Chrome cookie on Windows

獲取 cookie 的代碼如下所示:

import browsercookie

firefox_cookiejar = browsercookie.firefox()

for c in firefox_cookiejar:
    print(c)

運行代碼,輸出如下格式內容。

Python 爬蟲 cookie 實戰(zhàn)博客,涉及 browsercookie 與 scrapy

獲取了 cookies 之后,就可以訪問之后登錄后才能訪問的頁面了(前提是在火狐瀏覽器登錄過一次)。

下面拿 某管理中心舉例,在火狐瀏覽器登錄過之后,使用 browsercookie 獲取 cookie 之后,就可以直接訪問后臺接口。

import browsercookie
import requests

firefox_cookiejar = browsercookie.firefox()

# for c in firefox_cookiejar:
#     print(c)

res = requests.get("https://img-home.csdnimg.cn/data_json/jsconfig/menu_path.json", cookies=firefox_cookiejar)
print(res.text)

可以直接獲取到后臺菜單。

Python 爬蟲 cookie 實戰(zhàn)博客,涉及 browsercookie 與 scrapy

使用 browsercookie 實現(xiàn) 自動化點贊

在 scrapy 框架中,已經(jīng)內置了一個 CookiesMiddleware 用于處理 cookies,我們這次通過繼承 CookiesMiddleware ,然后使用 browsercookie 庫完成點贊器的研發(fā)(僅做了一個測試案例,沒有使用并發(fā)哦)

打開 middlewares.py 文件,編寫自定義的類:

from scrapy.downloadermiddlewares.cookies import CookiesMiddleware
import browsercookie
class BrowserCookiesDownloaderMiddleware(CookiesMiddleware):
    def __init__(self, debug=False):
        super().__init__(debug)
        self.load_browser_cookies()

    def load_browser_cookies(self):
        # 注意這個地方的名字叫做 firefox
        jar = self.jars['firefox']
        firefox_cookiejar = browsercookie.firefox()
        for cookie in firefox_cookiejar:
            jar.set_cookie(cookie)

上述類的核心內容是使用 browsercookie 對瀏覽器的 cookie 進行提取,存儲到 CookieJar 類型的字典 jars 中,后續(xù)請求的時候,在進行調用。

同步在 settings.py 文件中禁用默認的 CookiesMiddleware,啟用咱們自定義的新類。

DOWNLOADER_MIDDLEWARES = {
    'scrapy.downloadermiddlewares.cookies.CookiesMiddleware': None,
    'csdn.middlewares.BrowserCookiesDownloaderMiddleware': 543,
}

在編寫爬蟲核心函數(shù),重點修改 Request 請求為 POST 請求,并且攜帶相關參數(shù),meta={'cookiejar':COOKIEJAR}
代碼如下所示:

import scrapy
class ClikeSpider(scrapy.Spider):
    name = 'clike'
    allowed_domains = ['csdn.net']
    like_url = 'https://blog.csdn.net/phoenix/web/v1/article/like'
    def start_requests(self):
        data = {
            "articleId": "120845464",
        }
        yield scrapy.FormRequest(url=self.like_url, formdata=data, meta={'cookiejar': 'firefox'})
    def parse(self, response):
        print(response.json())

運行爬蟲之后,在日志中可以發(fā)現(xiàn)成功的點贊了。

Python 爬蟲 cookie 實戰(zhàn)博客,涉及 browsercookie 與 scrapy

以上就是python實戰(zhàn)scrapy操作cookie爬取博客涉及browsercookie的詳細內容,更多關于scrapy操作cookie爬取博客的資料請關注腳本之家其它相關文章!

相關文章

  • 如何在Win10系統(tǒng)使用Python3連接Hive

    如何在Win10系統(tǒng)使用Python3連接Hive

    這篇文章主要介紹了如何在Win10系統(tǒng)使用Python3連接Hive,幫助大家更好的利用python讀取數(shù)據(jù),進行探索、分析和挖掘工作。感興趣的朋友可以了解下
    2020-10-10
  • Python wordcloud庫安裝方法

    Python wordcloud庫安裝方法

    Wordcloud庫的基本使用非常簡單,只需要導入庫并調用WordCloud類即可,這篇文章主要介紹了Python wordcloud庫,需要的朋友可以參考下
    2024-01-01
  • PyautoGui常用教程(一篇掌握)

    PyautoGui常用教程(一篇掌握)

    這篇文章主要介紹了PyautoGui常用教程(一篇掌握),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2021-04-04
  • python接口自動化之ConfigParser配置文件的使用詳解

    python接口自動化之ConfigParser配置文件的使用詳解

    這篇文章主要介紹了python接口自動化之ConfigParser配置文件的使用,本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-08-08
  • python制作花瓣網(wǎng)美女圖片爬蟲

    python制作花瓣網(wǎng)美女圖片爬蟲

    本文通過python 來實現(xiàn)這樣一個簡單的爬蟲功能,把我們想要的圖片爬取到本地,需要的朋友可以參考下
    2015-10-10
  • Python 虛擬環(huán)境venv詳解

    Python 虛擬環(huán)境venv詳解

    Python 虛擬環(huán)境主要是為不同 Python 項目創(chuàng)建一個隔離的環(huán)境,每個項目都可以擁有獨立的依賴包環(huán)境,而項目間的依賴包互不影響,對Python 虛擬環(huán)境venv相關知識感興趣的朋友一起看看吧
    2021-09-09
  • Python Mysql自動備份腳本

    Python Mysql自動備份腳本

    測試系統(tǒng)環(huán)境 Windows 2003 python 2.5.1 mysql 5.0.1 應該只適用于Win,因為調用了CMD。 增量備份,因為自用,數(shù)據(jù)庫不大。
    2008-07-07
  • centos7中安裝python3.6.4的教程

    centos7中安裝python3.6.4的教程

    Python3.6.4官方版是一款在適合開發(fā)人員使用的windows系統(tǒng)上運行的腳本語言工具,Python3.6.4官方版是目前程序設計從業(yè)者必學的語言之一。這篇文章給大家介紹了centos7中安裝python3.6.4的教程,感興趣的朋友一起看看吧
    2019-12-12
  • Python中time庫的使用(日期時間)

    Python中time庫的使用(日期時間)

    time庫是python中處理時間的標準庫,這篇文章主要介紹了Python中time庫的使用(日期時間),本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2023-02-02
  • Python調用olmOCR大模型實現(xiàn)提取復雜PDF文件內容

    Python調用olmOCR大模型實現(xiàn)提取復雜PDF文件內容

    olmocr是由Allen人工智能研究所(AI2)開發(fā)的一個開源工具包,旨在高效地將PDF和其他文檔轉換為結構化的純文本,同時保持自然閱讀順序,下面我們來看看如何使用olmOCR大模型實現(xiàn)提取復雜PDF文件內容吧
    2025-03-03

最新評論

平安县| 建宁县| 从江县| 明水县| 神农架林区| 溧阳市| 祁连县| 三穗县| 巫山县| 元阳县| 永清县| 科尔| 孟州市| 天全县| 嵩明县| 江永县| 安徽省| 呼伦贝尔市| 遵义市| 林甸县| 阿克| 沙田区| 滨州市| 奉化市| 广河县| 从江县| 香港 | 库伦旗| 磴口县| 洛隆县| 鸡泽县| 金堂县| 潞西市| 伊吾县| 侯马市| 黑河市| 海兴县| 如东县| 抚远县| 吕梁市| 花莲市|