最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python爬蟲之scrapy框架詳解

 更新時間:2021年11月24日 08:39:47   作者:可小v.  
這篇文章主要為大家介紹了python爬蟲之scrapy框架,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
1.在pycharm下安裝scrapy函數(shù)庫
2.將安裝好scrapy函數(shù)庫下的路徑配置到系統(tǒng)path的環(huán)境變量中
3.打開cmd終端輸入:scrapy.exe檢查是否安裝成功
4.創(chuàng)建一個項(xiàng)目:scrapy startproject 項(xiàng)目名字
5.cd進(jìn)入該目錄下,創(chuàng)建一個spider:scrapy genspider 項(xiàng)目名字 網(wǎng)址
6.編輯settings.py文件中的USER_AGENT選項(xiàng)為正常的瀏覽器頭部
7.執(zhí)行這個spider:scrapy crawl 項(xiàng)目名字
8.如果遇到因pip版本太低導(dǎo)致安裝不了scarpy函數(shù)庫,可以先在cmd窗口輸入py -m pip install --upgrade pip升級命令(前提是你的python環(huán)境下得有pip,可通過輸入pip命令查看是否已安裝,如未安裝得去官網(wǎng)下載并解壓至相應(yīng)路徑)

代碼示例命令截圖:

在這里插入圖片描述

項(xiàng)目文件截圖:

在這里插入圖片描述

settings.py文件截圖:(需要修改爬取網(wǎng)站的USER_AGENT)

在這里插入圖片描述

scrapy運(yùn)行工作流程圖:

Spiders(爬蟲):它負(fù)責(zé)處理所有Responses,從中分析提取數(shù)據(jù),獲取Item字段需要的數(shù)據(jù),并將需要跟進(jìn)的URL提交給引擎,再次進(jìn)入Scheduler(調(diào)度器)

Engine(引擎):負(fù)責(zé)Spider、ItemPipelineDownloader、Scheduler中間的通訊,信號、數(shù)據(jù)傳遞等。

Scheduler(調(diào)度器):它負(fù)責(zé)接受引擎發(fā)送過來的Request請求,并按照一定的方式進(jìn)行整理排列,入隊(duì),當(dāng)引擎需要時,交還給引擎。

Downloader(下載器):負(fù)責(zé)下載Scrapy Engine(引擎)發(fā)送的所有Requests請求,并將其獲取到的Responses交還給Scrapy Engine(引擎),由引擎交給Spider來處理

ItemPipeline(管道):它負(fù)責(zé)處理Spider中獲取到的Item,并進(jìn)行進(jìn)行后期處理(詳細(xì)分析、過濾、存儲等)的地方.

Downloader Middlewares(下載中間件):你可以當(dāng)作是一個可以自定義擴(kuò)展下載功能的組件。

Spider MiddlewaresSpider中間件):你可以理解為是一個可以自定擴(kuò)展和操作引擎和Spider中間

通信的功能組件(比如進(jìn)入Spider的Responses;和從Spider出去的Requests)
在這里插入圖片描述

總結(jié)

本篇文章就到這里了,希望能夠給你帶來幫助,也希望您能夠多多關(guān)注腳本之家的更多內(nèi)容!

相關(guān)文章

最新評論

南丰县| 合作市| 年辖:市辖区| 富蕴县| 巴南区| 神池县| 寻乌县| 望谟县| 阿拉尔市| 宁安市| 金坛市| 麻江县| 华宁县| 晋江市| 辽中县| 民和| 青川县| 虎林市| 高邑县| 青铜峡市| 海原县| 玉屏| 和田市| 调兵山市| 东乌| 芦溪县| 陕西省| 吴江市| 鄂州市| 呼玛县| 信宜市| 凭祥市| 滦南县| 台安县| 都昌县| 招远市| 米林县| 遵义县| 阿拉善左旗| 门头沟区| 淮南市|