最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python Scrapy框架原理解析

 更新時間:2021年01月04日 11:47:51   作者:劃水De雁曉明  
這篇文章主要介紹了python Scrapy框架原理的相關資料,幫助大家更好的理解和使用python爬蟲,感興趣的朋友可以了解下

Python 爬蟲包含兩個重要的部分:正則表達式和Scrapy框架的運用, 正則表達式對于所有語言都是通用的,網(wǎng)絡上可以找到各種資源。

如下是手繪Scrapy框架原理圖,幫助理解

如下是一段運用Scrapy創(chuàng)建的spider:使用了內(nèi)置的crawl模板,以利用Scrapy庫的CrawlSpider。相對于簡單的爬取爬蟲來說,Scrapy的CrawlSpider擁有一些網(wǎng)絡爬取時可用的特殊屬性和方法:

$ scrapy genspider country_or_district example.python-scrapying.com--template=crawl

運行genspider命令后,下面的代碼將會在example/spiders/country_or_district.py中自動生成。

# -*- coding: utf-8 -*-
import scrapy
from scrapy.linkextractors import LinkExtractor
from scrapy.spiders import CrawlSpider, Rule
from example.items import CountryOrDistrictItem


class CountryOrDistrictSpider(CrawlSpider):
  name = 'country_or_district'
  allowed_domains = ['example.python-scraping.com']
  start_urls = ['http://example.python-scraping.com/']

  rules = (
    Rule(LinkExtractor(allow=r'/index/', deny=r'/user/'),
       follow=True),
    Rule(LinkExtractor(allow=r'/view/', deny=r'/user/'),
       callback='parse_item'),
  )

  def parse_item(self, response):
    item = CountryOrDistrictItem()
    name_css = 'tr#places_country_or_district__row td.w2p_fw::text'
    item['name'] = response.css(name_css).extract()
    pop_xpath = '//tr[@id="places_population__row"]/td[@class="w2p_fw"]/text()'
    item['population'] = response.xpath(pop_xpath).extract()
    return item

爬蟲類包括的屬性:

  • name: 識別爬蟲的字符串。
  • allowed_domains: 可以爬取的域名列表。如果沒有設置該屬性,則表示可以爬取任何域名。
  • start_urls: 爬蟲起始URL列表。
  • rules: 該屬性為一個通過正則表達式定義的Rule對象元組,用于告知爬蟲需要跟蹤哪些鏈接以及哪些鏈接包含抓取的有用內(nèi)容。

以上就是python Scrapy框架原理解析的詳細內(nèi)容,更多關于Scrapy框架原理的資料請關注腳本之家其它相關文章!

相關文章

  • Python3多線程詳解

    Python3多線程詳解

    使用多線程,可以同時進行多項任務,可以使用戶界面更友好,還可以后臺執(zhí)行某些用時長的任務,同時具有易于通信的優(yōu)點。python3中多線程的實現(xiàn)使用了threading模塊,它允許同一進程中運行多個線程,本文介紹的非常詳細,,需要的朋友可以參考下
    2023-05-05
  • python實現(xiàn)求最長回文子串長度

    python實現(xiàn)求最長回文子串長度

    最長回文子串問題:給定一個字符串,求它的最長回文子串長度。如果一個字符串正著讀和反著讀是一樣的,那它就是回文串。今天我們就來探討下這個問題
    2018-01-01
  • Python 開發(fā)工具PyCharm安裝教程圖文詳解(新手必看)

    Python 開發(fā)工具PyCharm安裝教程圖文詳解(新手必看)

    PyCharm是一種Python IDE,帶有一整套可以幫助用戶在使用Python語言開發(fā)時提高其效率的工具,比如調(diào)試、語法高亮、Project管理、代碼跳轉、智能提示、自動完成、單元測試、版本控制。今天通過本文給大家分享PyCharm安裝教程,一起看看吧
    2020-02-02
  • pytorch 計算Parameter和FLOP的操作

    pytorch 計算Parameter和FLOP的操作

    這篇文章主要介紹了pytorch 計算Parameter和FLOP的操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2021-03-03
  • 查看已安裝tensorflow版本的方法示例

    查看已安裝tensorflow版本的方法示例

    這篇文章主要介紹了查看已安裝tensorflow版本的方法示例,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-04-04
  • Python基于os.environ從windows獲取環(huán)境變量

    Python基于os.environ從windows獲取環(huán)境變量

    這篇文章主要介紹了Python基于os.environ從windows獲取環(huán)境變量,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-06-06
  • Python實現(xiàn)單詞拼寫檢查

    Python實現(xiàn)單詞拼寫檢查

    這篇文章主要介紹了Python實現(xiàn)單詞拼寫檢查,本文講解了單詞拼寫檢查的一些知識并給出兩種實現(xiàn)方法,需要的朋友可以參考下
    2015-04-04
  • python使用wxpython開發(fā)簡單記事本的方法

    python使用wxpython開發(fā)簡單記事本的方法

    這篇文章主要介紹了python使用wxpython開發(fā)簡單記事本的方法,涉及Python使用wxPython實現(xiàn)桌面圖形應用程序的技巧,需要的朋友可以參考下
    2015-05-05
  • Python讀取pdf文件的簡單代碼示例

    Python讀取pdf文件的簡單代碼示例

    PDF文件的數(shù)據(jù)主要是文本、圖片、表格,這三部分組成,但是也會穿插流程圖、各種柱狀圖等,這篇文章主要給大家介紹了關于Python讀取pdf文件的簡單代碼示例,需要的朋友可以參考下
    2024-02-02
  • 在django中使用自定義標簽實現(xiàn)分頁功能

    在django中使用自定義標簽實現(xiàn)分頁功能

    這篇文章主要介紹了在django中使用自定義標簽實現(xiàn)分頁功能,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2017-07-07

最新評論

武功县| 新蔡县| 贵州省| 聂荣县| 高平市| 昌江| 琼中| 金门县| 军事| 东丽区| 桐城市| 汉寿县| 丰镇市| 长沙县| 东方市| 荥经县| 平凉市| 台州市| 红桥区| 宝坻区| 堆龙德庆县| 禹州市| 万载县| 溧水县| 神池县| 平果县| 南京市| 澄江县| 城固县| 福州市| 曲阜市| 牙克石市| 胶南市| 金塔县| 高唐县| 阿拉尔市| 开平市| 兴海县| 濮阳县| 万盛区| 鹿泉市|