最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

基于scrapy實(shí)現(xiàn)的簡(jiǎn)單蜘蛛采集程序

 更新時(shí)間:2015年04月17日 12:22:19   作者:pythoner  
這篇文章主要介紹了基于scrapy實(shí)現(xiàn)的簡(jiǎn)單蜘蛛采集程序,實(shí)例分析了scrapy實(shí)現(xiàn)采集程序的技巧,具有一定參考借鑒價(jià)值,需要的朋友可以參考下

本文實(shí)例講述了基于scrapy實(shí)現(xiàn)的簡(jiǎn)單蜘蛛采集程序。分享給大家供大家參考。具體如下:

# Standard Python library imports
# 3rd party imports
from scrapy.contrib.spiders import CrawlSpider, Rule
from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor
from scrapy.selector import HtmlXPathSelector
# My imports
from poetry_analysis.items import PoetryAnalysisItem
HTML_FILE_NAME = r'.+\.html'
class PoetryParser(object):
  """
  Provides common parsing method for poems formatted this one specific way.
  """
  date_pattern = r'(\d{2} \w{3,9} \d{4})'
 
  def parse_poem(self, response):
    hxs = HtmlXPathSelector(response)
    item = PoetryAnalysisItem()
    # All poetry text is in pre tags
    text = hxs.select('//pre/text()').extract()
    item['text'] = ''.join(text)
    item['url'] = response.url
    # head/title contains title - a poem by author
    title_text = hxs.select('//head/title/text()').extract()[0]
    item['title'], item['author'] = title_text.split(' - ')
    item['author'] = item['author'].replace('a poem by', '')
    for key in ['title', 'author']:
      item[key] = item[key].strip()
    item['date'] = hxs.select("http://p[@class='small']/text()").re(date_pattern)
    return item
class PoetrySpider(CrawlSpider, PoetryParser):
  name = 'example.com_poetry'
  allowed_domains = ['www.example.com']
  root_path = 'someuser/poetry/'
  start_urls = ['http://www.example.com/someuser/poetry/recent/',
         'http://www.example.com/someuser/poetry/less_recent/']
  rules = [Rule(SgmlLinkExtractor(allow=[start_urls[0] + HTML_FILE_NAME]),
                  callback='parse_poem'),
       Rule(SgmlLinkExtractor(allow=[start_urls[1] + HTML_FILE_NAME]),
                  callback='parse_poem')]

希望本文所述對(duì)大家的Python程序設(shè)計(jì)有所幫助。

相關(guān)文章

  • python批量下載網(wǎng)站馬拉松照片的完整步驟

    python批量下載網(wǎng)站馬拉松照片的完整步驟

    這篇文章主要給大家介紹了關(guān)于利用python批量下載網(wǎng)站馬拉松照片的完整步驟,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2018-12-12
  • Python爬蟲(chóng)自動(dòng)化爬取b站實(shí)時(shí)彈幕實(shí)例方法

    Python爬蟲(chóng)自動(dòng)化爬取b站實(shí)時(shí)彈幕實(shí)例方法

    在本篇文章里小編給大家整理的是一篇關(guān)于Python爬蟲(chóng)自動(dòng)化爬取b站實(shí)時(shí)彈幕實(shí)例方法,有興趣的朋友們可以學(xué)習(xí)下。
    2021-01-01
  • 解決python中文亂碼問(wèn)題方法總結(jié)

    解決python中文亂碼問(wèn)題方法總結(jié)

    這篇文章主要介紹了解決python中文亂碼問(wèn)題方法總結(jié),需要的朋友可以參考下
    2021-05-05
  • pycharm使用matplotlib畫(huà)圖問(wèn)題解決方法

    pycharm使用matplotlib畫(huà)圖問(wèn)題解決方法

    Pycharm是一款功能強(qiáng)大的Python集成開(kāi)發(fā)環(huán)境(IDE),它提供了許多有用的工具和功能,可以幫助開(kāi)發(fā)人員更輕松地編寫和調(diào)試Python代碼,其中一個(gè)有用的工具是Pycharm如何畫(huà)圖,本文給大家介紹在pycharm中使用matplotlib畫(huà)圖問(wèn)題,感興趣的朋友一起看看吧
    2023-11-11
  • 詳解Python實(shí)現(xiàn)字典合并的四種方法

    詳解Python實(shí)現(xiàn)字典合并的四種方法

    這篇文章主要為大家詳細(xì)介紹了Python的合并字典的四種方法,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來(lái)幫助
    2022-03-03
  • 以SortedList為例詳解Python的defaultdict對(duì)象使用自定義類型的方法

    以SortedList為例詳解Python的defaultdict對(duì)象使用自定義類型的方法

    這篇文章主要介紹了以SortedList為例詳解Python的defaultdict對(duì)象使用自定義類型的方法,文章圍繞主題展開(kāi)詳細(xì)的內(nèi)容介紹,具有一定的參考價(jià)值,需要的朋友可以參考一下
    2022-07-07
  • 訊飛webapi語(yǔ)音識(shí)別接口調(diào)用示例代碼(python)

    訊飛webapi語(yǔ)音識(shí)別接口調(diào)用示例代碼(python)

    這篇文章主要介紹了如何使用Python3調(diào)用訊飛WebAPI語(yǔ)音識(shí)別接口,重點(diǎn)解決了在處理語(yǔ)音識(shí)別結(jié)果時(shí)判斷是否為最后一幀的問(wèn)題,通過(guò)運(yùn)行代碼并總結(jié)經(jīng)驗(yàn),解決了常見(jiàn)的模塊和屬性錯(cuò)誤,需要的朋友可以參考下
    2025-03-03
  • python自動(dòng)化運(yùn)維之Telnetlib的具體使用

    python自動(dòng)化運(yùn)維之Telnetlib的具體使用

    本文將結(jié)合實(shí)例代碼,介紹python自動(dòng)化運(yùn)維之Telnetlib的具體使用,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2021-06-06
  • 深入淺析Python 中的sklearn模型選擇

    深入淺析Python 中的sklearn模型選擇

    這篇文章主要介紹了Python sklearn模型選擇的相關(guān)知識(shí),非常不錯(cuò),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2019-10-10
  • pandas讀取文件夾下所有excel文件的實(shí)現(xiàn)

    pandas讀取文件夾下所有excel文件的實(shí)現(xiàn)

    最近需要做一個(gè)需求,要求匯總一個(gè)文件夾所有的excel文件,所以本文就來(lái)介紹一下pandas讀取文件夾下所有excel文件的實(shí)現(xiàn),具有一定的參考價(jià)值,感興趣的可以了解一下
    2023-09-09

最新評(píng)論

清苑县| 白河县| 漠河县| 兴和县| 天等县| 阿图什市| 华池县| 临城县| 淮南市| 子洲县| 亳州市| 巴塘县| 南丹县| 关岭| 孟连| 白玉县| 南华县| 长白| 静乐县| 霞浦县| 鲜城| 青河县| 儋州市| 邵武市| 新河县| 巨鹿县| 郸城县| 临沂市| 西华县| 中宁县| 嘉义县| 大余县| 玛多县| 独山县| 北安市| 哈尔滨市| 泉州市| 卓尼县| 扬中市| 邯郸县| 安多县|