最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python異步存儲數據詳解

 更新時間:2019年03月19日 14:14:10   作者:我是李玉峰  
這篇文章主要為大家詳細介紹了python異步存儲數據的相關資料,具有一定的參考價值,感興趣的小伙伴們可以參考一下

在Python中,數據存儲方式分為同步存儲和異步存儲。同步寫入速度比較慢,而爬蟲速度比較快,有可能導致數據保存不完整,一部分數據沒有入庫。而異步可以將爬蟲和寫入數據庫操作分開執(zhí)行,互不影響,所以寫入速度比較快,能夠保證數據的完整性。

異步存儲數據庫大致看分為以下步驟:

1. 在settings中配置Mysql鏈接需要的參數(主機地址、用戶賬號、密碼、需要操作的表名、編碼格式等)
2. 自定義Pipeline,實現from_settings函數
3. from twisted.enterprise import adbapi 引入連接池模塊
4. from pymysql import cursors 引入游標模塊
5. 在from_settings中,準備鏈接數據庫參數,創(chuàng)建db_pool連接池,創(chuàng)建返回當前類的對象,傳入db_pool
6. 實現初始化函數,在初始化函數中,將db_pool賦值self的屬性
7. 實現process_item函數
    7.1  query = self.db_pool.runInteraction(執(zhí)行插入數據操作的函數對象,函數需要參數),并接受執(zhí)行返回結果
    7.2  query.addErrback(錯誤回調函數,函數需要參數),添加執(zhí)行sql失敗回調的函數,在回調函數中對錯誤數據進一步處理
8. 實現插入數據操作的函數,準備sql,執(zhí)行sql
9. 實現錯誤回調函數,在回調函數中對錯誤數據進一步處理 

下面,我們以天堂圖片網為例,大致熟悉一下異步存儲:

1. 在存儲之前,可以選擇手動創(chuàng)建數據庫(表名、字段名、字段類型等自己定義),也可以選擇代碼創(chuàng)建。

2. 存儲數據之前還得先拿到數據

import scrapy
from ..items import ImgItem
class IvskySpider(scrapy.Spider):
  name = 'ivsky'
  allowed_domains = ['ivsky.com']
  start_urls = ['http://www.ivsky.com/tupian/ziranfengguang/']
  def parse(self, response):
    imgs = response.xpath('//div[@class="il_img"]/a/img')
    for img in imgs:
      alt = img.xpath('@alt').extract_first('')
      src = img.xpath('@src').extract_first('')
      item = ImgItem()
      item['alt'] = alt
      item['src'] = src
 
      yield item

3. 自定義item,并把數據傳進去

import scrapy
 
class IvskySpiderItem(scrapy.Item):
  # define the fields for your item here like:
  # name = scrapy.Field()
  pass
 
class ImgItem(scrapy.Item):
 
  alt = scrapy.Field()
  src = scrapy.Field()

4. 接下來就是settings中的配置,代碼如下(robots協(xié)議記得改為False):

MYSQL_HOST = '127.0.0.1'
MYSQL_USER = 'root'
MYSQL_PW = '123456'
MYSQL_DB = 'ivskydb'
MYSQL_CHARSET = 'utf8'

5. 再然后自定義pipeline,并把該pipeline在settings中配置(設置優(yōu)先級):

from twisted.enterprise import adbapi
from pymysql import cursors
 
class TwistedMysqlPipeline(object):
 
  # 在調用TwistedMysqlPipeline時,第一個調用該函數
  @classmethod
  def from_settings(cls, settings):
 
    #準備需要用到的鏈接mysql的參數
    db_prams = dict(
      host=settings['MYSQL_HOST'],
      user=settings['MYSQL_USER'],
      password=settings['MYSQL_PW'],
      db=settings['MYSQL_DB'],
      port=3306,
      use_unicode=True,
      charset=settings['MYSQL_CHARSET'],
      # 指定使用的游標類型
      cursorclass=cursors.DictCursor
    )
    # 創(chuàng)建連接池對象,需要傳入兩個參數
    # 1.使用操作mysql第三方包名
    # 2.連接數據庫需要的參數
    db_pool = adbapi.ConnectionPool('pymysql', **db_prams)
 
    return cls(db_pool)
 
  def __init__(self, db_pool):
    # 將連接池對象賦值self.db_pool屬性
    self.db_pool = db_pool
 
  def process_item(self, item, spider):
 
    # 準備sql
    # 執(zhí)行sql
    # 執(zhí)行一個將item數據寫入數據庫的動作
    # 1.執(zhí)行操作的函數
    # 2.執(zhí)行函數需要的參數....
    query = self.db_pool.runInteraction(self.insert_item, item)
    # 執(zhí)行sql出現異常錯誤時,回調的函數
    query.addErrback(self.handle_error, item, spider)
 
    return item
 
  # 插入數據出現錯誤時,回調的函數
  def handle_error(self, failure, item, spider):
    print(failure)
    print(item)
 
  # 執(zhí)行插入數據的函數
  def insert_item(self, cursor, item):
    # 創(chuàng)建sql
    sql = "INSERT INTO ivs(alt,src)VALUES(%s,%s)"
    # 執(zhí)行sql
    cursor.execute(sql,(item['alt'], item['src']))

6. pipeline在settings中的配置

ITEM_PIPELINES = {
  # 'ivsky_spider.pipelines.MysqlPipeline': 300,
  'ivsky_spider.pipelines.TwistedMysqlPipeline': 300,
}

代碼到這里就結束了。

以上就是本文的全部內容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。

相關文章

  • Python中的默認參數實例分析

    Python中的默認參數實例分析

    這篇文章主要介紹了Python中的默認參數實例分析,分享了相關代碼示例,小編覺得還是挺不錯的,具有一定借鑒價值,需要的朋友可以參考下
    2018-01-01
  • Python如何使用OS模塊調用cmd

    Python如何使用OS模塊調用cmd

    這篇文章主要介紹了Python如何使用OS模塊調用 cmd,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-02-02
  • Python實現list反轉實例匯總

    Python實現list反轉實例匯總

    這篇文章主要介紹了Python實現list反轉的方法,實例總結了關于list的各種較為常見的操作技巧,需要的朋友可以參考下
    2014-11-11
  • ???????Python?入門學習之函數式編程

    ???????Python?入門學習之函數式編程

    這篇文章主要介紹了???????Python?入門學習之函數式編程,?Python?中的函數式編程技術進行了簡單的入門介紹,下文詳細內容需要的小伙伴可以參考一下
    2022-05-05
  • python實現在pickling的時候壓縮的方法

    python實現在pickling的時候壓縮的方法

    這篇文章主要介紹了python實現在pickling的時候壓縮的方法,比較具有實用價值,需要的朋友可以參考下
    2014-09-09
  • Python 布爾類型示例精講

    Python 布爾類型示例精講

    這篇文章主要為大家介紹了Python 布爾類型示例精講,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2023-10-10
  • python實現csv格式文件轉為asc格式文件的方法

    python實現csv格式文件轉為asc格式文件的方法

    下面小編就為大家分享一篇python實現csv格式文件轉為asc格式文件的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-03-03
  • 關于Numpy數據類型對象(dtype)使用詳解

    關于Numpy數據類型對象(dtype)使用詳解

    今天小編就為大家分享一篇關于Numpy數據類型對象(dtype)使用詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-11-11
  • 淺析Python 中整型對象存儲的位置

    淺析Python 中整型對象存儲的位置

    下面小編就為大家?guī)硪黄獪\析Python 中整型對象存儲的位置。小編覺得挺不錯的,現在分享給大家,也給大家做個參考,一起跟隨小編過來看看吧
    2016-05-05
  • np.random.choice()函數示例詳解

    np.random.choice()函數示例詳解

    np.random.choice() 是 NumPy 中的一個隨機抽樣函數,用于從給定的一維數組中隨機抽取指定數量或指定概率的元素,本文給大家介紹np.random.choice()函數的相關知識,感興趣的朋友一起看看吧
    2023-11-11

最新評論

旅游| 行唐县| 哈巴河县| 六安市| 澄江县| 百色市| 南澳县| 礼泉县| 八宿县| 嘉荫县| 灌阳县| 高安市| 铜梁县| 麦盖提县| 克拉玛依市| 固镇县| 客服| 庆安县| 绵竹市| 民丰县| 淅川县| 油尖旺区| 阳高县| 根河市| 南宫市| 南汇区| 婺源县| 临桂县| 尼勒克县| 延安市| 郓城县| 河池市| 长治市| 泸溪县| 油尖旺区| 新乡县| 泽库县| 福海县| 曲靖市| 保山市| 南华县|