最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲框架Scrapy安裝使用步驟

 更新時間:2014年04月01日 14:49:28   作者:  
這篇文章主要介紹了Python爬蟲框架Scrapy的安裝和使用步驟,重點在解決依賴問題上,需要的朋友可以參考下

一、爬蟲框架Scarpy簡介
Scrapy 是一個快速的高層次的屏幕抓取和網(wǎng)頁爬蟲框架,爬取網(wǎng)站,從網(wǎng)站頁面得到結(jié)構(gòu)化的數(shù)據(jù),它有著廣泛的用途,從數(shù)據(jù)挖掘到監(jiān)測和自動測試,Scrapy完全用Python實現(xiàn),完全開源,代碼托管在Github上,可運行在Linux,Windows,Mac和BSD平臺上,基于Twisted的異步網(wǎng)絡庫來處理網(wǎng)絡通訊,用戶只需要定制開發(fā)幾個模塊就可以輕松的實現(xiàn)一個爬蟲,用來抓取網(wǎng)頁內(nèi)容以及各種圖片。

二、Scrapy安裝指南

我們的安裝步驟假設你已經(jīng)安裝一下內(nèi)容:<1>Python2.7<2>lxml<3>OpenSSL,我們使用Python的包管理工具pip或者easy_install來安裝Scrapy。
pip的安裝方式:

復制代碼 代碼如下:
pip install Scrapy

easy_install的安裝方式:
復制代碼 代碼如下:
easy_install Scrapy

三、Ubuntu平臺上環(huán)境配置

1、python的包管理工具
當前的包管理工具鏈是 easy_install/pip + distribute/setuptools
distutils : Python 自帶的基本安裝工具, 適用于非常簡單的應用場景;
setuptools : 針對 distutils 做了大量擴展, 尤其是加入了包依賴機制. 在部分 Python 子社區(qū)已然是事實上的標準;
distribute : 由于 setuptools 開發(fā)進度緩慢, 不支持 Python 3, 代碼混亂, 一幫程序員另起爐灶, 重構(gòu)代碼, 增加功能, 希望能夠取代 setuptools 并被接納為官方標準庫, 他們非常努力, 在很短的時間便讓社區(qū)接受了 distribute;,setuptools / distribute 都只是擴展了 distutils;
easy_install : setuptools 和 distribute 自帶的安裝腳本, 也就是一旦 setuptools 或 distribute 安裝完畢, easy_install 也便可用. 最大的特點是自動查找 Python 官方維護的包源 PyPI , 安裝第三方 Python 包非常方便; 使用:
pip : pip 的目標非常明確 – 取代 easy_install. easy_install 有很多不足: 安裝事務是非原子操作, 只支持 svn, 沒有提供卸載命令, 安裝一系列包時需要寫腳本; pip 解決了以上問題, 已儼然成為新的事實標準, virtualenv 與它已經(jīng)成為一對好搭檔;

安裝過程:
安裝distribute  

復制代碼 代碼如下:
$ curl -O http://python-distribute.org/distribute_setup.py 
$ python distribute_setup.py

安裝pip:
復制代碼 代碼如下:
$ curl -O https://raw.github.com/pypa/pip/master/contrib/get-pip.py 
$ [sudo] python get-pip.py

2、Scrapy的安裝
在Windows平臺上,可以通過包管理工具或者手動下載各種依賴的二進制包:pywin32,Twisted,zope.interface,lxml,pyOpenSSL,在Ubuntu9.10以后的版本上,官方推薦不用使用Ubuntu提供的python-scrapy包,它們要么太老要么太慢,無法匹配最新的Scrapy,解決方案是,使用官方的Ubuntu Packages,它提供了所有的依賴庫,并且對于最新的bug提供持續(xù)的更新,穩(wěn)定性更高,它們持續(xù)的從Github倉庫(master和stable branches)構(gòu)建,Scrapy在Ubuntu9.10之后的版本上的安裝方法如下:
<1>輸入GPG密鑰

復制代碼 代碼如下:
sudo apt-key adv --keyserver hkp://keyserver.ubuntu.com:80 --recv 627220E7

<2>創(chuàng)建/etc/apt/sources.list.d/scrapy.list 文件
復制代碼 代碼如下:
echo 'deb http://archive.scrapy.org/ubuntu scrapy main' | sudo tee /etc/apt/sources.list.d/scrapy.list

<3>更新包列表,安裝scrapy版本,其中VERSION用實際的版本代替,如scrapy-0.22
復制代碼 代碼如下:
sudo apt-get update && sudo apt-get install scrapy-VERSION

3、Scrapy依賴庫的安裝
ubuntu12.04下scrapy依賴庫的安裝
ImportError: No module named w3lib.http

復制代碼 代碼如下:
pip install w3lib

ImportError: No module named twisted
復制代碼 代碼如下:
pip install twisted

ImportError: No module named lxml.html
復制代碼 代碼如下:
pip install lxml

解決:error: libxml/xmlversion.h: No such file or directory

復制代碼 代碼如下:
apt-get install libxml2-dev libxslt-dev 
apt-get install python-lxml

解決:ImportError: No module named cssselect

復制代碼 代碼如下:
pip install cssselect 

ImportError: No module named OpenSSL
復制代碼 代碼如下:
pip install pyOpenSSL 

4、定制自己的爬蟲開發(fā)
切換到文件目錄,開啟新的工程

復制代碼 代碼如下:
scrapy startproject test

 

相關文章

  • Pytorch訓練過程出現(xiàn)nan的解決方式

    Pytorch訓練過程出現(xiàn)nan的解決方式

    今天小編就為大家分享一篇Pytorch訓練過程出現(xiàn)nan的解決方式,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01
  • 使用python接受tgam的腦波數(shù)據(jù)實例

    使用python接受tgam的腦波數(shù)據(jù)實例

    這篇文章主要介紹了使用python接受tgam的腦波數(shù)據(jù)實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-04-04
  • python實現(xiàn)字符串加密成純數(shù)字

    python實現(xiàn)字符串加密成純數(shù)字

    這篇文章主要為大家詳細介紹了python實現(xiàn)字符串加密成純數(shù)字,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2019-03-03
  • Python使用sigthief簽發(fā)證書的實現(xiàn)步驟

    Python使用sigthief簽發(fā)證書的實現(xiàn)步驟

    Windows 系統(tǒng)中的一些非常重要文件通常會被添加數(shù)字簽名,其目的是用來防止被篡改,能確保用戶通過互聯(lián)網(wǎng)下載時能確信此代碼沒有被非法篡改和來源可信,從而保護了代碼的完整性、保護了用戶不會被病毒、惡意代碼和間諜軟件所侵害,本章將演示證書的簽發(fā)與偽造
    2021-06-06
  • Python Docx庫完美操作word文檔實例探究

    Python Docx庫完美操作word文檔實例探究

    這篇文章主要為大家介紹了Python Docx庫完美操作word文檔,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2024-01-01
  • python異常的傳遞知識點總結(jié)

    python異常的傳遞知識點總結(jié)

    在本篇文章里小編給大家整理的是一篇關于python異常的傳遞知識點總結(jié),有興趣的朋友們可以學習下。
    2021-06-06
  • 手把手教你用322行Python代碼編寫貪吃蛇游戲

    手把手教你用322行Python代碼編寫貪吃蛇游戲

    最近在學Python,想做點什么來練練手,命令行的貪吃蛇一般是C的練手項目,但是一時之間找不到別的,就先做個貪吃蛇來練練簡單的語法,下面這篇文章主要給大家介紹了關于如何用322行Python代碼編寫貪吃蛇游戲的相關資料,需要的朋友可以參考下
    2023-02-02
  • python使用pandas庫導入并保存excel、csv格式文件數(shù)據(jù)

    python使用pandas庫導入并保存excel、csv格式文件數(shù)據(jù)

    CSV格式文件很方便各種工具之間傳遞數(shù)據(jù),平時工作過程之中會將數(shù)據(jù)保存為CSV格式,這篇文章主要介紹了python使用pandas庫導入并保存excel、csv格式文件數(shù)據(jù)的相關資料,需要的朋友可以參考下
    2017-12-12
  • 基于python的MD5腳本開發(fā)思路

    基于python的MD5腳本開發(fā)思路

    這篇文章主要介紹了基于python的MD5腳本,通過 string模塊自動生成字典,使用permutations()函數(shù),對字典進行全排列,本文通過實例代碼給大家介紹的非常詳細,需要的朋友可以參考下
    2022-03-03
  • python網(wǎng)絡爬蟲精解之pyquery的使用說明

    python網(wǎng)絡爬蟲精解之pyquery的使用說明

    PyQuery是一個類似于jQuery的解析網(wǎng)頁工具,使用lxml操作xml和html文檔,它的語法和jQuery很像。和XPATH,Beautiful Soup比起來,PyQuery更加靈活,提供增加節(jié)點的class信息,移除某個節(jié)點,提取文本信息等功能
    2021-09-09

最新評論

大城县| 康定县| 定日县| 富川| 佛山市| 长葛市| 酉阳| 丽水市| 本溪| 祁阳县| 沧州市| 聊城市| 安多县| 平利县| 广灵县| 卢龙县| 岢岚县| 桃园县| 石台县| 平阳县| 清徐县| 定州市| 六盘水市| 崇明县| 林西县| 西乌| 泽普县| 临邑县| 栾城县| 正安县| 肇州县| 大关县| 平定县| 张家界市| 中宁县| 拉萨市| 双城市| 兴义市| 古丈县| 什邡市| 鸡泽县|