最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲之Spider類用法簡單介紹

 更新時間:2020年08月04日 10:42:08   作者:WCCW  
這篇文章主要介紹了Python爬蟲之Spider類用法簡單介紹,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧

一、網絡爬蟲

網絡爬蟲又被稱為網絡蜘蛛(🕷️),我們可以把互聯網想象成一個蜘蛛網,每一個網站都是一個節(jié)點,我們可以使用一只蜘蛛去各個網頁抓取我們想要的資源。舉一個最簡單的例子,你在百度和谷歌中輸入‘Python',會有大量和Python相關的網頁被檢索出來,百度和谷歌是如何從海量的網頁中檢索出你想要的資源,他們靠的就是派出大量蜘蛛去網頁上爬取,檢索關鍵字,建立索引數據庫,經過復雜的排序算法,結果按照搜索關鍵字相關度的高低展現給你。

千里之行,始于足下,我們從最基礎的開始學習如何寫一個網絡爬蟲,實現語言使用Python。

二、Python如何訪問互聯網

想要寫網絡爬蟲,第一步是訪問互聯網,Python如何訪問互聯網呢?

在Python中,我們使用urllib包訪問互聯網。(在Python3中,對這個模塊做了比較大的調整,以前有urllib和urllib2,在3中對這兩個模塊做了統(tǒng)一合并,稱為urllib包。包下面包含了四個模塊,urllib.request,urllib.error,urllib.parse,urllib.robotparser),目前主要使用的是urllib.request。

我們首先舉一個最簡單的例子,如何獲取獲取網頁的源碼:

import urllib.request
response = urllib.request.urlopen('https://docs.python.org/3/')
html = response.read()
print(html.decode('utf-8'))

三、Python網絡簡單使用

首先我們用兩個小demo練一下手,一個是使用python代碼下載一張圖片到本地,另一個是調用有道翻譯寫一個翻譯小軟件。

3.1根據圖片鏈接下載圖片,代碼如下:

import urllib.request

response = urllib.request.urlopen('http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg')
image = response.read()

with open('123.jpg','wb') as f:
 f.write(image)

其中response是一個對象

輸入:response.geturl()
->'http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg'

輸入:response.info()
-><http.client.HTTPMessage object at 0x10591c0b8>

輸入:print(response.info())
->Content-Type: text/html
Last-Modified: Mon, 27 Sep 2004 01:23:20 GMT
Accept-Ranges: bytes
ETag: "0f4b59230a4c41:0"
Server: Microsoft-IIS/8.0
Date: Sun, 14 Aug 2016 07:16:01 GMT
Connection: close
Content-Length: 2827

輸入:response.getcode()
->200

3.2使用有道詞典實現翻譯功能

我們想實現翻譯功能,我們需要拿到請求鏈接。首先我們需要進入有道首頁,點擊翻譯,在翻譯界面輸入要翻譯的內容,點擊翻譯按鈕,就會向服務器發(fā)起一個請求,我們需要做的就是拿到請求地址和請求參數。

我在此使用谷歌瀏覽器實現拿到請求地址和請求參數。首先點擊右鍵,點擊檢查(不同瀏覽器點擊的選項可能不同,同一瀏覽器的不同版本也可能不同),進入圖一所示,從中我們可以拿到請求請求地址和請求參數,在Header中的Form Data中我們可以拿到請求參數。

(圖一)

代碼段如下:

import urllib.request
import urllib.parse

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'
data = {}
data['type'] = 'AUTO'
data['i'] = 'i love you'
data['doctype'] = 'json'
data['xmlVersion'] = '1.8'
data['keyfrom'] = 'fanyi.web'
data['ue'] = 'UTF-8'
data['action'] = 'FY_BY_CLICKBUTTON'
data['typoResult'] = 'true'
data = urllib.parse.urlencode(data).encode('utf-8')
response = urllib.request.urlopen(url,data)
html = response.read().decode('utf-8')
print(html)

上述代碼執(zhí)行如下:

{"type":"EN2ZH_CN","errorCode":0,"elapsedTime":0,"translateResult":[[{"src":"i love you","tgt":"我愛你"}]],"smartResult":{"type":1,"entries":["","我愛你。"]}}

對于上述結果,我們可以看到是一個json串,我們可以對此解析一下,并且對代碼進行完善一下:

import urllib.request
import urllib.parse
import json

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'
data = {}
data['type'] = 'AUTO'
data['i'] = 'i love you'
data['doctype'] = 'json'
data['xmlVersion'] = '1.8'
data['keyfrom'] = 'fanyi.web'
data['ue'] = 'UTF-8'
data['action'] = 'FY_BY_CLICKBUTTON'
data['typoResult'] = 'true'
data = urllib.parse.urlencode(data).encode('utf-8')
response = urllib.request.urlopen(url,data)
html = response.read().decode('utf-8')
target = json.loads(html)
print(target['translateResult'][0][0]['tgt'])

四、規(guī)避風險

服務器檢測出請求不是來自瀏覽器,可能會屏蔽掉請求,服務器判斷的依據是使用‘User-Agent',我們可以修改改字段的值,來隱藏自己。代碼如下:

import urllib.request
import urllib.parse
import json

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'
data = {}
data['type'] = 'AUTO'
data['i'] = 'i love you'
data['doctype'] = 'json'
data['xmlVersion'] = '1.8'
data['keyfrom'] = 'fanyi.web'
data['ue'] = 'UTF-8'
data['action'] = 'FY_BY_CLICKBUTTON'
data['typoResult'] = 'true'
data = urllib.parse.urlencode(data).encode('utf-8')
req = urllib.request.Request(url, data)
req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
response = urllib.request.urlopen(url, data)
html = response.read().decode('utf-8')
target = json.loads(html)
print(target['translateResult'][0][0]['tgt'])

上述做法雖然可以隱藏自己,但是還有很大問題,例如一個網絡爬蟲下載圖片軟件,在短時間內大量下載圖片,服務器可以可以根據IP訪問次數判斷是否是正常訪問。所有上述做法還有很大的問題。我們可以通過兩種做法解決辦法,一是使用延遲,例如5秒內訪問一次。另一種辦法是使用代理。

延遲訪問(休眠5秒,缺點是訪問效率低下):

import urllib.request
import urllib.parse
import json
import time


while True:
 content = input('please input content(input q exit program):')
 if content == 'q':
  break;

 url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'
 data = {}
 data['type'] = 'AUTO'
 data['i'] = content
 data['doctype'] = 'json'
 data['xmlVersion'] = '1.8'
 data['keyfrom'] = 'fanyi.web'
 data['ue'] = 'UTF-8'
 data['action'] = 'FY_BY_CLICKBUTTON'
 data['typoResult'] = 'true'
 data = urllib.parse.urlencode(data).encode('utf-8')
 req = urllib.request.Request(url, data)
 req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
 response = urllib.request.urlopen(url, data)
 html = response.read().decode('utf-8')
 target = json.loads(html)
 print(target['translateResult'][0][0]['tgt'])
 time.sleep(5)

代理訪問:讓代理訪問資源,然后講訪問到的資源返回。服務器看到的是代理的IP地址,不是自己地址,服務器就沒有辦法對你做限制。

步驟:

1,參數是一個字典{'類型' : '代理IP:端口號' } //類型是http,https等
proxy_support = urllib.request.ProxyHandler({})

2,定制、創(chuàng)建一個opener
opener = urllib.request.build_opener(proxy_support)

3,安裝opener(永久安裝,一勞永逸)
urllib.request.install_opener(opener)

4,調用opener(調用的時候使用)
opener.open(url)

五、批量下載網絡圖片

圖片下載來源為煎蛋網(http://jandan.net)

圖片下載的關鍵是找到圖片的規(guī)律,如找到當前頁,每一頁的圖片鏈接,然后使用循環(huán)下載圖片。下面是程序代碼(待優(yōu)化,正則表達式匹配,IP代理):

import urllib.request
import os

def url_open(url):
 req = urllib.request.Request(url)
 req.add_header('User-Agent','Mozilla/5.0')
 response = urllib.request.urlopen(req)
 html = response.read()
 return html

def get_page(url):
 html = url_open(url).decode('utf-8')
 a = html.find('current-comment-page') + 23
 b = html.find(']',a)
 return html[a:b]


def find_image(url):
 html = url_open(url).decode('utf-8')
 image_addrs = []
 a = html.find('img src=')
 while a != -1:
  b = html.find('.jpg',a,a + 150)
  if b != -1:
   image_addrs.append(html[a+9:b+4])
  else:
   b = a + 9
  a = html.find('img src=',b)
 for each in image_addrs:
  print(each)
 return image_addrs

def save_image(folder,image_addrs):
 for each in image_addrs:
  filename = each.split('/')[-1]
  with open(filename,'wb') as f:
   img = url_open(each)
   f.write(img)

def download_girls(folder = 'girlimage',pages = 20):
 os.mkdir(folder)
 os.chdir(folder)
 url = 'http://jandan.net/ooxx/'
 page_num = int(get_page(url))

 for i in range(pages):
  page_num -= i
  page_url = url + 'page-' + str(page_num) + '#comments'
  image_addrs = find_image(page_url)
  save_image(folder,image_addrs)

if __name__ == '__main__':
 download_girls()

代碼運行效果如下:

到此這篇關于Python爬蟲之Spider類用法簡單介紹的文章就介紹到這了,更多相關Python爬蟲Spider類內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • 深入解析Python中的urllib2模塊

    深入解析Python中的urllib2模塊

    這篇文章主要介紹了Python中的urllib2模塊,包括一個利用其抓取網站生成RSS的小例子,需要的朋友可以參考下
    2015-11-11
  • Python 腳本拉取 Docker 鏡像問題

    Python 腳本拉取 Docker 鏡像問題

    這篇文章主要介紹了 Python 腳本拉取 Docker 鏡像問題,本文給大家介紹的非常詳細,具有一定的參考借鑒價值,需要的朋友可以參考下
    2019-11-11
  • pandas實現處理TB級別的數據

    pandas實現處理TB級別的數據

    這篇文章主要介紹了pandas實現處理TB級別的數據,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2025-04-04
  • Matlab中plot基本用法的具體使用

    Matlab中plot基本用法的具體使用

    這篇文章主要介紹了Matlab中plot基本用法的具體使用,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-07-07
  • Python中Tkinter組件Listbox的具體使用

    Python中Tkinter組件Listbox的具體使用

    本文主要介紹了Python中Tkinter組件Listbox的具體使用,Listbox組件用于顯示一個選擇列表,文中通過示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2022-01-01
  • Django結合ajax進行頁面實時更新的例子

    Django結合ajax進行頁面實時更新的例子

    今天小編就為大家分享一篇Django結合ajax進行頁面實時更新的例子,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-08-08
  • 詳解tf.device()指定tensorflow運行的GPU或CPU設備實現

    詳解tf.device()指定tensorflow運行的GPU或CPU設備實現

    這篇文章主要介紹了詳解tf.device()指定tensorflow運行的GPU或CPU設備實現,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2021-02-02
  • django模板加載靜態(tài)文件的方法步驟

    django模板加載靜態(tài)文件的方法步驟

    這篇文章主要介紹了django模板加載靜態(tài)文件的方法步驟,小編覺得挺不錯的,現在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2019-03-03
  • Python 找出出現次數超過數組長度一半的元素實例

    Python 找出出現次數超過數組長度一半的元素實例

    這篇文章主要介紹了Python 找出出現次數超過數組長度一半的元素實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-05-05
  • 深入了解Python數據類型之列表

    深入了解Python數據類型之列表

    下面小編就為大家?guī)硪黄钊肓私釶ython數據類型之列表。小編覺得挺不錯的,現在就分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2016-06-06

最新評論

丹寨县| 宁乡县| 上犹县| 平乡县| 白山市| 邛崃市| 临桂县| 康平县| 桂林市| 邵武市| 乐东| 黔江区| 荥阳市| 洱源县| 丹寨县| 濮阳县| 循化| 化州市| 克什克腾旗| 乌拉特后旗| 岫岩| 遂川县| 全南县| 东乡| 西藏| 历史| 柘荣县| 友谊县| 涪陵区| 合肥市| 南宁市| 太谷县| 福建省| 宜君县| 华安县| 遵义县| 竹溪县| 潞西市| 广宁县| 平南县| 商南县|