最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python正則抓取網(wǎng)易新聞的方法示例

 更新時間:2017年04月21日 14:37:22   作者:我要的shine  
這篇文章主要介紹了Python正則抓取網(wǎng)易新聞的方法,結(jié)合實例形式較為詳細的分析了Python使用正則進行網(wǎng)易新聞抓取操作的相關(guān)實現(xiàn)技巧與注意事項,需要的朋友可以參考下

本文實例講述了Python正則抓取網(wǎng)易新聞的方法。分享給大家供大家參考,具體如下:

自己寫了些關(guān)于抓取網(wǎng)易新聞的爬蟲,發(fā)現(xiàn)其網(wǎng)頁源代碼與網(wǎng)頁的評論根本就對不上,所以,采用了抓包工具得到了其評論的隱藏地址(每個瀏覽器都有自己的抓包工具,都可以用來分析網(wǎng)站)

如果仔細觀察的話就會發(fā)現(xiàn),有一個特殊的,那么這個就是自己想要的了

然后打開鏈接就可以找到相關(guān)的評論內(nèi)容了。(下圖為第一頁內(nèi)容)

接下來就是代碼了(也照著大神的改改寫寫了)。

#coding=utf-8
import urllib2
import re
import json
import time
class WY():
  def __init__(self):
    self.headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 5.1) AppleWebKit/534.24 (KHTML, like '}
    self.url='http://comment.news.163.com/data/news3_bbs/df/B9IBDHEH000146BE_1.html'
  def getpage(self,page):
    full_url='http://comment.news.163.com/cache/newlist/news3_bbs/B9IBDHEH000146BE_'+str(page)+'.html'
    return full_url
  def gethtml(self,page):
    try:
      req=urllib2.Request(page,None,self.headers)
      response = urllib2.urlopen(req)
      html = response.read()
      return html
    except urllib2.URLError,e:
      if hasattr(e,'reason'):
        print u"連接失敗",e.reason
        return None
  #處理字符串
  def Process(self,data,page):
    if page == 1:
      data=data.replace('var replyData=','')
    else:
      data=data.replace('var newPostList=','')
    reg1=re.compile(" \[<a href=''>")
    data=reg1.sub(' ',data)
    reg2=re.compile('<\\\/a>\]')
    data=reg2.sub('',data)
    reg3=re.compile('<br>')
    data=reg3.sub('',data)
    return data
  #解析json
  def dealJSON(self):
    with open("WY.txt","a") as file:
      file.write('ID'+'|'+'評論'+'|'+'踩'+'|'+'頂'+'\n')
    for i in range(1,12):
      if i == 1:
        data=self.gethtml(self.url)
        data=self.Process(data,i)[:-1]
        value=json.loads(data)
        file=open('WY.txt','a')
        for item in value['hotPosts']:
          try:
            file.write(item['1']['f'].encode('utf-8')+'|')
            file.write(item['1']['b'].encode('utf-8')+'|')
            file.write(item['1']['a'].encode('utf-8')+'|')
            file.write(item['1']['v'].encode('utf-8')+'\n')
          except:
            continue
        file.close()
        print '--正在采集%d/12--'%i
        time.sleep(5)
      else:
        page=self.getpage(i)
        data = self.gethtml(page)
        data = self.Process(data,i)[:-2]
        # print data
        value=json.loads(data)
        # print value
        file=open('WY.txt','a')
        for item in value['newPosts']:
          try:
            file.write(item['1']['f'].encode('utf-8')+'|')
            file.write(item['1']['b'].encode('utf-8')+'|')
            file.write(item['1']['a'].encode('utf-8')+'|')
            file.write(item['1']['v'].encode('utf-8')+'\n')
          except:
            continue
        file.close()
        print '--正在采集%d/12--'%i
        time.sleep(5)
if __name__ == '__main__':
  WY().dealJSON()

以上就是我爬取的代碼了。

PS:這里再為大家提供2款非常方便的正則表達式工具供大家參考使用:

JavaScript正則表達式在線測試工具:
http://tools.jb51.net/regex/javascript

正則表達式在線生成工具:
http://tools.jb51.net/regex/create_reg

更多關(guān)于Python相關(guān)內(nèi)容可查看本站專題:《Python正則表達式用法總結(jié)》、《Python數(shù)據(jù)結(jié)構(gòu)與算法教程》、《Python Socket編程技巧總結(jié)》、《Python函數(shù)使用技巧總結(jié)》、《Python字符串操作技巧匯總》、《Python入門與進階經(jīng)典教程》及《Python文件與目錄操作技巧匯總

希望本文所述對大家Python程序設(shè)計有所幫助。

相關(guān)文章

最新評論

大埔区| 彭泽县| 青田县| 白河县| 临沭县| 蒙自县| 永德县| 梧州市| 哈巴河县| 醴陵市| 贵南县| 东光县| 安阳市| 新密市| 古蔺县| 玛纳斯县| 大化| 承德市| 南华县| 福州市| 塔河县| 年辖:市辖区| 东乡族自治县| 江安县| 安新县| 甘谷县| 金昌市| 和龙市| 遂平县| 随州市| 侯马市| 新龙县| 高陵县| 西城区| 法库县| 义马市| 新巴尔虎左旗| 韶关市| 昌江| 区。| 改则县|