最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python提取頁面內(nèi)url列表的方法

 更新時(shí)間:2015年05月25日 12:27:51   作者:小蘿莉  
這篇文章主要介紹了python提取頁面內(nèi)url列表的方法,涉及Python操作頁面元素的相關(guān)技巧,需要的朋友可以參考下

本文實(shí)例講述了python提取頁面內(nèi)url列表的方法。分享給大家供大家參考。具體實(shí)現(xiàn)方法如下:

from bs4 import BeautifulSoup
import time,re,urllib2
t=time.time()
websiteurls={}
def scanpage(url):
  websiteurl=url
  t=time.time()
  n=0
  html=urllib2.urlopen(websiteurl).read()
  soup=BeautifulSoup(html)
  pageurls=[]
  Upageurls={}
  pageurls=soup.find_all("a",href=True)
  for links in pageurls:
    if websiteurl in links.get("href") and links.get("href") not in Upageurls and links.get("href") not in websiteurls:
      Upageurls[links.get("href")]=0
  for links in Upageurls.keys():
    try:
      urllib2.urlopen(links).getcode()
    except:
      print "connect failed"
    else:
      t2=time.time()
      Upageurls[links]=urllib2.urlopen(links).getcode()
      print n,
      print links,
      print Upageurls[links]
      t1=time.time()
      print t1-t2
    n+=1
  print ("total is "+repr(n)+" links")
  print time.time()-t
scanpage("http://news.163.com/")

希望本文所述對(duì)大家的Python程序設(shè)計(jì)有所幫助。

相關(guān)文章

最新評(píng)論

二手房| 达拉特旗| 余干县| 凤凰县| 新泰市| 安塞县| 崇阳县| 土默特左旗| 治多县| 衡阳县| 甘孜县| 吴桥县| 连江县| 长武县| 麦盖提县| 丹东市| 寿光市| 屏东县| 宁河县| 宿州市| 阳春市| 威海市| 全州县| 江北区| 吉林省| 涡阳县| 松阳县| 东阳市| 灌云县| 孟连| 盐边县| 宜都市| 济南市| 南投市| 巴楚县| 唐河县| 上高县| 鞍山市| 小金县| 葫芦岛市| 临夏县|