最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python抽取指定url頁面的title方法

 更新時間:2018年05月11日 15:21:44   作者:Together_CZ  
今天小編就為大家分享一篇python抽取指定url頁面的title方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧

今天簡單使用了一下python的re模塊和lxml模塊,分別利用的它們提供的正則表達式和xpath來解析頁面源碼從中提取所需的title,xpath在完成這樣的小任務(wù)上效率非常好,在這里之所以又使用了一下正則表達式是因為xpath在處理一些特殊的頁面的時候會出現(xiàn)亂碼的情況,當然這不是xpath的原因,而是頁面本身編碼,跟utf-8轉(zhuǎn)碼之間有沖突所致,這里看代碼:

# !/usr/bin/python
#-*-coding:utf-8-*-
'''
功能:抽取指定url的頁面內(nèi)容中的title
'''
import re
import chardet
import urllib
from lxml import etree
def utf8_transfer(strs):
 '''
 utf8編碼轉(zhuǎn)換
 '''
 try:
  if isinstance(strs, unicode):
   strs = strs.encode('utf-8')
  elif chardet.detect(strs)['encoding'] == 'GB2312':
   strs = strs.decode("gb2312", 'ignore').encode('utf-8')
  elif chardet.detect(strs)['encoding'] == 'utf-8':
   strs = strs.decode('utf-8', 'ignore').encode('utf-8')
 except Exception, e:
  print 'utf8_transfer error', strs, e
 return strs
def get_title_xpath(Html):
 '''
 用xpath抽取網(wǎng)頁Title
 '''
 Html = utf8_transfer(Html)
 Html_encoding = chardet.detect(Html)['encoding']
 page = etree.HTML(Html, parser=etree.HTMLParser(encoding=Html_encoding))
 title = page.xpath('/html/head/title/text()')
 try:
  title = title[0].strip()
 except IndexError:
  print 'Nothing'
 print title
def get_title(Html):
 '''
 用re抽取網(wǎng)頁Title
 '''
 Html = utf8_transfer(Html)
 compile_rule = ur'<title>.*</title>'
 title_list = re.findall(compile_rule, Html)
 if title_list == []:
  title = ''
 else:
  title = title_list[0][7:-8]
 print title
if __name__ == '__main__':
	url = 'http://www.baidu.com'
	html = urllib.urlopen(url).read()
	new_html = utf8_transfer(html)
	try:
		get_title_xpath(new_html)
		get_title(new_html)
	except Exception, e:
		print e

下面是結(jié)果:

百度一下,你就知道
百度一下,你就知道

簡單的小實踐,繼續(xù)學習,歡迎交流。

以上這篇python抽取指定url頁面的title方法就是小編分享給大家的全部內(nèi)容了,希望能給大家一個參考,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python如何快速實現(xiàn)分布式任務(wù)

    Python如何快速實現(xiàn)分布式任務(wù)

    這篇文章主要介紹了Python如何快速實現(xiàn)分布式任務(wù),小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2017-07-07
  • python中ImageTk.PhotoImage()不顯示圖片卻不報錯問題解決

    python中ImageTk.PhotoImage()不顯示圖片卻不報錯問題解決

    這篇文章主要給大家介紹了關(guān)于在python中ImageTk.PhotoImage()不顯示圖片卻不報錯問題的解決方法,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2018-12-12
  • Pycharm-community-2021版安裝和配置

    Pycharm-community-2021版安裝和配置

    pycharm-community-PyCharm是一種Python IDE,帶有一整套可以幫助用戶在使用Python語言開發(fā)時提高其效率的工具,本文就來介紹一下Pycharm-community-2021版安裝和配置,感興趣的可以了解一下
    2023-11-11
  • Python?pytest自動化測試庫十個強大用法示例

    Python?pytest自動化測試庫十個強大用法示例

    本文將介紹Python的pytest庫的10個強大用法,并提供相應(yīng)的代碼示例,幫助你更好地理解和應(yīng)用單元測試,它提供了許多高級功能和便利的用法,能夠讓我們更輕松地編寫和執(zhí)行單元測試
    2024-01-01
  • python基礎(chǔ)之輸入與輸出

    python基礎(chǔ)之輸入與輸出

    這篇文章主要介紹了python的輸入與輸出,實例分析了Python中返回一個返回值與多個返回值的方法,需要的朋友可以參考下
    2021-10-10
  • 對Python中的@classmethod用法詳解

    對Python中的@classmethod用法詳解

    下面小編就為大家分享一篇對Python中的@classmethod用法詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-04-04
  • Django模塊學習之模塊語言詳解

    Django模塊學習之模塊語言詳解

    模板語言渲染的整個過程其實就是將html轉(zhuǎn)換成函數(shù),并為該函數(shù)提供全局變量,然后執(zhí)行該函數(shù),下面這篇文章主要給大家介紹了關(guān)于Django模塊學習之模塊語言的相關(guān)資料,需要的朋友可以參考下
    2021-11-11
  • Python txt文件常用讀寫操作代碼實例

    Python txt文件常用讀寫操作代碼實例

    這篇文章主要介紹了Python txt文件常用讀寫操作代碼實例,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-08-08
  • python?序列去重并保持原始順序操作

    python?序列去重并保持原始順序操作

    這篇文章主要介紹了python序列去重并保持原始順序操作,文章圍繞了python?序列去重的相關(guān)資料展開詳細介紹,需要的小伙伴可以參考一下,希望對你的有所幫助
    2022-03-03
  • python第三方庫pygame的使用詳解

    python第三方庫pygame的使用詳解

    這篇文章主要介紹了python第三方庫pygame的使用,pygame一般用來做游戲,在這需要注意在使用pygame提供的功能之前,需要調(diào)用init方法,本文給大家介紹的非常詳細,需要的朋友可以參考下
    2022-08-08

最新評論

瑞金市| 儋州市| 昌平区| 山西省| 永和县| 鲁山县| 上犹县| 武义县| 宝清县| 丰城市| 巫溪县| 三亚市| 平顺县| 安义县| 宣城市| 汨罗市| 莱阳市| 大关县| 大庆市| 新安县| 新宾| 罗江县| 宁明县| 隆化县| 揭西县| 平谷区| 苗栗市| 大兴区| 黑山县| 大庆市| 平定县| 金沙县| 时尚| 兴安县| 南安市| 依安县| 永和县| 澄迈县| 大姚县| 阳江市| 隆昌县|