最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python數(shù)據(jù)分析之真實IP請求Pandas詳解

 更新時間:2016年11月18日 11:16:41   投稿:daisy  
這篇文章主要給大家介紹了Python數(shù)據(jù)分析之真實IP請求Pandas,文中通過示例嗲嗎給大家介紹的很詳細,相信對大家的學習或者理解具有一定的參考借鑒價值,有需要的朋友們可以參考借鑒,下面來一起學習學習吧。

前言

pandas 是基于 Numpy 構(gòu)建的含有更高級數(shù)據(jù)結(jié)構(gòu)和工具的數(shù)據(jù)分析包類似于 Numpy 的核心是 ndarray,pandas 也是圍繞著 Series 和 DataFrame 兩個核心數(shù)據(jù)結(jié)構(gòu)展開的 。Series 和 DataFrame 分別對應于一維的序列和二維的表結(jié)構(gòu)。pandas 約定俗成的導入方法如下:

from pandas import Series,DataFrame
import pandas as pd

1.1. Pandas分析步驟

    1、載入日志數(shù)據(jù)

    2、載入area_ip數(shù)據(jù)

    3、將 real_ip 請求數(shù) 進行 COUNT。類似如下SQL:

SELECT inet_aton(l.real_ip),
  count(*),
  a.addr
FROM log AS l
INNER JOIN area_ip AS a
  ON a.start_ip_num <= inet_aton(l.real_ip)
  AND a.end_ip_num >= inet_aton(l.real_ip)
GROUP BY real_ip
ORDER BY count(*)
LIMIT 0, 100;

1.2. 代碼

cat pd_ng_log_stat.py
#!/usr/bin/env python
#-*- coding: utf-8 -*-
 
from ng_line_parser import NgLineParser
 
import pandas as pd
import socket
import struct
 
class PDNgLogStat(object):
 
  def __init__(self):
    self.ng_line_parser = NgLineParser()
 
  def _log_line_iter(self, pathes):
    """解析文件中的每一行并生成一個迭代器"""
    for path in pathes:
      with open(path, 'r') as f:
        for index, line in enumerate(f):
          self.ng_line_parser.parse(line)
          yield self.ng_line_parser.to_dict()
 
  def _ip2num(self, ip):
    """用于IP轉(zhuǎn)化為數(shù)字"""
    ip_num = -1
    try:
      # 將IP轉(zhuǎn)化成INT/LONG 數(shù)字
      ip_num = socket.ntohl(struct.unpack("I",socket.inet_aton(str(ip)))[0])
    except:
      pass
    finally:
      return ip_num
 
  def _get_addr_by_ip(self, ip):
    """通過給的IP獲得地址"""
    ip_num = self._ip2num(ip)
 
    try:
      addr_df = self.ip_addr_df[(self.ip_addr_df.ip_start_num <= ip_num) & 
                   (ip_num <= self.ip_addr_df.ip_end_num)]
      addr = addr_df.at[addr_df.index.tolist()[0], 'addr']
      return addr
    except:
      return None
           
  def load_data(self, path):
    """通過給的文件路徑加載數(shù)據(jù)生成 DataFrame"""
    self.df = pd.DataFrame(self._log_line_iter(path))
 
 
  def uv_real_ip(self, top = 100):
    """統(tǒng)計cdn ip量"""
    group_by_cols = ['real_ip'] # 需要分組的列,只計算和顯示該列
     
    # 直接統(tǒng)計次數(shù)
    url_req_grp = self.df[group_by_cols].groupby(
                   self.df['real_ip'])
    return url_req_grp.agg(['count'])['real_ip'].nlargest(top, 'count')
     
  def uv_real_ip_addr(self, top = 100):
    """統(tǒng)計real ip 地址量"""
    cnt_df = self.uv_real_ip(top)
 
    # 添加 ip 地址 列
    cnt_df.insert(len(cnt_df.columns),
           'addr',
           cnt_df.index.map(self._get_addr_by_ip))
    return cnt_df
     
  def load_ip_addr(self, path):
    """加載IP"""
    cols = ['id', 'ip_start_num', 'ip_end_num',
        'ip_start', 'ip_end', 'addr', 'operator']
    self.ip_addr_df = pd.read_csv(path, sep='\t', names=cols, index_col='id')
    return self.ip_addr_df
 
def main():
  file_pathes = ['www.ttmark.com.access.log']
 
  pd_ng_log_stat = PDNgLogStat()
  pd_ng_log_stat.load_data(file_pathes)
 
  # 加載 ip 地址
  area_ip_path = 'area_ip.csv'
  pd_ng_log_stat.load_ip_addr(area_ip_path)
 
  # 統(tǒng)計 用戶真實 IP 訪問量 和 地址
  print pd_ng_log_stat.uv_real_ip_addr()
 
if __name__ == '__main__':
  main()

運行統(tǒng)計和輸出結(jié)果

python pd_ng_log_stat.py
 
         count  addr
real_ip            
60.191.123.80  101013 浙江省杭州市
-        32691  None
218.30.118.79  22523   北京市
......
136.243.152.18   889   德國
157.55.39.219   889   美國
66.249.65.170   888   美國
 
[100 rows x 2 columns]

總結(jié)

以上就是這篇文章的全部內(nèi)容了,希望本文的內(nèi)容對大家的學習或者工作帶來一定的幫助,如果有疑問大家可以留言交流。

相關(guān)文章

  • Python使用gRPC實現(xiàn)數(shù)據(jù)分析能力的共享

    Python使用gRPC實現(xiàn)數(shù)據(jù)分析能力的共享

    gRPC是一個高性能、開源、通用的遠程過程調(diào)用(RPC)框架,由Google推出,本文主要介紹了Python如何使用gRPC實現(xiàn)數(shù)據(jù)分析能力的共享,感興趣的可以了解下
    2024-02-02
  • Python?statistics模塊示例詳解

    Python?statistics模塊示例詳解

    這篇文章主要介紹了Python?statistics模塊示例詳解,本文總結(jié)了 statistics 模塊的常規(guī)操作,對于數(shù)據(jù)分析還是非常有益處的,需要的朋友可以參考下
    2023-05-05
  • Python獲取網(wǎng)頁數(shù)據(jù)詳解流程

    Python獲取網(wǎng)頁數(shù)據(jù)詳解流程

    讀萬卷書不如行萬里路,只學書上的理論是遠遠不夠的,只有在實戰(zhàn)中才能獲得能力的提升,本篇文章手把手帶你用Python來獲取網(wǎng)頁的數(shù)據(jù),主要應用了Requests庫,大家可以在過程中查缺補漏,提升水平
    2021-10-10
  • Python讀寫yaml文件

    Python讀寫yaml文件

    這篇文章主要介紹了Python讀寫yaml文件,yaml?是專門用來寫配置文件的語言,非常簡潔和強大,之前用ini也能寫配置文件,有點類似于json格式,下面關(guān)于Python讀寫yaml文件的詳細資料,需要的小伙伴可以參考一下
    2022-03-03
  • Python對Excel按列值篩選并拆分表格到多個文件的代碼

    Python對Excel按列值篩選并拆分表格到多個文件的代碼

    這篇文章主要介紹了Python對Excel按列值篩選并拆分表格到多個文件,本文通過代碼給大家介紹的非常詳細,需要的朋友可以參考下
    2019-11-11
  • Python中列表的高級索引技巧分享

    Python中列表的高級索引技巧分享

    列表是?Python?中最常用的數(shù)據(jù)結(jié)構(gòu)之一,它允許你存儲多個元素,并且可以通過索引來訪問這些元素,本文將帶你深入了解?Python?列表的高級索引技巧,希望對大家有所幫助
    2025-01-01
  • Python實現(xiàn)針對中文排序的方法

    Python實現(xiàn)針對中文排序的方法

    這篇文章主要介紹了Python實現(xiàn)針對中文排序的方法,結(jié)合實例形式較為詳細的分析了Python針對中文進行排序操作出現(xiàn)的問題與相關(guān)處理技巧,需要的朋友可以參考下
    2017-05-05
  • 詳解python多線程之間的同步(一)

    詳解python多線程之間的同步(一)

    這篇文章主要介紹了python多線程之間的同步,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2019-04-04
  • Python異常處理例題整理

    Python異常處理例題整理

    在本篇文章里
    2019-07-07
  • python讀取raw binary圖片并提取統(tǒng)計信息的實例

    python讀取raw binary圖片并提取統(tǒng)計信息的實例

    今天小編就為大家分享一篇python讀取raw binary圖片并提取統(tǒng)計信息的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01

最新評論

平昌县| 抚州市| 屯昌县| 舟山市| 梧州市| 西华县| 江陵县| 镇平县| 大连市| 文安县| 丰宁| 昭苏县| 南通市| 新沂市| 徐汇区| 镇赉县| 淳化县| 将乐县| 哈尔滨市| 彩票| 周至县| 五河县| 贡觉县| 广德县| 峨眉山市| 芜湖市| 双峰县| 禄劝| 即墨市| 镇巴县| 泗洪县| 白朗县| 汾阳市| 临朐县| 潼南县| 太保市| 嘉兴市| 迁安市| 灵川县| 万全县| 沈阳市|