最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

分析總結(jié)Python數(shù)據(jù)化運(yùn)營KMeans聚類

 更新時(shí)間:2021年08月25日 17:57:08   作者:Mr數(shù)據(jù)楊  
本文主要以 Python 使用 Keans 進(jìn)行聚類分析的簡單舉例應(yīng)用介紹聚類分析,它是探索性數(shù)據(jù)挖掘的主要任務(wù),也是統(tǒng)計(jì)數(shù)據(jù)分析的常用技術(shù),用于許多領(lǐng)域

內(nèi)容介紹

以 Python 使用 Keans 進(jìn)行聚類分析的簡單舉例應(yīng)用介紹聚類分析。

聚類分析 或 聚類 是對(duì)一組對(duì)象進(jìn)行分組的任務(wù),使得同一組(稱為聚類)中的對(duì)象(在某種意義上)與其他組(聚類)中的對(duì)象更相似(在某種意義上)。

它是探索性數(shù)據(jù)挖掘的主要任務(wù),也是統(tǒng)計(jì)數(shù)據(jù)分析的常用技術(shù),用于許多領(lǐng)域,包括機(jī)器學(xué)習(xí),模式識(shí)別,圖像分析,信息檢索,生物信息學(xué),數(shù)據(jù)壓縮和計(jì)算機(jī)圖形學(xué)。

一般應(yīng)用場(chǎng)景

目標(biāo)用戶的群體分類:

根據(jù)運(yùn)營或商業(yè)目的挑選出來的變量,對(duì)目標(biāo)群體進(jìn)行聚類,將目標(biāo)群體分成幾個(gè)有明顯的特征區(qū)別的細(xì)分群體,在運(yùn)營活動(dòng)中為這些細(xì)分群體采用精細(xì)化、個(gè)性化的運(yùn)營和服務(wù),提升運(yùn)營的效率和商業(yè)效果。

不同產(chǎn)品的價(jià)值組合:

按特定的指標(biāo)變量對(duì)眾多產(chǎn)品種類進(jìn)行聚類。將產(chǎn)品體系細(xì)分成具有不同價(jià)值、不同目的、多維度產(chǎn)品組合,在此基礎(chǔ)上制定相應(yīng)的產(chǎn)品開發(fā)計(jì)劃、運(yùn)營計(jì)劃和服務(wù)計(jì)劃。

探索、發(fā)現(xiàn)孤立點(diǎn)及異常值:

主要是風(fēng)控應(yīng)用。孤立點(diǎn)可能會(huì)存在欺詐的風(fēng)險(xiǎn)成分。

聚類的常見方法

分為基于劃分、層次、密度、網(wǎng)格、統(tǒng)計(jì)學(xué)、模型等類型的算法,典型算法包括K均值(經(jīng)典的聚類算法)、DBSCAN、兩步聚類、BIRCH、譜聚類等。

Keans聚類實(shí)現(xiàn)

import numpy as np
import matplotlib.pyplot as plt
from sklearn.cluster import KMeans
from sklearn import metrics
import random
# 隨機(jī)生成100組包含3組特征的數(shù)據(jù)
feature = [[random.random(),random.random(),random.random()] for i in range(100)]
label = [int(random.randint(0,2)) for i in range(100)]
# 轉(zhuǎn)換數(shù)據(jù)格式
x_feature = np.array(feature)
# 訓(xùn)練聚類模型
n_clusters = 3  # 設(shè)置聚類數(shù)量
model_kmeans = KMeans(n_clusters=n_clusters, random_state=0)  # 建立聚類模型對(duì)象
model_kmeans.fit(x_feature)  # 訓(xùn)練聚類模型
y_pre = model_kmeans.predict(x_feature)  # 預(yù)測(cè)聚類模型
y_pre

在這里插入圖片描述

聚類的評(píng)估指標(biāo)

inertias

是K均值模型對(duì)象的屬性,表示樣本距離最近的聚類中心的總和,它是作為在沒有真實(shí)分類結(jié)果標(biāo)簽下的非監(jiān)督式評(píng)估指標(biāo)。

該值越小越好,值越小證明樣本在類間的分布越集中,即類內(nèi)的距離越小。

# 樣本距離最近的聚類中心的總和
inertias = model_kmeans.inertia_ 

adjusted_rand_s:

調(diào)整后的蘭德指數(shù)(Adjusted Rand Index),蘭德指數(shù)通過考慮在預(yù)測(cè)和真實(shí)聚類中在相同或不同聚類中分配的所有樣本對(duì)和計(jì)數(shù)對(duì)來計(jì)算兩個(gè)聚類之間的相似性度量。

調(diào)整后的蘭德指數(shù)通過對(duì)蘭德指數(shù)的調(diào)整得到獨(dú)立于樣本量和類別的接近于0的值,其取值范圍為[-1, 1],負(fù)數(shù)代表結(jié)果不好,越接近于1越好意味著聚類結(jié)果與真實(shí)情況越吻合。

# 調(diào)整后的蘭德指數(shù)
adjusted_rand_s = metrics.adjusted_rand_score(label, y_pre)

mutual_info_s:

互信息(Mutual Information, MI),互信息是一個(gè)隨機(jī)變量中包含的關(guān)于另一個(gè)隨機(jī)變量的信息量,在這里指的是相同數(shù)據(jù)的兩個(gè)標(biāo)簽之間的相似度的量度,結(jié)果是非負(fù)值。

# 互信息
mutual_info_s = metrics.mutual_info_score(label, y_pre)

adjusted_mutual_info_s:

調(diào)整后的互信息(Adjusted Mutual Information, AMI),調(diào)整后的互信息是對(duì)互信息評(píng)分的調(diào)整得分。

它考慮到對(duì)于具有更大數(shù)量的聚類群,通常MI較高,而不管實(shí)際上是否有更多的信息共享,它通過調(diào)整聚類群的概率來糾正這種影響。

當(dāng)兩個(gè)聚類集相同(即完全匹配)時(shí),AMI返回值為1;隨機(jī)分區(qū)(獨(dú)立標(biāo)簽)平均預(yù)期AMI約為0,也可能為負(fù)數(shù)。

# 調(diào)整后的互信息
adjusted_mutual_info_s = metrics.adjusted_mutual_info_score(label, y_pre) 

homogeneity_s:

同質(zhì)化得分(Homogeneity),如果所有的聚類都只包含屬于單個(gè)類的成員的數(shù)據(jù)點(diǎn),則聚類結(jié)果將滿足同質(zhì)性。其取值范圍[0,1]值越大意味著聚類結(jié)果與真實(shí)情況越吻合。

# 同質(zhì)化得分
homogeneity_s = metrics.homogeneity_score(label, y_pre)  

completeness_s:

完整性得分(Completeness),如果作為給定類的成員的所有數(shù)據(jù)點(diǎn)是相同集群的元素,則聚類結(jié)果滿足完整性。其取值范圍[0,1],值越大意味著聚類結(jié)果與真實(shí)情況越吻合。

# 完整性得分
completeness_s = metrics.completeness_score(label, y_pre) 

v_measure_s:

它是同質(zhì)化和完整性之間的諧波平均值,v = 2 (均勻性 完整性)/(均勻性+完整性)。其取值范圍[0,1],值越大意味著聚類結(jié)果與真實(shí)情況越吻合。

v_measure_s = metrics.v_measure_score(label, y_pre) 

silhouette_s:

輪廓系數(shù)(Silhouette),它用來計(jì)算所有樣本的平均輪廓系數(shù),使用平均群內(nèi)距離和每個(gè)樣本的平均最近簇距離來計(jì)算,它是一種非監(jiān)督式評(píng)估指標(biāo)。其最高值為1,最差值為-1,0附近的值表示重疊的聚類,負(fù)值通常表示樣本已被分配到錯(cuò)誤的集群。

# 平均輪廓系數(shù)
silhouette_s = metrics.silhouette_score(x_feature, y_pre, metric='euclidean') 

calinski_harabaz_s:

該分?jǐn)?shù)定義為群內(nèi)離散與簇間離散的比值,它是一種非監(jiān)督式評(píng)估指標(biāo)。

# Calinski和Harabaz得分
calinski_harabaz_s = metrics.calinski_harabasz_score(x_feature, y_pre) 

聚類效果可視化

# 模型效果可視化
centers = model_kmeans.cluster_centers_  # 各類別中心
colors = ['#4EACC5', '#FF9C34', '#4E9A06']  # 設(shè)置不同類別的顏色
plt.figure()  # 建立畫布
for i in range(n_clusters):  # 循環(huán)讀類別
    index_sets = np.where(y_pre == i)  # 找到相同類的索引集合
    cluster = x_feature[index_sets]  # 將相同類的數(shù)據(jù)劃分為一個(gè)聚類子集
    plt.scatter(cluster[:, 0], cluster[:, 1], c=colors[i], marker='.')  # 展示聚類子集內(nèi)的樣本點(diǎn)
    plt.plot(centers[i][0], centers[i][1], 'o', markerfacecolor=colors[i], markeredgecolor='k',
             markersize=6)  # 展示各聚類子集的中心
plt.show()  # 展示圖像

在這里插入圖片描述

數(shù)據(jù)預(yù)測(cè)

# 模型應(yīng)用
new_X = [1, 3.6,9.9]
cluster_label = model_kmeans.predict(np.array(new_X).reshape(1,-1))
print ('聚類預(yù)測(cè)結(jié)果為: %d' % cluster_label)

在這里插入圖片描述

以上就是分析總結(jié)Python數(shù)據(jù)化運(yùn)營KMeans聚類的詳細(xì)內(nèi)容,更多關(guān)于Python數(shù)據(jù)化運(yùn)營KMeans聚類的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • 基于Python編寫簡易版的天天跑酷游戲的示例代碼

    基于Python編寫簡易版的天天跑酷游戲的示例代碼

    這篇文章主要介紹了如何利用Python編寫一個(gè)簡易版的天天跑酷游戲,文中的示例代碼講解詳細(xì),對(duì)我們學(xué)習(xí)Python有一定幫助,需要的可以參考一下
    2022-03-03
  • 在Python中利用Bokeh創(chuàng)建動(dòng)態(tài)數(shù)據(jù)可視化

    在Python中利用Bokeh創(chuàng)建動(dòng)態(tài)數(shù)據(jù)可視化

    在本文中,我們探討了如何利用 Bokeh 庫在 Python 中創(chuàng)建動(dòng)態(tài)數(shù)據(jù)可視化,我們介紹了 Bokeh 的基本概念和優(yōu)勢(shì),以及如何安裝 Bokeh 庫,對(duì)在Python中利用Bokeh創(chuàng)建動(dòng)態(tài)數(shù)據(jù)可視化相關(guān)知識(shí)感興趣的朋友跟隨小編一起看看吧
    2024-05-05
  • 基于Python的一個(gè)自動(dòng)錄入表格的小程序

    基于Python的一個(gè)自動(dòng)錄入表格的小程序

    這篇文章主要介紹了基于Python的一個(gè)自動(dòng)錄入表格的小程序,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-08-08
  • 2021年pycharm的最新安裝教程及基本使用圖文詳解

    2021年pycharm的最新安裝教程及基本使用圖文詳解

    這篇文章主要介紹了2021年pycharm的最新安裝教程及基本使用,本文通過圖文并茂的形式給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-04-04
  • django框架之cookie/session的使用示例(小結(jié))

    django框架之cookie/session的使用示例(小結(jié))

    這篇文章主要介紹了django框架之cookie/session的使用示例(小結(jié)),詳細(xì)的介紹了cookie和session技術(shù)的接口獲取等問題,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2018-10-10
  • python3.6 +tkinter GUI編程 實(shí)現(xiàn)界面化的文本處理工具(推薦)

    python3.6 +tkinter GUI編程 實(shí)現(xiàn)界面化的文本處理工具(推薦)

    這篇文章主要介紹了python3.6 +tkinter GUI編程 實(shí)現(xiàn)界面化的文本處理工具(推薦)的相關(guān)資料,需要的朋友可以參考下
    2017-12-12
  • Python 獲取項(xiàng)目根路徑的代碼

    Python 獲取項(xiàng)目根路徑的代碼

    這篇文章主要介紹了Python 獲取項(xiàng)目根路徑的代碼文中通過代碼給大家介紹了Python獲取當(dāng)前目錄和上級(jí)目錄,代碼簡單易懂,非常不錯(cuò),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2019-09-09
  • 在Python中使用base64模塊處理字符編碼的教程

    在Python中使用base64模塊處理字符編碼的教程

    這篇文章主要介紹了在Python中使用base64模塊處理字符編碼的教程,示例代碼基于Python2.x版本,需要的朋友可以參考下
    2015-04-04
  • 使用Python模塊進(jìn)行數(shù)據(jù)處理的詳細(xì)步驟

    使用Python模塊進(jìn)行數(shù)據(jù)處理的詳細(xì)步驟

    Python 提供了豐富的模塊和庫,用于處理各種類型的數(shù)據(jù),本文介紹了一些常用的模塊和庫,以及如何使用它們進(jìn)行數(shù)據(jù)處理的詳細(xì)步驟和代碼示例,對(duì)我們的學(xué)習(xí)或工作有一定的幫助,需要的朋友可以參考下
    2025-02-02
  • python實(shí)現(xiàn)四人制撲克牌游戲

    python實(shí)現(xiàn)四人制撲克牌游戲

    這篇文章主要介紹了python實(shí)現(xiàn)四人制撲克牌游戲,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2020-04-04

最新評(píng)論

江阴市| 平南县| 霍林郭勒市| 长海县| 平武县| 龙胜| 鲁山县| 若尔盖县| 砚山县| 黔东| 灌云县| 原平市| 疏勒县| 宝坻区| 拉孜县| 阿克苏市| 阿巴嘎旗| 桃园市| 中卫市| 锦州市| 贵南县| 凤翔县| 贵州省| 呼伦贝尔市| 宽城| 泾川县| 扎囊县| 安庆市| 建瓯市| 临城县| 清水县| 淮阳县| 永济市| 酒泉市| 涞源县| 九江县| 高邑县| 揭西县| 双辽市| 招远市| 逊克县|