最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

詳解DBSCAN算法原理及其Python實(shí)現(xiàn)

 更新時間:2023年12月08日 09:13:12   作者:微小冷  
DBSCAN,即Density-Based Spatial Clustering of Applications with Noise,基于密度的噪聲應(yīng)用空間聚類,本文將詳細(xì)介紹DBSCAN算法的原理及其Python實(shí)現(xiàn),需要的可以參考下

原理

DBSCAN,即Density-Based Spatial Clustering of Applications with Noise,基于密度的噪聲應(yīng)用空間聚類。

在DBSCAN算法中,將數(shù)據(jù)點(diǎn)分為三類:

1.核心點(diǎn):若樣本xi的ε鄰域內(nèi)至少包含了M個點(diǎn),則為核心點(diǎn)

2.邊界點(diǎn):若樣本xi的ε鄰域內(nèi)包含的點(diǎn)數(shù)小于M,但在其他核心點(diǎn)的ε鄰域內(nèi),則為邊界點(diǎn)

3.噪聲:既非核心點(diǎn)也非邊界點(diǎn)則為噪聲

那么,在實(shí)際實(shí)現(xiàn)DBSCAN算法時,對這三種點(diǎn)理應(yīng)采取不同的操作

1.若一個點(diǎn)是核心點(diǎn),那么應(yīng)該窮盡所有與其相連接的邊界點(diǎn),再得到與邊界點(diǎn)相連接的所有點(diǎn),知道遍歷完整個點(diǎn)集。

2.若一個點(diǎn)是邊界點(diǎn),若這個點(diǎn)尚未歸類;若已經(jīng)歸類,則如1中所說,繼續(xù)搜索與其相連的點(diǎn)。

3.若為噪聲,則直接跳過。

可見,DBSCAN算法需要兩個參數(shù),分別是鄰域半徑ε和點(diǎn)數(shù)M。

Python實(shí)現(xiàn)

為了衡量兩點(diǎn)之間的距離,計(jì)算一個距離矩陣以備調(diào)用,可以降低計(jì)算次數(shù)。對于一組點(diǎn)集data,其歐氏距離矩陣的求解方法如下

# 距離矩陣
def disMat(data):
    arr = np.array(data)
    dMat = lambda arr : arr.reshape(1,-1) - arr.reshape(-1,1)
    # 此為單個軸的距離矩陣
    mats = [dMat(arr[:,i]) for i in range(arr.shape[1])]
    return np.linalg.norm(mats, axis=0)

其中,dMat用于求解一維向量的距離矩陣。

下面則是基于距離矩陣的DBSCAN算法。

import numpy as np

class DBSCAN(object):
    # e 最小距離, minPts 最少樣本數(shù)量
    def __init__(self, e, minPts):
        self.e = e
        self.minPts = minPts

    # 獲取點(diǎn)id的臨近點(diǎn)
    def nearby(self, id):
        return np.where(self.mat[id] <= self.e)[0]

    def searchNearbyPts(self, points, group):
        for id in points:
            if id not in self.data:
                continue

            group.append(id)
            self.data.remove(id)

            # 查看id點(diǎn)的臨近點(diǎn)
            nearbyPts = self.nearby(id)
            if len(nearbyPts) >= self.minPts:
                self.searchNearbyPts(nearbyPts, group)

    def fit(self, mat):
        self.mat = mat
        groups = list()

        keys = range(mat.shape[0])
        self.data = list(keys)

        for id in keys:
            if id not in self.data:
                continue

            # id點(diǎn)的臨近點(diǎn)
            nearbyPts = self.nearby(id)
            if len(nearbyPts) < self.minPts:
                continue

            group = [id]
            self.data.remove(id)
            self.searchNearbyPts(nearbyPts, group)
            groups.append(group)

        # 加入飛點(diǎn)
        groups += self.data
        return groups

在上面的DBSCAN類中,fit相當(dāng)于執(zhí)行聚類的開關(guān),其輸入?yún)?shù)mat是點(diǎn)集的距離矩陣。

self.data是點(diǎn)的序號的列表。其中的for循環(huán)是DBSCAN算法的核心部分,其基本邏輯是,如果一個點(diǎn)已經(jīng)被歸類了,那么就從self.data中刪除;如果這個點(diǎn)恰好又是核心點(diǎn),那么就要搜尋其所有的鄰近點(diǎn)。

函數(shù)nearby用于查找序號為id的點(diǎn)的所有臨近點(diǎn),searchNearbyPts則將某點(diǎn)的所有臨近點(diǎn)進(jìn)行歸類。

驗(yàn)證

其數(shù)據(jù)生成、繪圖代碼如下所示

# 初始化數(shù)據(jù)
def initData(num, min, max):
    return [np.random.randint(min, max, size=2) for _ in range(num)]

def drawRes(data, groups):
    for gp in groups:
        xy = np.array([data[i] for i in gp])
        plt.scatter(xy[:,0], xy[:,1])
    plt.title(u'DBSCAN')
    plt.grid()
    plt.tight_layout()
    plt.show()

if __name__ == '__main__':
    np.random.seed(42)
    ds1 = initData(20, 0, 30)
    ds2 = initData(20, 40, 60)
    ds3 = initData(20, 70, 100)
    ds = ds1 + ds2 + ds3

    score_mat = disMat(ds)

    groups = DBSCAN(20, 3).fit(score_mat)
    drawRes(ds, groups)

聚類結(jié)果為

到此這篇關(guān)于詳解DBSCAN算法原理及其Python實(shí)現(xiàn)的文章就介紹到這了,更多相關(guān)Python DBSCAN算法內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python如何對數(shù)組進(jìn)行降維

    python如何對數(shù)組進(jìn)行降維

    這篇文章主要介紹了python如何對數(shù)組進(jìn)行降維問題,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2023-05-05
  • Python獲取當(dāng)前目錄下所有文件的6種方法總結(jié)

    Python獲取當(dāng)前目錄下所有文件的6種方法總結(jié)

    這篇文章主要給大家介紹了關(guān)于Python獲取當(dāng)前目錄下所有文件的6種方法,要獲取當(dāng)前目錄下的所有目錄,可以使用Python內(nèi)置的os模塊中的listdir()函數(shù)和isdir()函數(shù),需要的朋友可以參考下
    2023-08-08
  • 在Pytorch中簡單使用tensorboard

    在Pytorch中簡單使用tensorboard

    今天給大家?guī)淼氖顷P(guān)于Python的相關(guān)知識,文章圍繞著Pytorch使用tensorboard展開,文中有非常詳細(xì)的介紹及代碼示例,需要的朋友可以參考下
    2021-06-06
  • Anaconda安裝pytorch及配置PyCharm 2021環(huán)境

    Anaconda安裝pytorch及配置PyCharm 2021環(huán)境

    小編使用的是python3.8版本,為了防止訪問量過大導(dǎo)致http連接失敗,所以采用本地安裝,具體安裝方法本文給大家詳細(xì)介紹,在文章底部給大家提到了PyCharm 2021配置環(huán)境的方法,感興趣的朋友一起看看吧
    2021-06-06
  • 如何利用Matlab制作一款真正的拼圖小游戲

    如何利用Matlab制作一款真正的拼圖小游戲

    這篇文章主要給大家介紹了關(guān)于如何利用Matlab制作一款真正的拼圖小游戲的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-05-05
  • python用folium繪制地圖并設(shè)置彈窗效果

    python用folium繪制地圖并設(shè)置彈窗效果

    這篇文章主要介紹了python用folium繪制地圖并設(shè)置彈窗,本文通過實(shí)例代碼給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-09-09
  • 利用Python模擬谷歌的小恐龍游戲

    利用Python模擬谷歌的小恐龍游戲

    谷歌流量器中有個很有名的彩蛋:當(dāng)你網(wǎng)絡(luò)出現(xiàn)問題時,就會出現(xiàn)一個“小恐龍游戲”。本文就主要為大家介紹了如何用Python模擬實(shí)現(xiàn)這一小游戲,感興趣的同學(xué)可以學(xué)習(xí)一下
    2021-12-12
  • 提高python代碼可讀性利器pycodestyle使用詳解

    提高python代碼可讀性利器pycodestyle使用詳解

    鑒于 Python 在數(shù)據(jù)科學(xué)中的流行,我將深入研究 pycodestyle 的使用方法,以提高 Python 代碼的質(zhì)量和可讀性。如果你想提升代碼質(zhì)量,歡迎收藏學(xué)習(xí),有所收獲,點(diǎn)贊支持
    2021-11-11
  • Python判斷Nan值的五種方式小結(jié)

    Python判斷Nan值的五種方式小結(jié)

    這篇文章主要介紹了Python判斷Nan值的五種方式小結(jié),具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-05-05
  • Python繪制動態(tài)的521玫瑰花

    Python繪制動態(tài)的521玫瑰花

    敲了這么多年代碼,每年都得畫一些心啊花啊什么的,所以現(xiàn)在常規(guī)的已經(jīng)有些倦怠了,至少也得來個三維圖形才看著比較合理,所以本文就來繪制一個動態(tài)的玫瑰花吧
    2023-05-05

最新評論

芦山县| 正定县| 台北县| 怀化市| 青川县| 康马县| 赤水市| 苍溪县| 专栏| 老河口市| 白山市| 鹤壁市| 巴林右旗| 宜章县| 白山市| 潮州市| 科技| 合肥市| 镇康县| 商南县| 澜沧| 辛集市| 精河县| 库车县| 旅游| 清丰县| 文登市| 上饶市| 蛟河市| 靖江市| 河北省| 台湾省| 邻水| 余干县| 贞丰县| 保德县| 奇台县| 鸡东县| 铜鼓县| 昭觉县| 得荣县|