最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

數(shù)據(jù)分析崗面試題與參考答案解析

  發(fā)布時(shí)間:2019-12-13 14:08:19   作者:小力子~   我要評(píng)論
這篇文章主要介紹了數(shù)據(jù)分析崗面試題與參考答案,總結(jié)分析了數(shù)據(jù)分析崗位招聘的常見面試題所涉及的知識(shí)點(diǎn)與參考答案,需要的朋友可以參考下

1.怎么做惡意刷單檢測?

a. 選取特征利用機(jī)器學(xué)習(xí)方法做分類。
特征: 結(jié)合商家特征和環(huán)境特征做商家惡意刷單分類預(yù)測,結(jié)合用戶行為特征和環(huán)境特征做用戶惡意刷單分類預(yù)測。
1)商家特征:商家歷史銷量、信用、產(chǎn)品類別、發(fā)貨快遞公司等。
2)用戶行為特征:用戶信用、下單量、下單路徑、瀏覽店鋪行為、支付賬號(hào)。
3)環(huán)境特征(主要是避免機(jī)器刷單):地區(qū)、ip、手機(jī)型號(hào)等。
注:構(gòu)造特征。刷單的評(píng)論文本可能套路較為一致,計(jì)算與已標(biāo)注評(píng)論文本的相似度作為特征。
機(jī)器學(xué)習(xí)方法: 決策樹, 感知機(jī), 邏輯回歸, 支持向量機(jī), 隨機(jī)森林
b. 異常檢測:ip地址經(jīng)常變動(dòng)(固定時(shí)間內(nèi)變動(dòng)次數(shù))、賬號(hào)近期交易成功率上升(固定時(shí)間內(nèi)交易成功率)------利用箱型圖進(jìn)行結(jié)構(gòu)化檢測。
機(jī)器學(xué)習(xí)中的異常檢測手段:
1)總體來講,異常檢測問題可以概括為兩類:一是對(duì)結(jié)構(gòu)化數(shù)據(jù)的異常檢測,二是對(duì)非結(jié)構(gòu)化數(shù)據(jù)(通過對(duì)圖像目標(biāo)檢測,識(shí)別出異常點(diǎn))的異常檢測。
2)對(duì)結(jié)構(gòu)化數(shù)據(jù)的異常檢測的解決思想主要是通過找出與正常數(shù)據(jù)集差異較大的離群點(diǎn),把離群點(diǎn)作為異常點(diǎn)。常常面臨的問題有二:一是需要定義一個(gè)清晰的決策邊界,從而界定正常點(diǎn)與異常點(diǎn);二是維數(shù)災(zāi)難及交叉指標(biāo)計(jì)算之間的高頻計(jì)算性能瓶頸。
3)結(jié)構(gòu)化的數(shù)據(jù)的異常檢測手段:圖形位置分布(箱型圖), 統(tǒng)計(jì)方法檢測(切比雪夫不等式的方法能夠有效地劃分出三個(gè)類別,包括正常數(shù)據(jù)、異常數(shù)據(jù)、未知數(shù)據(jù))+距離檢測(距離位置檢測有一個(gè)非常強(qiáng)的假設(shè):正常的數(shù)據(jù)都比較集中,有較多的鄰居,而異常數(shù)據(jù)都特立獨(dú)行。未知數(shù)據(jù)的簇里面尋找出與正常數(shù)據(jù)更不相似的,或者和異常數(shù)據(jù)更相似的數(shù)據(jù)就可以了。)

2.K-means算法

a. k-means原理: 隨機(jī)選擇k個(gè)中心點(diǎn),把每個(gè)數(shù)據(jù)點(diǎn)分配到離它最近的中心點(diǎn),重新計(jì)算每個(gè)簇的質(zhì)心,直到質(zhì)心不發(fā)生變化。
b. 改進(jìn)
1) kmeans++:初始隨機(jī)點(diǎn)選擇盡可能遠(yuǎn),避免陷入局部解。
2 ) ISODATA:對(duì)于難以確定k的時(shí)候,使用該方法。思路是當(dāng)類下的樣本小時(shí),剔除;類下樣本數(shù)量多時(shí),拆分。
3 )kernel kmeans:kmeans用歐氏距離計(jì)算相似度,也可以使用kernel映射到高維空間再聚類。
c. 遇到異常值:
1 )局部異常因子LOF:如果點(diǎn)p的密度明顯小于其鄰域點(diǎn)的密度,那么點(diǎn)p可能是異常值.。
2 ) 使用PCA或自動(dòng)編碼機(jī)進(jìn)行異常點(diǎn)檢測:使用降維后的維度作為新的特征空間,其降維結(jié)果可以認(rèn)為剔除了異常值的影響(因?yàn)檫^程是保留使投影后方差最大的投影方向)。
3 ) winsorize:對(duì)于簡單的,可以對(duì)單一維度做上下截取。
d. 評(píng)估聚類算法的指標(biāo)

  • 1 ) 外部法(基于有標(biāo)注):Jaccard系數(shù)、純度

    2 ) 內(nèi)部法(無標(biāo)注):內(nèi)平方和WSS和外平方和BSS

    3 ) 此外還要考慮到算法的時(shí)間空間復(fù)雜度、聚類穩(wěn)定性等
    e. k-means算法的問題: 對(duì)異常值和初值敏感。當(dāng)有異常值是,質(zhì)心可能就會(huì)離大多數(shù)點(diǎn)比較遠(yuǎn)。比如1,2,3,4,100五個(gè)樣本,均值是22,這樣類別中心就離樣本較遠(yuǎn),這時(shí)選取中位數(shù)做為質(zhì)心是更好的選擇,這就是k-Mediods(k-中值)聚類算法。同時(shí)k-means是初值敏感的,即當(dāng)選取不同的初始值時(shí)分類結(jié)果可能不同。
    f. K值的選擇
    1)這個(gè)真的沒有確定的做法,分幾類主要取決于個(gè)人的經(jīng)驗(yàn)與感覺,通常的做法是多嘗試幾個(gè)K值,看分成幾類的結(jié)果更好解釋,更符合分析目的等。
    2)對(duì)于難以確定k的時(shí)候,使用ISODATA,思路是當(dāng)類下的樣本小時(shí),剔除;類下樣本數(shù)量多時(shí),拆分。
    3)手肘法,當(dāng)k小于真實(shí)聚類數(shù)時(shí),由于k的增大會(huì)大幅增加每個(gè)簇的聚合程度,故SSE的下降幅度會(huì)很大,而當(dāng)k到達(dá)真實(shí)聚類數(shù)時(shí),再增加k所得到的聚合程度回報(bào)會(huì)迅速變小,所以SSE的下降幅度會(huì)驟減,然后隨著k值的繼續(xù)增大而趨于平緩,也就是說SSE和k的關(guān)系圖是一個(gè)手肘的形狀,而這個(gè)肘部對(duì)應(yīng)的k值就是數(shù)據(jù)的真實(shí)聚類數(shù)。
    4)使用輪廓系數(shù)(silhouette coefficient)來確定,選擇使系數(shù)較大所對(duì)應(yīng)的k值
    kmeans最優(yōu)k值的確定方法-手肘法和輪廓系數(shù)法:https://www.jianshu.com/p/335b376174d4
    g.初始的K個(gè)質(zhì)心怎么選?
    最常用的方法是隨機(jī)選,初始質(zhì)心的選取對(duì)最終聚類結(jié)果有影響,因此算法一定要多執(zhí)行幾次,哪個(gè)結(jié)果更reasonable,就用哪個(gè)結(jié)果。 當(dāng)然也有一些優(yōu)化的方法,第一種是選擇彼此距離最遠(yuǎn)的點(diǎn),具體來說就是先選第一個(gè)點(diǎn),然后選離第一個(gè)點(diǎn)最遠(yuǎn)的當(dāng)?shù)诙€(gè)點(diǎn),然后選第三個(gè)點(diǎn),第三個(gè)點(diǎn)到第一、第二兩點(diǎn)的距離之和最小,以此類推。第二種是先根據(jù)其他聚類算法(如層次聚類)得到聚類結(jié)果,從結(jié)果中每個(gè)分類選一個(gè)點(diǎn)。
    h. 層次聚類算法思想
    1 )將每個(gè)對(duì)象歸為一類,共得到N類,每類僅包含一個(gè)對(duì)象。類與類之間的距離就是它們包含的對(duì)象之間的距離。
    2)找到最接近的兩個(gè)類并合并成一類,于是總的類數(shù)少了一個(gè)。
    3)重新計(jì)算新的類與所有舊類之間的距離。
    4)重復(fù)第2步和第3步,直到最后合并一個(gè)類為止。
    根據(jù)步驟3的不同,可將層次聚類方法分為幾類:single-linkage,complete-linkage,average-linkage等。
    i .K-means算法為什么在每次迭代更新時(shí)使用各簇中樣本點(diǎn)的平均值為聚類中心
    要想使損失函數(shù)(平方誤差)最小,聚類中心要為各簇中樣本點(diǎn)的平均值。
    https://blog.csdn.net/weiyongle1996/article/details/77925325
    j. K-Means會(huì)不會(huì)陷入一直選質(zhì)心的過程,永遠(yuǎn)停不下來?
    不會(huì),有數(shù)學(xué)證明K-Means一定會(huì)收斂,大致思路是利用SSE的概念(也就是誤差平方和),即每個(gè)點(diǎn)到自身所歸屬質(zhì)心的距離的平方和,這個(gè)平方和是一個(gè)函數(shù),然后能夠證明這個(gè)函數(shù)是可以最終收斂的函數(shù)。
    k. 判斷每個(gè)點(diǎn)歸屬哪個(gè)質(zhì)心的距離怎么算?
    歐幾里得聚類,余弦相似度
    歌手大賽,三個(gè)評(píng)委給三個(gè)歌手打分,第一個(gè)評(píng)委的打分(10,8,9) 第二個(gè)評(píng)委的打分(4,3,2),第三個(gè)評(píng)委的打分(8,9,10)
    如果采用余弦相似度來看每個(gè)評(píng)委的差異,雖然每個(gè)評(píng)委對(duì)同一個(gè)選手的評(píng)分不一樣,但第一、第二兩個(gè)評(píng)委對(duì)這四位歌手實(shí)力的排序是一樣的,只是第二個(gè)評(píng)委對(duì)滿分有更高的評(píng)判標(biāo)準(zhǔn),說明第一、第二個(gè)評(píng)委對(duì)音樂的品味上是一致的。 因此,用余弦相似度來看,第一、第二個(gè)評(píng)委為一類人,第三個(gè)評(píng)委為另外一類。 如果采用歐氏距離, 第一和第三個(gè)評(píng)委的歐氏距離更近,就分成一類人了,但其實(shí)不太合理,因?yàn)樗麄儗?duì)于四位選手的排名都是完全顛倒的。
    l. k-means聚類需要考慮單位一致
    1)min-max標(biāo)準(zhǔn)化(離差標(biāo)準(zhǔn)化):對(duì)原始數(shù)據(jù)進(jìn)行線性變換,是結(jié)果落到【0,1】區(qū)間,轉(zhuǎn)換方法為 X’=(X-min)/(max-min),其中max為樣本數(shù)據(jù)最大值,min為樣本數(shù)據(jù)最小值。
    2)z-score標(biāo)準(zhǔn)化(標(biāo)準(zhǔn)差標(biāo)準(zhǔn)化):處理后的數(shù)據(jù)符合標(biāo)準(zhǔn)正態(tài)分布(均值為0,方差為1),轉(zhuǎn)換公式:X減去均值,再除以標(biāo)準(zhǔn)差
    m. 關(guān)于離群值?
    答:離群值就是遠(yuǎn)離整體的,非常異常、非常特殊的數(shù)據(jù)點(diǎn),在聚類之前應(yīng)該將這些“極大”“極小”之類的離群數(shù)據(jù)都去掉,否則會(huì)對(duì)于聚類的結(jié)果有影響。但是,離群值往往自身就很有分析的價(jià)值,可以把離群值單獨(dú)作為一類來分析。
    o. 用SPSS作出的K-Means聚類結(jié)果,包含ANOVA(單因素方差分析),是什么意思?
    簡單說就是判斷用于聚類的變量是否對(duì)于聚類結(jié)果有貢獻(xiàn),方差分析檢驗(yàn)結(jié)果越顯著的變量,說明對(duì)聚類結(jié)果越有影響。對(duì)于不顯著的變量,可以考慮從模型中剔除。
    p. 業(yè)務(wù)專家的作用非常大,主要體現(xiàn)在聚類變量的選擇和對(duì)于聚類結(jié)果的解讀。

 

相關(guān)文章

最新評(píng)論

罗定市| 柘城县| 泸溪县| 静乐县| 洪江市| 彭山县| 策勒县| 健康| 郑州市| 武鸣县| 宽城| 黄山市| 三明市| 江安县| 台北市| 延边| 普定县| 万全县| 平定县| 和林格尔县| 衢州市| 平邑县| 苏尼特右旗| 泽州县| 金沙县| 肥西县| 伊宁市| 陇南市| 和政县| 泗阳县| 天津市| 工布江达县| 孟连| 奉节县| 阳高县| 三亚市| 陵川县| 邵东县| 伽师县| 凤台县| 儋州市|