最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

數據挖掘常見面試題與參考答案簡析

  發(fā)布時間:2019-10-17 14:23:11   作者:_小羊   我要評論
這篇文章主要介紹了數據挖掘常見面試題與參考答案,簡單分析了數據挖掘面試中比較常見的概念、知識點與解答技巧,需要的朋友可以參考下

機器學習方面:

SVM

1、支撐平面-和支持向量交互的平面,分割平面---支持平面中間面也就是最優(yōu)分類平面

2、SVM不是定義損失,而是定義支持向量之間的距離目標函數

3、正則化參數對支持向量數的影響

LR

1、LR的形式:h(x)=g(f(x)) 其中x為原數據,f(x)為線性/非線性回歸得到的值,也叫判定邊界 g()為Sigmod函數,最終h(x)輸出的范圍為(0,1)

LR對樣本分布敏感

LR和樸素貝葉斯(NB)之間的區(qū)別

LR是loss最優(yōu)化求出的 NB是跳過統(tǒng)計Loss最優(yōu),直接得出權重的   NB比LR多了一個條件獨立假設 LR屬于判別模型 NB是生成模型

在機器學習中,LR和SVM有什么區(qū)別?

兩者都可以處理非線性的問題;LR和SVM最初都是針對二分類問題的,SVM最大化間隔平面,LR極大似然估計,SVM只能輸出類別,不能輸出概率,兩者LOSS function 不同,LR的可解釋性更強,SVM自帶有約束的正則化

LR為什么用sigmod函數,這個函數有什么優(yōu)點和缺點?為什么不用其他函數?

LR只能用于處理二分類,而Sigmod對于所有的輸入,得到的輸出接近0或者 1

Sigmod存在的問題,梯度消失、他的輸出不是關于原點對稱的導致收斂速度非常慢,計算非常耗時間

Tanh激活桉樹存在的問題:梯度消失,計算耗時,但是其輸出的是中心對稱的

Relu:其輸出不關于原點對稱:反向傳播時,輸入的神經元小于0時,會有梯度消失問題,當x=0是,該點的梯度不存在(沒有定義)

Relu問題:權重初始化不當,出事學習率設置的非常大

SVM原問題和對偶問題關系?

SVM對偶問題的獲得方法:將原問題的目標函數L和約束條件構造拉格朗日函數,再對L中原參數和lambda、miu分別求導,并且三種導數都等于0;再將等于0的三個導數帶入原目標函數中,即可獲得對偶問題的目標函數

關系:原問題的最大值相對于對偶問題的最小值

KKT(Karysh-Kuhn-Tucker)條件有哪些,完整描述?

KKT條件是思考如何把約束優(yōu)化轉化為無約束優(yōu)化à進而求約束條件的極值點

決策樹過擬合哪些方法,前后剪枝

決策樹對訓練屬性有很好的分類能力;但對位置的測試數據未必有好的分類能力,泛化能力弱,即發(fā)生過擬合

防止過擬合的方法:剪枝(把一些相關的屬性歸為一個大類,減少決策樹的分叉);隨機森林

L1正則為什么可以把系數壓縮成0,坐標回歸的具體實現細節(jié)?

L1正則化可以實現稀疏(即截斷),使訓練得到的權重為0;

l1正則會產生稀疏解,即不相關的的特征對應的權重為0,就相當于降低了維度。但是l1的求解復雜度要高于l2,并且l1更為流行

正則化就是對loss進行懲罰(加了正則化項之后,使loss不可能為0,lambda越大懲罰越大-->lambda較小時,約束小,可能仍存在過擬合;太大時,使loss值集中于正則化的值上)

正則化使用方法:L1/L2/L1+L2

LR在特征較多時可以進行怎樣的優(yōu)化?-->L1正則有特征選擇的作用

如果是離線的話,L1正則可以有稀疏解,batch大點應該也有幫助,在線的解決思路有ftrl,rds,robots,還有阿里的mlr。當然還可以用gbdt,fm,ffm做一些特性選擇和組合應該也有效果。

機器學習里面的聚類和分類模型有哪些?

分類:LR、SVM、KNN、決策樹、RandomForest、GBDT

回歸:non-Linear regression、SVR(支持向量回歸-->可用線性或高斯核(RBF))、隨機森林

聚類:Kmeans、層次聚類、GMM(高斯混合模型)、譜聚類

聚類算法(可以作為監(jiān)督學習中稀疏特征的處理):Kmeans、層次聚類、GMM(高斯混合模型)

聚類算法唯一用到的信息是樣本和樣本之間的相似度

評判聚類效果準則:高類間距,低類內距;高類內相似度,低類間相似度。

相似度與距離負相關。

圖像之間的距離的度量是對每個像素操作,最后獲得距離

正則化為什么能防止過擬合?

過擬合表現在訓練數據上的誤差非常小,而在測試數據上誤差反而增大。其原因一般是模型過于復雜,過分得去擬合數據的噪聲. 正則化則是對模型參數添加先驗,使得模型復雜度較小,對于噪聲的輸入擾動相對較小。

正則化時,相當于是給模型參數w 添加了一個協方差為1/lambda 的零均值高斯分布先驗。對于lambda =0,也就是不添加正則化約束,則相當于參數的高斯先驗分布有著無窮大的協方差,那么這個先驗約束則會非常弱,模型為了擬合所有的訓練數據,w可以變得任意大不穩(wěn)定。lambda越大,表明先驗的高斯協方差越小,模型越穩(wěn)定,相對的variance(方差)也越小。

相關文章

  • 2019年測試工程師常見面試題與參考答案小結

    這篇文章主要介紹了2019年測試工程師常見面試題與參考答案,總結分析了測試工程師面試過程中比較常見的各類問題、知識點與相關注意事項,需要的朋友可以參考下
    2019-10-14
  • 華為云計算電話面試與參考答案總結

    這篇文章主要介紹了華為云計算電話面試與參考答案,總結分析了華為云計算電話面試中所遇到的各種問題與相應的參考答案,包括云計算相關的常見概念、原理與考察知識點,需要的
    2019-10-12
  • 云計算常見面試題及參考答案集錦

    這篇文章主要介紹了云計算常見面試題及參考答案,涉及云計算常見的概念、原理、知識點與相關注意事項,需要的朋友可以參考下
    2019-10-11
  • 騰訊面試算法題之編碼問題案例分析

    這篇文章主要介紹了騰訊面試算法題之編碼問題,結合具體案例形式分析了基于java的編碼轉換相關算法原理與操作技巧,需要的朋友可以參考下
    2019-10-08
  • 網易游戲面試經歷總結

    這篇文章主要介紹了網易游戲面試經歷,總結記錄了網易游戲招聘面試所經歷的流程及各個面試環(huán)節(jié)所遇到的問題,需要的朋友可以參考下
    2019-09-30
  • Java多線程與并發(fā)面試題(小結)

    這篇文章主要介紹了Java多線程與并發(fā)面試題(小結),小編覺得挺不錯的,現在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2019-09-26
  • 騰訊游戲客戶端開發(fā)面試經歷分享

    這篇文章主要介紹了騰訊游戲客戶端開發(fā)面試經歷,總結分享了騰訊游戲客戶端開發(fā)面試所涉及到的考點與注意事項,需要的朋友可以參考下
    2019-09-20
  • 華為Java社招面試經歷詳解【已拿到offer】

    這篇文章主要介紹了華為Java社招面試經歷,詳細記錄了華為java面試的流程、相關面試題與參考答案,需要的朋友可以參考下
    2019-09-17
  • 大數據工程師面試題與參考答案集錦

    這篇文章主要介紹了大數據工程師面試題與參考答案,總結整理了大數據相關的基本概念、原理、知識點與注意事項,需要的朋友可以參考下
    2019-09-16
  • 大數據基礎面試題考點與知識點整理

    這篇文章主要介紹了大數據基礎面試題考點與知識點,總結整理了大數據常見的各種知識點、難點、考點以及相關注意事項,需要的朋友可以參考下
    2019-09-09

最新評論

徐州市| 古交市| 芦溪县| 泸溪县| 安远县| 临颍县| 临高县| 绵竹市| 新宁县| 桃江县| 蓬溪县| 仁化县| 河南省| 威远县| 桃江县| 武夷山市| 崇州市| 尼玛县| 安乡县| 从化市| 绥宁县| 锡林浩特市| 临江市| 建湖县| 无锡市| 晋中市| 宜州市| 郴州市| 海淀区| 大竹县| 临漳县| 确山县| 禄丰县| 股票| 淮阳县| 定西市| 朔州市| 瑞昌市| 郸城县| 宝兴县| 思南县|