Python sklearn CountVectorizer使用詳解
簡介
將一個文檔集合向量化為為一個計數(shù)矩陣。
如果不提供一個先驗字典,不使用分析器做某種特征選擇,那么特征的數(shù)量將等于通過分析數(shù)據(jù)發(fā)現(xiàn)的詞匯量。
數(shù)據(jù)預(yù)處理
兩種方法:1.可以不分詞直接投入模型;2.可以先將中文文本進行分詞。
兩種方法產(chǎn)生的詞匯會非常不同。在后面會具體給出示范。
import jieba
import re
from sklearn.feature_extraction.text import CountVectorizer
#原始數(shù)據(jù)
text = ['很少在公眾場合手機外放',
'大部分人都還是很認真去學(xué)習(xí)的',
'他們會用行動來',
'無論你現(xiàn)在有多頹廢,振作起來',
'只需要一點點地改變',
'你的外在和內(nèi)在都能煥然一新']
#提取中文
text = [' '.join(re.findall('[\u4e00-\u9fa5]+',tt,re.S)) for tt in text]
#分詞
text = [' '.join(jieba.lcut(tt)) for tt in text]
text
構(gòu)建模型
訓(xùn)練模型
#構(gòu)建模型 vectorizer = CountVectorizer() #訓(xùn)練模型 X = vectorizer.fit_transform(text)
所有詞匯:model.get_feature_names()
#所有文檔匯集后生成的詞匯 feature_names = vectorizer.get_feature_names() print(feature_names)
不分詞生成的詞匯

分詞后生成的詞匯

計數(shù)矩陣:X.toarray()
#每個文檔相對詞匯量出現(xiàn)次數(shù)形成的矩陣 matrix = X.toarray() print(matrix)

#計數(shù)矩陣轉(zhuǎn)化為DataFrame df = pd.DataFrame(matrix, columns=feature_names) df

詞匯索引:model.vocabulary_
print(vectorizer.vocabulary_)

到此這篇關(guān)于Python_sklearn_CountVectorizer使用詳解的文章就介紹到這了,更多相關(guān)Python_sklearn_CountVectorizer使用內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
卸載所有通過pip安裝的Python包的方法總結(jié)(Windows系統(tǒng))
這篇文章主要介紹了卸載所有通過pip安裝的Python包的方法總結(jié)(Windows系統(tǒng)),文中通過代碼示例和圖文講解的非常詳細,并具有一定的參考價值,需要的朋友可以參考下2024-08-08
Python OpenCV Hough直線檢測算法的原理實現(xiàn)
這篇文章主要介紹了Python OpenCV Hough直線檢測算法的原理實現(xiàn),文章圍繞主題展開詳細的內(nèi)容介紹,具有一定的參考價值,需要的朋友可以參考一下2022-07-07
Linux(Redhat)安裝python3.6虛擬環(huán)境(推薦)
這篇文章主要介紹了Linux(Redhat)安裝python3.6虛擬環(huán)境,非常不錯,具有參考借鑒價值 ,需要的朋友可以參考下2018-05-05
python logging 重復(fù)寫日志問題解決辦法詳解
這篇文章主要介紹了python logging 重復(fù)寫日志問題解決辦法詳解,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2020-08-08
用Python實現(xiàn)web端用戶登錄和注冊功能的教程
這篇文章主要介紹了用Python實現(xiàn)web端用戶登錄和注冊功能的教程,需要的朋友可以參考下2015-04-04

