最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理基本操作精確分詞

 更新時(shí)間:2021年09月21日 13:22:21   作者:我是小白呀  
本文是Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理系列文章,帶大家開啟一段學(xué)習(xí)自然語(yǔ)言處理 (NLP) 的旅程. 本文主要學(xué)習(xí)NLP自然語(yǔ)言處理基本操作之如何精確分詞

概述

從今天開始我們將開啟一段自然語(yǔ)言處理 (NLP) 的旅程. 自然語(yǔ)言處理可以讓來處理, 理解, 以及運(yùn)用人類的語(yǔ)言, 實(shí)現(xiàn)機(jī)器語(yǔ)言和人類語(yǔ)言之間的溝通橋梁.

在這里插入圖片描述

分詞器 jieba

jieba 算法基于前綴詞典實(shí)現(xiàn)高效的詞圖掃描, 生成句子中漢字所有可能成詞的情況所構(gòu)成的有向無(wú)環(huán)圖. 通過動(dòng)態(tài)規(guī)劃查找最大概率路徑, 找出基于詞頻的最大切分組合. 對(duì)于未登錄詞采用了基于漢字成詞能力的 HMM 模型, 使用 Viterbi 算法.

在這里插入圖片描述

安裝

pip install jieba

在這里插入圖片描述

查看是否安裝成功:

import jieba
print(jieba.__version__)

輸出結(jié)果:

0.42.1

精確分詞

精確分詞: 精確模式試圖將句子最精確地切開, 精確分詞也是默認(rèn)分詞.

在這里插入圖片描述

格式:

jieba.cut(content, cut_all=False)

參數(shù):

  • content: 需要分詞的內(nèi)容
  • cut_all: 如果為 True 則為全模式, False 為精確模式

例子:

import jieba
# 定義文本
content = "自然語(yǔ)言處理是人工智能和語(yǔ)言學(xué)領(lǐng)域的分支學(xué)科。此領(lǐng)域探討如何處理及運(yùn)用自然語(yǔ)言;自然語(yǔ)言處理包括多方面和步驟,基本有認(rèn)知、理解、生成等部分。"
# 精確分詞
seg = jieba.cut(content, cut_all=False)
# 調(diào)試輸出
print([word for word in seg])

輸出結(jié)果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
Loading model cost 0.984 seconds.
Prefix dict has been built successfully.
['自然語(yǔ)言', '處理', '是', '人工智能', '和', '語(yǔ)言學(xué)', '領(lǐng)域', '的', '分支', '學(xué)科', '。', '此', '領(lǐng)域', '探討', '如何', '處理', '及', '運(yùn)用', '自然語(yǔ)言', ';', '自然語(yǔ)言', '處理', '包括', '多方面', '和', '步驟', ',', '基本', '有', '認(rèn)知', '、', '理解', '、', '生成', '等', '部分', '。']

全模式

全模式分詞: 全模式會(huì)把句子中所有可能是詞語(yǔ)的都掃出來. 速度非??? 但不能解決歧義問題.

例子:

C:\Users\Windows\Anaconda3\pythonw.exe "C:/Users/Windows/Desktop/project/NLP 基礎(chǔ)/結(jié)巴.py"
Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
['自然', '自然語(yǔ)言', '語(yǔ)言', '處理', '是', '人工', '人工智能', '智能', '和', '語(yǔ)言', '語(yǔ)言學(xué)', '領(lǐng)域', '的', '分支', '學(xué)科', '。', '此', '領(lǐng)域', '探討', '如何', '何處', '處理', '及', '運(yùn)用', '自然', '自然語(yǔ)言', '語(yǔ)言', ';', '自然', '自然語(yǔ)言', '語(yǔ)言', '處理', '包括', '多方', '多方面', '方面', '和', '步驟', ',', '基本', '有', '認(rèn)知', '、', '理解', '、', '生成', '等', '部分', '。']
Loading model cost 0.999 seconds.
Prefix dict has been built successfully.

輸出結(jié)果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
['自然', '自然語(yǔ)言', '語(yǔ)言', '處理', '是', '人工', '人工智能', '智能', '和', '語(yǔ)言', '語(yǔ)言學(xué)', '領(lǐng)域', '的', '分支', '學(xué)科', '。', '此', '領(lǐng)域', '探討', '如何', '何處', '處理', '及', '運(yùn)用', '自然', '自然語(yǔ)言', '語(yǔ)言', ';', '自然', '自然語(yǔ)言', '語(yǔ)言', '處理', '包括', '多方', '多方面', '方面', '和', '步驟', ',', '基本', '有', '認(rèn)知', '、', '理解', '、', '生成', '等', '部分', '。']
Loading model cost 0.999 seconds.
Prefix dict has been built successfully.

搜索引擎模式

搜索引擎模式: 在精確模式的基礎(chǔ)上, 對(duì)長(zhǎng)詞再次切分. 提高召回率, 適合用于搜索引擎分詞.

在這里插入圖片描述

例子:

import jieba
# 定義文本
content = "自然語(yǔ)言處理是人工智能和語(yǔ)言學(xué)領(lǐng)域的分支學(xué)科。此領(lǐng)域探討如何處理及運(yùn)用自然語(yǔ)言;自然語(yǔ)言處理包括多方面和步驟,基本有認(rèn)知、理解、生成等部分。"
# 搜索引擎模式
seg = jieba.cut_for_search(content)
# 調(diào)試輸出
print([word for word in seg])

輸出結(jié)果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
[('自然語(yǔ)言', 'l'), ('處理', 'v'), ('是', 'v'), ('人工智能', 'n'), ('和', 'c'), ('語(yǔ)言學(xué)', 'n'), ('領(lǐng)域', 'n'), ('的', 'uj'), ('分支', 'n'), ('學(xué)科', 'n'), ('。', 'x'), ('此', 'zg'), ('領(lǐng)域', 'n'), ('探討', 'v'), ('如何', 'r'), ('處理', 'v'), ('及', 'c'), ('運(yùn)用', 'vn'), ('自然語(yǔ)言', 'l'), (';', 'x'), ('自然語(yǔ)言', 'l'), ('處理', 'v'), ('包括', 'v'), ('多方面', 'm'), ('和', 'c'), ('步驟', 'n'), (',', 'x'), ('基本', 'n'), ('有', 'v'), ('認(rèn)知', 'v'), ('、', 'x'), ('理解', 'v'), ('、', 'x'), ('生成', 'v'), ('等', 'u'), ('部分', 'n'), ('。', 'x')]
Loading model cost 1.500 seconds.
Prefix dict has been built successfully.

獲取詞性

通過 jieba.posseg 模式實(shí)現(xiàn)詞性標(biāo)注.

import jieba.posseg as psg
# 定義文本
content = "自然語(yǔ)言處理是人工智能和語(yǔ)言學(xué)領(lǐng)域的分支學(xué)科。此領(lǐng)域探討如何處理及運(yùn)用自然語(yǔ)言;自然語(yǔ)言處理包括多方面和步驟,基本有認(rèn)知、理解、生成等部分。"
# 分詞
seg = psg.lcut(content)
# 獲取詞性
part_of_speech = [(x.word, x.flag) for x in seg]
# 調(diào)試輸出
print(part_of_speech)

輸出結(jié)果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
[('自然語(yǔ)言', 'l'), ('處理', 'v'), ('是', 'v'), ('人工智能', 'n'), ('和', 'c'), ('語(yǔ)言學(xué)', 'n'), ('領(lǐng)域', 'n'), ('的', 'uj'), ('分支', 'n'), ('學(xué)科', 'n'), ('。', 'x'), ('此', 'zg'), ('領(lǐng)域', 'n'), ('探討', 'v'), ('如何', 'r'), ('處理', 'v'), ('及', 'c'), ('運(yùn)用', 'vn'), ('自然語(yǔ)言', 'l'), (';', 'x'), ('自然語(yǔ)言', 'l'), ('處理', 'v'), ('包括', 'v'), ('多方面', 'm'), ('和', 'c'), ('步驟', 'n'), (',', 'x'), ('基本', 'n'), ('有', 'v'), ('認(rèn)知', 'v'), ('、', 'x'), ('理解', 'v'), ('、', 'x'), ('生成', 'v'), ('等', 'u'), ('部分', 'n'), ('。', 'x')]
Loading model cost 1.500 seconds.
Prefix dict has been built successfully.

以上就是Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理基本操作之精確分詞的詳細(xì)內(nèi)容,更多關(guān)于Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • 淺析python中SQLAlchemy排序的一個(gè)坑

    淺析python中SQLAlchemy排序的一個(gè)坑

    這篇文章主要介紹了關(guān)于python中SQLAlchemy排序的一個(gè)坑,文中給出了詳細(xì)的示例代碼,需要的朋友可以參考借鑒,感興趣的朋友們下面來一起學(xué)習(xí)學(xué)習(xí)吧。
    2017-02-02
  • 解決hive中導(dǎo)入text文件遇到的坑

    解決hive中導(dǎo)入text文件遇到的坑

    這篇文章主要介紹了解決hive中導(dǎo)入text文件遇到的坑,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2021-04-04
  • Python的Django框架中settings文件的部署建議

    Python的Django框架中settings文件的部署建議

    這篇文章主要介紹了Python的Django框架中settings文件的部署建議,包括對(duì)local_settings的弊病的一些簡(jiǎn)單分析,需要的朋友可以參考下
    2015-05-05
  • python實(shí)現(xiàn)三子棋游戲

    python實(shí)現(xiàn)三子棋游戲

    這篇文章主要為大家詳細(xì)介紹了python實(shí)現(xiàn)三子棋游戲,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2022-05-05
  • Python編程在flask中模擬進(jìn)行Restful的CRUD操作

    Python編程在flask中模擬進(jìn)行Restful的CRUD操作

    今天小編就為大家分享一篇關(guān)于Python編程在flask中模擬進(jìn)行Restful的CRUD操作,小編覺得內(nèi)容挺不錯(cuò)的,現(xiàn)在分享給大家,具有很好的參考價(jià)值,需要的朋友一起跟隨小編來看看吧
    2018-12-12
  • Python調(diào)用命令行進(jìn)度條的方法

    Python調(diào)用命令行進(jìn)度條的方法

    這篇文章主要介紹了Python調(diào)用命令行進(jìn)度條的方法,涉及Python進(jìn)度條的調(diào)用技巧,具有一定參考借鑒價(jià)值,需要的朋友可以參考下
    2015-05-05
  • python利用opencv實(shí)現(xiàn)顏色檢測(cè)

    python利用opencv實(shí)現(xiàn)顏色檢測(cè)

    這篇文章主要為大家詳細(xì)介紹了python利用opencv實(shí)現(xiàn)顏色檢測(cè),文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2021-02-02
  • NumPy之矩陣向量線性代數(shù)等操作示例

    NumPy之矩陣向量線性代數(shù)等操作示例

    這篇文章主要為大家介紹了NumPy之矩陣向量線性代數(shù)等操作示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-04-04
  • Python實(shí)現(xiàn)變量數(shù)值交換及判斷數(shù)組是否含有某個(gè)元素的方法

    Python實(shí)現(xiàn)變量數(shù)值交換及判斷數(shù)組是否含有某個(gè)元素的方法

    這篇文章主要介紹了Python實(shí)現(xiàn)變量數(shù)值交換及判斷數(shù)組是否含有某個(gè)元素的方法,涉及Python字符串與數(shù)組的相關(guān)賦值、判斷操作技巧,需要的朋友可以參考下
    2017-09-09
  • django有外鍵關(guān)系的兩張表如何相互查找

    django有外鍵關(guān)系的兩張表如何相互查找

    這篇文章主要介紹了django有外鍵關(guān)系的兩張表如何相互查找,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-02-02

最新評(píng)論

济宁市| 淄博市| 盘锦市| 衡阳市| 广平县| 鄂托克前旗| 阿拉善盟| 乐平市| 中牟县| 秀山| 乌拉特前旗| 景东| 沭阳县| 金昌市| 喀什市| 桦川县| 喜德县| 新绛县| 新昌县| 新田县| 邢台县| 台北县| 南京市| 遂平县| 毕节市| 慈溪市| 景洪市| 康定县| 乐山市| 丰都县| 麻江县| 布尔津县| 芷江| 高邑县| 额敏县| 嘉定区| 南丹县| 宁明县| 成安县| 衡阳县| 邯郸县|