最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

能讓你輕松的實現(xiàn)自然語言處理的5個Python庫

 更新時間:2021年05月19日 12:00:19   作者:deephub  
今天教大家如何你輕松的實現(xiàn)自然語言預(yù)處理,僅僅需要5個python庫,文中介紹的非常詳細,對正在學(xué)習(xí)python的小伙伴們有很好的幫助,需要的朋友可以參考下

一、前言

自然語言是指人類相互交流的語言,而自然語言處理是將數(shù)據(jù)以可理解的形式進行預(yù)處理,使計算機能夠理解的一種方法。簡單地說,自然語言處理(NLP)是幫助計算機用自己的語言與人類交流的過程。

自然語言處理是最廣泛的研究領(lǐng)域之一。許多大公司在這個領(lǐng)域投資很大。NLP為公司提供了機會,讓他們能夠根據(jù)消費者的情緒和文本很好地了解他們。NLP的一些最佳用例是檢測假電子郵件、對假新聞進行分類、情感分析、預(yù)測你的下一個單詞、自動更正、聊天機器人、個人助理等等。

解決任何NLP任務(wù)前要知道的7個術(shù)語

標(biāo)記:它是將整個文本分割成小標(biāo)記的過程。占卜是根據(jù)句子和單詞兩個基礎(chǔ)來完成的。

text = "Hello there, how are you doing today? The weather is great today. python is awsome"

##sentece tokenize (Separated by sentence)
['Hello there, how are you doing today?', 'The weather is great today.', 'python is awsome']
##word tokenizer (Separated by words)
['Hello', 'there', ',', 'how', 'are', 'you', 'doing', 'today', '?', 'The', 'weather', 'is', 'great', 'today', '.','python', 'is', 'awsome']

停止詞:一般來說,這些詞不會給句子增加太多的意義。在NLP中,我們刪除了所有的停止詞,因為它們對分析數(shù)據(jù)不重要。英語中總共有179個停止詞。

詞干提?。核峭ㄟ^去掉后綴和前綴將一個單詞還原為詞根的過程。

詞形還原:它的工作原理與詞干法相同,但關(guān)鍵的區(qū)別是它返回一個有意義的單詞。主要是開發(fā)聊天機器人、問答機器人、文本預(yù)測等。

WordNet:它是英語語言名詞、動詞、形容詞和副詞的詞匯數(shù)據(jù)庫或詞典,這些詞被分組為專門為自然語言處理設(shè)計的集合。

詞性標(biāo)注:它是將一個句子轉(zhuǎn)換為一個元組列表的過程。每個元組都有一個形式(單詞、標(biāo)記)。這里的標(biāo)簽表示該單詞是名詞、形容詞還是動詞等等。

text = 'An sincerity so extremity he additions.'
--------------------------------
('An', 'DT'), ('sincerity', 'NN'), ('so', 'RB'), ('extremity', 'NN'), ('he', 'PRP'), ('additions', 'VBZ')]

詞袋:它是一個將文本轉(zhuǎn)換成某種數(shù)字表示的過程。比如獨熱編碼等。

sent1 = he is a good boy
sent2 = she is a good girl
            |
            |
        girl good boy   
sent1    0    1    1     
sent2    1    0    1

現(xiàn)在,讓我們回到我們的主題,看看可以幫助您輕松預(yù)處理數(shù)據(jù)的庫。

二、NLTK

毫無疑問,它是自然語言處理最好和使用最多的庫之一。NLTK是自然語言工具包的縮寫。由Steven Bird 和Edward Loper開發(fā)的。它帶有許多內(nèi)置的模塊,用于標(biāo)記化、詞元化、詞干化、解析、分塊和詞性標(biāo)記。它提供超過50個語料庫和詞匯資源。

安裝:pip install nltk

讓我們使用NLTK對給定的文本執(zhí)行預(yù)處理

import nltk
#nltk.download('punkt')
from nltk.tokenize import word_tokenize
from nltk.corpus import stopwords
from nltk.stem import PorterStemmer
import re
ps = PorterStemmer()
text = 'Hello there,how are you doing today? I am Learning Python.'
text = re.sub("[^a-zA-Z0-9]"," ",text)
text = word_tokenize(text)
text_with_no_stopwords = [ps.stem(word) for word in text if word not in stopwords.words('english')]
text = " ".join(text_with_no_stopwords) 
text
-----------------------------------------------OUTPUT------------------------------------
'hello today I learn python'

三、TextBlob

Textblob是一個簡化的文本處理庫。它提供了一個簡單的API,用于執(zhí)行常見的NLP任務(wù),如詞性標(biāo)記、情感分析、分類、翻譯等。

安裝:pip install textblob

四、spacy

這是python中最好用的自然語言處理庫之一,它是用cpython編寫的。它提供了一些預(yù)訓(xùn)練的統(tǒng)計模型,并支持多達49種以上的語言進行標(biāo)記化。它以卷積神經(jīng)網(wǎng)絡(luò)為特征,用于標(biāo)記、解析和命名實體識別。

安裝:pip install spacy

import spacy
nlp = spacy.load('en_core_web_sm')
text = "I am Learning Python Nowdays"
text2 = nlp(text)
for token in text2:
  print(token,token.idx)
------------------------------OUTPUT-----------------------
I 0
am 2
Learning 5
Python 14
Nowdays 21

五、Gensim

它是一個Python庫,專門用于識別兩個文檔之間的語義相似性。它使用向量空間建模和主題建模工具包來尋找文檔之間的相似之處。它是設(shè)計用來處理大型文本語料庫的算法。

安裝:pip install gensim

六、CoreNLP

Stanford CoreNLP的目標(biāo)是簡化對一段文本應(yīng)用不同語言工具的過程。這個庫運行速度非??欤⑶以陂_發(fā)中工作得很好。

安裝:pip install stanford-corenlp

到此這篇關(guān)于5個Python庫就能讓你輕松的實現(xiàn)自然語言預(yù)處理的文章就介紹到這了,更多相關(guān)Python庫自然語言預(yù)處理內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python爬蟲beautifulsoup解析html方法

    python爬蟲beautifulsoup解析html方法

    這篇文章主要介紹了python爬蟲beautifulsoup解析html方法,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-12-12
  • Python低層多線程接口_thread模塊的用法和特性

    Python低層多線程接口_thread模塊的用法和特性

    這篇文章主要介紹了Python低層多線程接口_thread模塊的用法和特性,_thread是python標(biāo)準(zhǔn)庫中的一個低層多線程API,可以在進程中啟動線程來處理任務(wù),并且提供了簡單的鎖機制來控制共享資源的同步訪問,本文就_thread模塊的用法和特性做個簡單的演示,需要的朋友可以參考下
    2024-10-10
  • python命令行參數(shù)用法實例分析

    python命令行參數(shù)用法實例分析

    這篇文章主要介紹了python命令行參數(shù)用法,結(jié)合實例形式分析了Python基于optparse模塊處理命令行參數(shù)相關(guān)使用技巧,需要的朋友可以參考下
    2019-06-06
  • Python3中的re.findall()方法及re.compile()

    Python3中的re.findall()方法及re.compile()

    這篇文章主要介紹了Python3中的re.findall()方法及re.compile(),具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-05-05
  • python開發(fā)任意表達式求值全功能示例

    python開發(fā)任意表達式求值全功能示例

    這篇文章主要為大家介紹了python開發(fā)任意表達式求值全功能示例,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2022-07-07
  • Python還能這么玩之用Python做個小游戲的外掛

    Python還能這么玩之用Python做個小游戲的外掛

    玩過電腦游戲的同學(xué)對于外掛肯定不陌生,但是你在用外掛的時候有沒有想過外掛怎么制作出來的呢?現(xiàn)在來看一下怎么制作一個外掛,首先說下,這里的游戲外掛的概念,和那些大型網(wǎng)游里的外掛可不同,不能自動打怪,主要為了提高一下編程技術(shù),需要的朋友可以參考下
    2021-06-06
  • Pyhton多線程采集圖片方式

    Pyhton多線程采集圖片方式

    這篇文章主要介紹了Pyhton多線程采集圖片方式,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2023-12-12
  • Python使用Keras庫中的LSTM模型生成新文本內(nèi)容教程

    Python使用Keras庫中的LSTM模型生成新文本內(nèi)容教程

    Python語言使用金庸小說文本庫,對文本進行預(yù)處理,然后使用Keras庫中的LSTM模型創(chuàng)建和訓(xùn)練了模型,根據(jù)這個模型,我們可以生成新的文本,并探索小說的不同應(yīng)用
    2024-01-01
  • Flask框架使用DBUtils模塊連接數(shù)據(jù)庫操作示例

    Flask框架使用DBUtils模塊連接數(shù)據(jù)庫操作示例

    這篇文章主要介紹了Flask框架使用DBUtils模塊連接數(shù)據(jù)庫操作,結(jié)合實例形式較為詳細的分析了flask框架使用DBUtils模塊連接數(shù)據(jù)庫的常見操作技巧與相關(guān)注意事項,需要的朋友可以參考下
    2018-07-07
  • 如何測試Python網(wǎng)站的訪問速度,并且優(yōu)化Python網(wǎng)站的性能

    如何測試Python網(wǎng)站的訪問速度,并且優(yōu)化Python網(wǎng)站的性能

    本文使用網(wǎng)絡(luò)工具和Python測速庫進行測試Python網(wǎng)站的訪問速度,通過優(yōu)化代碼性能和優(yōu)化服務(wù)器性能以及優(yōu)化數(shù)據(jù)庫性能等有針對性地優(yōu)化Python網(wǎng)站的性能
    2024-01-01

最新評論

集贤县| 渭源县| 巍山| 昭平县| 鄂托克旗| 新宁县| 白玉县| 澄城县| 天峨县| 自贡市| 柯坪县| 常宁市| 法库县| 吉安县| 溆浦县| 贺州市| 鞍山市| 江源县| 淮安市| 惠州市| 达拉特旗| 洛宁县| 嘉鱼县| 双辽市| 河池市| 耒阳市| 太和县| 安宁市| 全南县| 武邑县| 旅游| 丰镇市| 桃园市| 加查县| 吐鲁番市| 通化市| 土默特右旗| 北宁市| 图木舒克市| 阳春市| 正阳县|