最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

使用 Python 創(chuàng)建一個基于規(guī)則的聊天機(jī)器人

 更新時間:2021年10月29日 09:09:41   作者:deephub  
這篇文章主要介紹了使用 Python 創(chuàng)建一個基于規(guī)則的聊天機(jī)器人,使用 Python 創(chuàng)建一個簡單的基于規(guī)則的聊天機(jī)器人 聊天機(jī)器人本身是一種機(jī)器或軟件,它通過文本或句子模仿人類交互。 簡而言之,可以使用類似于與人類對話的軟件進(jìn)行聊天。

前言:

還記得這個價值一個億的AI核心代碼?

while True: 
  AI = input('我:') 
  print(AI.replace("嗎", " ").replace('?','!').replace('?','!')) 

以上這段代碼就是我們今天的主題,基于規(guī)則的聊天機(jī)器人

1、聊天機(jī)器人

聊天機(jī)器人本身是一種機(jī)器或軟件,它通過文本或句子模仿人類交互。 簡而言之,可以使用類似于與人類對話的軟件進(jìn)行聊天。

為什么要嘗試創(chuàng)建聊天機(jī)器人? 也許你對一個新項目感興趣,或者公司需要一個,或者想去拉投資。 無論動機(jī)是什么,本文都將嘗試解釋如何創(chuàng)建一個簡單的基于規(guī)則的聊天機(jī)器人。

2、基于規(guī)則的聊天機(jī)器人

什么是基于規(guī)則的聊天機(jī)器人?它是一種基于特定規(guī)則來回答人類給出的文本的聊天機(jī)器人。由于它基于強(qiáng)加的規(guī)則所以這個聊天機(jī)器人生成的響應(yīng)幾乎是準(zhǔn)確的;但是,如果我們收到與規(guī)則不匹配的查詢,聊天機(jī)器人將不會回答。與它相對的另一個版本是基于模型的聊天機(jī)器人,它通過機(jī)器學(xué)習(xí)模型來回答給定的查詢。(二者的區(qū)別就是基于規(guī)則的需要我們指定每一條規(guī)則,而且基于模型的會通過訓(xùn)練模型自動生成規(guī)則,還記得我們上一篇的”機(jī)器學(xué)習(xí)介紹“嗎,"機(jī)器學(xué)習(xí)為系統(tǒng)提供無需明確編程就能根據(jù)經(jīng)驗自動學(xué)習(xí)和改進(jìn)的能力。")

基于規(guī)則的聊天機(jī)器人可能基于人類給出的規(guī)則,但這并不意味著我們不使用數(shù)據(jù)集。聊天機(jī)器人的主要目標(biāo)仍然是自動化人類提出的問題,所以我們還是需要數(shù)據(jù)來制定特定的規(guī)則。

在本文中,我們將利用余弦相似距離作為基礎(chǔ)開發(fā)基于規(guī)則的聊天機(jī)器人。余弦相似度是向量(特別是內(nèi)積空間的非零向量)之間的相似度度量,常用于度量兩個文本之間的相似度。

我們將使用余弦相似度創(chuàng)建一個聊天機(jī)器人,通過對比查詢與我們開發(fā)的語料庫之間的相似性來回答查詢提出的問題。這也是我們最初需要開發(fā)我們的語料庫的原因。

3、創(chuàng)建語料庫

對于這個聊天機(jī)器人示例,我想創(chuàng)建一個聊天機(jī)器人來回答有關(guān)貓的所有問題。 為了收集關(guān)于貓的數(shù)據(jù),我會從網(wǎng)上抓取它。

import bs4 as bs 
import urllib.request#Open the cat web data page 
cat_data = urllib.request.urlopen('https://simple.wikipedia.org/wiki/Cat').read() 
#Find all the paragraph html from the web page 
cat_data_paragraphs = bs.BeautifulSoup(cat_data,'lxml').find_all('p') 
#Creating the corpus of all the web page paragraphs 
cat_text = '' 
#Creating lower text corpus of cat paragraphs 
for p in cat_data_paragraphs: 
cat_text += p.text.lower() 
print(cat_text) 

使用上面的代碼,會得到來自wikipedia頁面的段落集合。 接下來,需要清理文本以去除括號編號和空格等無用的文本。

 import re 
cat_text = re.sub(r'\s+', ' ',re.sub(r'\[[0-9]*\]', ' ', cat_text)) 

上述代碼將從語料庫中刪除括號號。我特意沒有去掉這些符號和標(biāo)點(diǎn)符號,因為當(dāng)與聊天機(jī)器人進(jìn)行對話時,這樣聽起來會很自然。

最后,我將根據(jù)之前創(chuàng)建的語料庫創(chuàng)建一個句子列表。

import nltk 
cat_sentences = nltk.sent_tokenize(cat_text) 

我們的規(guī)則很簡單:將聊天機(jī)器人的查詢文本與句子列表中的每一個文本之間的進(jìn)行余弦相似性的度量,哪個結(jié)果產(chǎn)生的相似度最接近(最高余弦相似度)那么它就是我們的聊天機(jī)器人的答案。

4、創(chuàng)建一個聊天機(jī)器人

我們上面的語料庫仍然是文本形式,余弦相似度不接受文本數(shù)據(jù);所以需要將語料庫轉(zhuǎn)換成數(shù)字向量。通常的做法是將文本轉(zhuǎn)換為詞袋(單詞計數(shù))或使用TF-IDF方法(頻率概率)。在我們的例子中,我們將使用TF-IDF。

我將創(chuàng)建一個函數(shù),它接收查詢文本,并根據(jù)以下代碼中的余弦相似性給出一個輸出。讓我們看一下代碼。

from sklearn.metrics.pairwise import cosine_similarity 
from sklearn.feature_extraction.text import TfidfVectorizer 
def chatbot_answer(user_query): 
 
#Append the query to the sentences list 
cat_sentences.append(user_query)  
#Create the sentences vector based on the list 
vectorizer = TfidfVectorizer() 
sentences_vectors = vectorizer.fit_transform(cat_sentences) 
 
#Measure the cosine similarity and take the second closest index because the first index is the user query 
vector_values = cosine_similarity(sentences_vectors[-1], sentences_vectors) 
answer = cat_sentences[vector_values.argsort()[0][-2]]  
#Final check to make sure there are result present. If all the result are 0, means the text input by us are not captured in the corpus 
input_check = vector_values.flatten() 
input_check.sort() 
 
if input_check[-2] == 0: 
return "Please Try again" 
else:  
return answer 

我們可以把上面的函數(shù)使用下面的流程圖進(jìn)行表示:

最后,使用以下代碼創(chuàng)建一個簡單的回答交互。

print("Hello, I am the Cat Chatbot. What is your meow questions?:") 
while(True): 
query = input().lower() 
if query not in ['bye', 'good bye', 'take care']: 
print("Cat Chatbot: ", end="") 
print(chatbot_answer(query)) 
cat_sentences.remove(query) 
else: 
print("See You Again") 
break 

上面的腳本將接收查詢,并通過我們之前開發(fā)的聊天機(jī)器人處理它們。

從上面的圖片中看到的,結(jié)果還是可以接受的,但有也有些奇怪的回答。但是我們要想到,目前只從一個數(shù)據(jù)源中得到的結(jié)果,并且也沒有做任何的優(yōu)化。如果我們用額外的數(shù)據(jù)集和規(guī)則來改進(jìn)它,它肯定會更好地回答問題。

5、總結(jié)

聊天機(jī)器人項目是一個令人興奮的數(shù)據(jù)科學(xué)項目,因為它在許多領(lǐng)域都有幫助。在本文中,我們使用從網(wǎng)頁中獲取的數(shù)據(jù),利用余弦相似度和TF-IDF,用Python創(chuàng)建了一個簡單的聊天機(jī)器人項目,真正的將我們的1個億的項目落地。其實(shí)這里面還有很多的改進(jìn):

向量化的選擇,除了TF-IDF還可以使用word2vec,甚至使用預(yù)訓(xùn)練的bert提取詞向量。
回答環(huán)節(jié),其實(shí)就是通過某種特定的算法或者規(guī)則從我們的語料庫中搜索最匹配的答案,本文中使用的相似度TOP1的方法其實(shí)就是一個最簡單的類greedsearch的方法,對于答案結(jié)果的優(yōu)化還可以使用類beamsearch 的算法提取回答的匹配項。
等等很多
在端到端的深度學(xué)習(xí)興起之前,很多的聊天機(jī)器人都是這樣基于規(guī)則來運(yùn)行的并且也有很多落地案例,如果你想快速的做一個POC展示,這種基于規(guī)則方法還是非常有用的。

到此這篇關(guān)于使用 Python 創(chuàng)建一個基于規(guī)則的聊天機(jī)器人的文章就介紹到這了,更多相關(guān)Python 創(chuàng)建聊天機(jī)器人內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python 全文檢索引擎詳解

    python 全文檢索引擎詳解

    這篇文章主要介紹了python 全文檢索引擎詳解的相關(guān)資料,需要的朋友可以參考下
    2017-04-04
  • 用python介紹4種常用的單鏈表翻轉(zhuǎn)的方法小結(jié)

    用python介紹4種常用的單鏈表翻轉(zhuǎn)的方法小結(jié)

    這篇文章主要介紹了用python介紹4種常用的單鏈表翻轉(zhuǎn)的方法小結(jié),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-02-02
  • python字典的遍歷3種方法詳解

    python字典的遍歷3種方法詳解

    這篇文章主要介紹了python字典的遍歷相關(guān)知識詳解,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2019-08-08
  • 基于python實(shí)現(xiàn)rpc遠(yuǎn)程過程調(diào)用

    基于python實(shí)現(xiàn)rpc遠(yuǎn)程過程調(diào)用

    本文主要介紹了基于python實(shí)現(xiàn)rpc遠(yuǎn)程過程調(diào)用,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2022-06-06
  • Python OrderedDict字典排序方法詳解

    Python OrderedDict字典排序方法詳解

    這篇文章主要介紹了Python OrderedDict字典使用方法詳解,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2020-05-05
  • python模擬斗地主發(fā)牌

    python模擬斗地主發(fā)牌

    這篇文章主要為大家詳細(xì)介紹了python模擬斗地主發(fā)牌,文中示例代碼介紹的非常詳細(xì),具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2020-04-04
  • Python 的 vars() 函數(shù)功能

    Python 的 vars() 函數(shù)功能

    本文將深入探討如何利用 vars() 函數(shù)的靈活性和功能,以提高代碼調(diào)試的效率和準(zhǔn)確性,感興趣的朋友跟隨小編一起看看吧
    2024-06-06
  • Python爬蟲實(shí)戰(zhàn)之爬取京東商品數(shù)據(jù)并實(shí)實(shí)現(xiàn)數(shù)據(jù)可視化

    Python爬蟲實(shí)戰(zhàn)之爬取京東商品數(shù)據(jù)并實(shí)實(shí)現(xiàn)數(shù)據(jù)可視化

    今天再帶大家簡單爬一波京東的商品數(shù)據(jù)唄,廢話不多說,文中有非常詳細(xì)的代碼示例,需要的朋友可以參考下
    2021-06-06
  • python3+PyQt5泛型委托詳解

    python3+PyQt5泛型委托詳解

    這篇文章主要為大家詳細(xì)介紹了python3+PyQt5泛型委托的相關(guān)資料,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2018-04-04
  • Python入門教程之變量與數(shù)據(jù)類型

    Python入門教程之變量與數(shù)據(jù)類型

    這篇文章主要介紹了Python入門教程之變量與數(shù)據(jù)類型的相關(guān)知識,文中給大家提到了變量的基本概念和數(shù)據(jù)類型的相關(guān)實(shí)例代碼,需要的朋友可以參考下
    2022-02-02

最新評論

明光市| 桂阳县| 蒙山县| 元江| 应城市| 沙田区| 阳泉市| 买车| 湟中县| 会宁县| 冀州市| 盐池县| 盐池县| 利津县| 右玉县| 丹阳市| 华宁县| 金溪县| 海兴县| 古田县| 新龙县| 台南市| 伽师县| 阿合奇县| 读书| 蕲春县| 池州市| 夏津县| 浦江县| 孙吴县| 扶余县| 泊头市| 大姚县| 易门县| 铜陵市| 元氏县| 丰城市| 宿州市| 大关县| 虞城县| 白玉县|