最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python英文詞頻統(tǒng)計(jì)(哈姆雷特)程序示例代碼

 更新時(shí)間:2023年06月15日 09:05:57   作者:永遠(yuǎn)是少年啊  
在文本處理方面,Python也有著得天獨(dú)厚的優(yōu)勢,不僅提供了多種字符串操作函數(shù),而且還可以使用各種開源庫來處理文本,下面這篇文章主要給大家介紹了關(guān)于Python英文詞頻統(tǒng)計(jì)(哈姆雷特)程序示例的相關(guān)資料,需要的朋友可以參考下

今天繼續(xù)給大家介紹Python相關(guān)知識,本文主要內(nèi)容是Python英文詞頻統(tǒng)計(jì)程序示例,主要是對英文文本——《哈姆雷特》進(jìn)行分詞。

一、英文文本詞頻統(tǒng)計(jì)思路

想要對《哈姆雷特》進(jìn)行英文單詞詞頻統(tǒng)計(jì),那么我們首先需要拿到《哈姆雷特》的原文,將之存儲為本地的txt文檔,然后使用Python打開該文件,讀取里面的信息。

在讀取《哈姆雷特》內(nèi)容后,我們首先需要將文件內(nèi)容進(jìn)行預(yù)處理,比如刪除文件中的特殊符號,以及對文件內(nèi)容進(jìn)行全部小寫的歸一化操作等等。除此之外,我們還需要刪除文檔中所有的標(biāo)點(diǎn)符號。之后,我們可以將文檔使用split()函數(shù),根據(jù)空格進(jìn)行分隔,形成一個(gè)列表。

之后,我們逐個(gè)取出列表中的元素,然后統(tǒng)計(jì)列表中單詞的個(gè)數(shù)。為了進(jìn)行詞頻統(tǒng)計(jì),我們需要創(chuàng)建一個(gè)字典變量,以單詞為鍵,以統(tǒng)計(jì)出的單詞個(gè)數(shù)為值,在遍歷列表時(shí)不斷更新該字典,就可以最終得到一個(gè)含有所有《哈姆雷特》內(nèi)容單詞詞頻的字典了。

最后,我們按照該字典轉(zhuǎn)化為一個(gè)新的列表,就可以對值的大小對該字典進(jìn)行排序,得到《哈姆雷特》詞頻從大到小的順序了。

二、英文文本詞頻統(tǒng)計(jì)程序編寫

根據(jù)上述思路,我們可以來編寫英文文本詞頻統(tǒng)計(jì)程序了。

打開文件及讀取文件內(nèi)容程序代碼如下所示:

f=open("C:\\Users\\Administrator\\Desktop\\哈姆雷特原文.txt","rt",encoding="utf-8")
Hamlet=f.read()
f.close()

對文件內(nèi)容進(jìn)行預(yù)處理代碼如下所示:

Hamlet=Hamlet.lower()
for char in "!@#$%^&*()_+~`,./;'[]\<>?:\"{}|":
    Hamlet=Hamlet.replace(char,"")

對文件單詞進(jìn)行統(tǒng)計(jì)代碼如下所示:

counts=dict()
for word in words:
    counts[word]=counts.get(word,0)+1

對字典生成新的列表,并進(jìn)行排序,代碼如下所示:

sequence=list(counts.items())
sequence.sort(key=lambda x:x[1],reverse=True)

篩選出單詞出現(xiàn)頻率最高的10個(gè)單詞,并進(jìn)行輸出,代碼如下所示:

for i in range(10):
    word,count=sequence[i]
    print("單詞{}在Hamlet中出現(xiàn)次數(shù)為第{},出現(xiàn)了{(lán)}次".format(word,i+1,count))

最終代碼如下所示:

f=open("C:\\Users\\Administrator\\Desktop\\哈姆雷特原文.txt","rt",encoding="utf-8")
Hamlet=f.read()
f.close()
Hamlet=Hamlet.lower()
for char in "!@#$%^&*()_+~`,./;'[]\<>?:\"{}|":
    Hamlet=Hamlet.replace(char,"")
words=Hamlet.split()
counts=dict()
for word in words:
    counts[word]=counts.get(word,0)+1
sequence=list(counts.items())
sequence.sort(key=lambda x:x[1],reverse=True)
for i in range(10):
    word,count=sequence[i]
    print("單詞{}在Hamlet中出現(xiàn)次數(shù)為第{},出現(xiàn)了{(lán)}次".format(word,i+1,count))

三、程序執(zhí)行結(jié)果展示

運(yùn)行上述程序,我們最終得到結(jié)果如下所示:

從上圖可以看出,我們成功統(tǒng)計(jì)出了在《哈姆雷特》中出現(xiàn)次數(shù)最多的10個(gè)單詞。

總結(jié)

到此這篇關(guān)于Python英文詞頻統(tǒng)計(jì)(哈姆雷特)程序的文章就介紹到這了,更多相關(guān)Python英文詞頻統(tǒng)計(jì)內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python求素?cái)?shù)示例分享

    python求素?cái)?shù)示例分享

    這篇文章主要介紹了python求素?cái)?shù)示例,打印出素?cái)?shù)列表,需要的朋友可以參考下
    2014-02-02
  • pandas DataFrame.to_sql()用法小結(jié)

    pandas DataFrame.to_sql()用法小結(jié)

    Pandas是基于NumPy的一種工具,該工具是為了解決數(shù)據(jù)分析任務(wù)而創(chuàng)建的,本文主要介紹了pandas DataFrame.to_sql()用法小結(jié),感興趣的可以了解一下
    2024-02-02
  • tensorflow 中對數(shù)組元素的操作方法

    tensorflow 中對數(shù)組元素的操作方法

    今天小編就為大家分享一篇tensorflow 中對數(shù)組元素的操作方法,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-07-07
  • 利用TensorFlow訓(xùn)練簡單的二分類神經(jīng)網(wǎng)絡(luò)模型的方法

    利用TensorFlow訓(xùn)練簡單的二分類神經(jīng)網(wǎng)絡(luò)模型的方法

    本篇文章主要介紹了利用TensorFlow訓(xùn)練簡單的二分類神經(jīng)網(wǎng)絡(luò)模型的方法,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2018-03-03
  • python爬蟲之教你如何爬取地理數(shù)據(jù)

    python爬蟲之教你如何爬取地理數(shù)據(jù)

    這篇文章主要介紹了python爬蟲之教你如何爬取地理數(shù)據(jù),文中有非常詳細(xì)的代碼示例,對正在學(xué)習(xí)python的小伙伴們有很好的幫助,需要的朋友可以參考下
    2021-04-04
  • pd.drop_duplicates刪除重復(fù)行的方法實(shí)現(xiàn)

    pd.drop_duplicates刪除重復(fù)行的方法實(shí)現(xiàn)

    drop_duplicates 方法實(shí)現(xiàn)對數(shù)據(jù)框 DataFrame 去除特定列的重復(fù)行,本文主要介紹了pd.drop_duplicates刪除重復(fù)行的方法實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2022-06-06
  • python實(shí)現(xiàn)使用遺傳算法進(jìn)行圖片擬合

    python實(shí)現(xiàn)使用遺傳算法進(jìn)行圖片擬合

    最近做項(xiàng)目需要圖像擬合,本文主要介紹了python實(shí)現(xiàn)使用遺傳算法進(jìn)行圖片擬合,文中通過示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2022-03-03
  • 使用Python開發(fā)Markdown兼容公式格式轉(zhuǎn)換工具

    使用Python開發(fā)Markdown兼容公式格式轉(zhuǎn)換工具

    在技術(shù)寫作中我們經(jīng)常遇到公式格式問題,例如MathML無法顯示,LaTeX格式錯(cuò)亂等,所以本文我們將使用Python開發(fā)Markdown兼容公式格式轉(zhuǎn)換工具,有需要的小伙伴可以了解下
    2025-05-05
  • pychram中切換python版本方式(附圖文)

    pychram中切換python版本方式(附圖文)

    這篇文章主要介紹了如何在PyCharm中切換Python版本的步驟,包括查看現(xiàn)有版本、文件設(shè)置切換、選擇解釋器路徑以及應(yīng)用更改,文中通過圖文介紹的非常詳細(xì),需要的朋友可以參考下
    2024-12-12
  • 使用k8s部署Django項(xiàng)目的方法步驟

    使用k8s部署Django項(xiàng)目的方法步驟

    這篇文章主要介紹了使用k8s部署Django項(xiàng)目的方法步驟,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2019-01-01

最新評論

海丰县| 平乐县| 五大连池市| 利津县| 长兴县| 九龙坡区| 江安县| 湖州市| 平乐县| 永登县| 尚义县| 中宁县| 济宁市| 耒阳市| 虎林市| 松原市| 遂溪县| 彩票| 祁门县| 竹山县| 开封县| 乌拉特前旗| 改则县| 班戈县| 揭阳市| 年辖:市辖区| 云龙县| 大竹县| 寿宁县| 南木林县| 申扎县| 德兴市| 德令哈市| 二连浩特市| 鸡西市| 玉溪市| 抚顺市| 红安县| 莱西市| 马龙县| 沙湾县|