最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

如何利用python實(shí)現(xiàn)詞頻統(tǒng)計(jì)功能

 更新時(shí)間:2021年10月17日 16:00:12   作者:周魚仔  
詞頻統(tǒng)計(jì)用途很廣泛,比如我們統(tǒng)計(jì)某篇文章中的用詞頻率,網(wǎng)絡(luò)熱點(diǎn)詞匯,再比如起名排行榜呀、熱門旅游景點(diǎn)排行榜呀什么的,其實(shí)也都可以套用,這篇文章主要給大家介紹了關(guān)于如何利用python實(shí)現(xiàn)詞頻統(tǒng)計(jì)功能的相關(guān)資料,需要的朋友可以參考下

功能要求

這是我們老師的作業(yè) 代碼中都有注釋 要求 詞頻統(tǒng)計(jì)軟件:

1)從文本中讀入數(shù)據(jù):(文件的輸入輸出)

2)不區(qū)分大小寫,去除特殊字符。

3) 統(tǒng)計(jì)單詞 例如:about :10 并統(tǒng)計(jì)總共多少單詞

4)對(duì)單詞排序。出現(xiàn)次數(shù)

5)輸出詞頻最高的10個(gè)單詞和次數(shù)

6)把統(tǒng)計(jì)結(jié)果存入文本

方法如下

1.文件的讀取,區(qū)分大小寫,去除特殊字符

import re
 
def getword():
     # 讀取文件
     f=open('read.txt','r',encoding='utf-8')
     # 將大寫轉(zhuǎn)化成小寫
     word=f.read().lower()
     # 關(guān)閉文件
     f.close()
     #利用正則除去特殊字符   |\符+
     list=re.split('\s+|\,+|\.+|\!+|\:+|\?+|\;+|\(+|\)+|\-+|\_+|\=+|\++|\“+|\、+|\/+|\{+|\}+|\”+|\:+|\。+|\“+|\[+|\]+|\【+|\】+|\—+|\%+|\"+',word)
     # 遍歷列表 去除列表中的空格
     i = 0
     while i < len(list):
          if list[i] == '':
               list.remove(list[i])
               i -= 1
          i += 1
 
     # for a in list:
     #      if a == "":
     #         list.remove(a)
    #用for循環(huán)的話如果存在多個(gè)空字符串 其列表會(huì)隨時(shí)發(fā)生變化,導(dǎo)致無(wú)法正常刪除空字符串 所以在使用for…in循環(huán)遍歷列表時(shí),最好不要對(duì)元素進(jìn)行增刪操作
 
#  對(duì)于others'優(yōu)化 如果最后一個(gè)字符是‘就將'其去掉
     for i in range(len(list)):
          l=list[i]
          if list[i][-1] == "'":
               list[i] = list[i][:-1]
     return list
 
 
 
 
 

2. 統(tǒng)計(jì),排序

from getfilewords import getword
 
def statistics():
    dict={}  #定義一個(gè)空的字典,在后面的運(yùn)算中逐步添加數(shù)據(jù)
    words=getword()
    for word in words: #遍歷整個(gè)列表
        if word in dict.keys():  #判斷當(dāng)前單詞是否已經(jīng)存在 dict.keys()是已存進(jìn)字典中的單詞
            # 補(bǔ)充:keys() 方法用于返回字典中的所有鍵;
            # values() 方法用于返回字典中所有鍵對(duì)應(yīng)的值;
            #詳情見(jiàn)Test1
            dict[word]=dict[word]+1  #在當(dāng)前單詞的個(gè)數(shù)上加 1
        else:
            dict[word]=1  #當(dāng)前單詞第一次出現(xiàn)時(shí) 會(huì)把單詞寫入dict字典里 格式為 ‘單詞'=1
#排序
    w_order=sorted(dict.items(),key=lambda x:x[1],reverse=True)
# print(dict.items())
# dict.items()返回的是列表
# 按字典集合中,每一個(gè)元組的第二個(gè)元素排列。
# sorted會(huì)對(duì)dict.items()這個(gè)list進(jìn)行遍歷,把list中的每一個(gè)元素,也就是每一個(gè)tuple()當(dāng)做x傳入匿名函數(shù)lambda x:x[1],函數(shù)返回值為x[1]
# reverse屬性True為降序 False為升序
    return w_order #返回排序后的列表

3.結(jié)果寫入文本

from WordStatistics import statistics
def writefile():
    w_order=statistics()
    f = open('result.txt', 'w',encoding='utf-8')
    print("文章單詞總個(gè)數(shù):",+len(getword()),file=f)
    print("文章單詞總個(gè)數(shù):", +len(getword()))
 
    # 寫入文件
    print("詞頻最高的10個(gè)單詞和次數(shù)",file=f)
    print("詞頻最高的10個(gè)單詞和次數(shù)")
 
    w_order10=w_order[:10]#將列表的前十位提取并且遍歷 輸出key(單詞)和values(次數(shù))
    for key,values in w_order10:
        print(key,':',values,file=f)
        print(key, ':', values)
 
    #遍歷列表中的所有數(shù)據(jù)
    print("統(tǒng)計(jì)結(jié)果",file=f)
    for key,values in w_order:
        print(key,':',values,file=f)
    f.close()#關(guān)閉文件

4.程序入口

import os
 
from writefile import writefile
 
print("詞頻統(tǒng)計(jì)軟件")
print("正在統(tǒng)計(jì)中。。。")
print("統(tǒng)計(jì)成功,結(jié)果保存到result.txt")
writefile()
print("程序運(yùn)行結(jié)束")
os.system("pause")

5.運(yùn)行截圖 這是需要統(tǒng)計(jì)的文本

運(yùn)行程序

運(yùn)行結(jié)果

總結(jié)

到此這篇關(guān)于如何利用python實(shí)現(xiàn)詞頻統(tǒng)計(jì)功能的文章就介紹到這了,更多相關(guān)python實(shí)現(xiàn)詞頻統(tǒng)計(jì)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python通過(guò)PyQt5實(shí)現(xiàn)登錄界面的示例代碼

    python通過(guò)PyQt5實(shí)現(xiàn)登錄界面的示例代碼

    本文主要介紹了python通過(guò)PyQt5實(shí)現(xiàn)登錄界面的示例代碼,文中通過(guò)示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2021-08-08
  • Python列表去重的幾種方法整理

    Python列表去重的幾種方法整理

    這篇文章介紹了Python列表去重的幾種方法,文中通過(guò)示例代碼介紹的非常詳細(xì)。對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2022-06-06
  • 深入Python解釋器理解Python中的字節(jié)碼

    深入Python解釋器理解Python中的字節(jié)碼

    這篇文章深入Python解釋器、從其對(duì)字節(jié)碼的處理過(guò)程來(lái)詳解Python中的字節(jié)碼,需要的朋友可以參考下
    2015-04-04
  • python 3.7.0 安裝配置方法圖文教程

    python 3.7.0 安裝配置方法圖文教程

    這篇文章主要為大家詳細(xì)介紹了python 3.7.0 安裝配置方法圖文教程,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2018-08-08
  • python帶參數(shù)打包exe及調(diào)用方式

    python帶參數(shù)打包exe及調(diào)用方式

    今天小編就為大家分享一篇python帶參數(shù)打包exe及調(diào)用方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2019-12-12
  • Python調(diào)整PDF文檔頁(yè)邊距的方法小結(jié)

    Python調(diào)整PDF文檔頁(yè)邊距的方法小結(jié)

    PDF 文檔中的邊距是指環(huán)繞每頁(yè)內(nèi)容的空白區(qū)域,充當(dāng)文本或圖像與頁(yè)面邊緣之間的緩沖區(qū),本文將介紹如何使用 Spire.PDF for Python 修改 PDF 文檔的頁(yè)邊距,為不同使用場(chǎng)景定制合適的文檔布局,需要的朋友可以參考下
    2024-05-05
  • Python中re模塊的元字符使用小結(jié)

    Python中re模塊的元字符使用小結(jié)

    元字符是正則表達(dá)式中具有特殊意義的專用字符,本文主要介紹了Python中re模塊的元字符使用小結(jié),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2022-04-04
  • 七個(gè)非常實(shí)用的Python工具包總結(jié)

    七個(gè)非常實(shí)用的Python工具包總結(jié)

    Python 擁有海量的包,無(wú)論是普通任務(wù)還是復(fù)雜任務(wù),我們經(jīng)常在應(yīng)用程序中使用大量的工具包.本文我將討論一些常被低估的數(shù)據(jù)科學(xué)包,包括:數(shù)據(jù)清理、應(yīng)用程序開發(fā)和調(diào)試方面,需要的朋友可以參考下
    2021-06-06
  • 時(shí)間序列分析之ARIMA模型預(yù)測(cè)餐廳銷量

    時(shí)間序列分析之ARIMA模型預(yù)測(cè)餐廳銷量

    這篇文章主要介紹了時(shí)間序列分析之ARIMA模型預(yù)測(cè)餐廳銷量,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2022-11-11
  • python實(shí)現(xiàn)簡(jiǎn)單銀行管理系統(tǒng)

    python實(shí)現(xiàn)簡(jiǎn)單銀行管理系統(tǒng)

    這篇文章主要為大家詳細(xì)介紹了python實(shí)現(xiàn)簡(jiǎn)單銀行管理系統(tǒng),文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2019-10-10

最新評(píng)論

临安市| 临潭县| 浮梁县| 中西区| 佛学| 讷河市| 克什克腾旗| 霍州市| 江陵县| 资中县| 六盘水市| 桦甸市| 贵港市| 丰都县| 苏尼特右旗| 滕州市| 昌图县| 右玉县| 越西县| 新巴尔虎右旗| 中牟县| 怀来县| 嘉兴市| 青海省| 滕州市| 自贡市| 克拉玛依市| 河西区| 垣曲县| 东莞市| 大名县| 沁源县| 东平县| 绵阳市| 深泽县| 桦南县| 枣阳市| 潍坊市| 济源市| 茶陵县| 钦州市|