最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python獲取txt文件詞向量過程詳解

 更新時間:2019年07月05日 15:31:13   作者:Zhen大蝦  
這篇文章主要介紹了python獲取txt文件詞向量過程詳解,如何讀取完整的大文件,而不會出現(xiàn)內(nèi)存不足memery error等問題,將讀取出來的文件,保存為npy文件,根據(jù)詞找到對應(yīng)的向量,需要的朋友可以參考下

在讀取https://github.com/Embedding/Chinese-Word-Vectors中的中文詞向量時,選擇了一個有3G多的txt文件,之前在做詞向量時用的是word2vec,所以直接導(dǎo)入模型然后indexword即可。

因為這是一個txt大文件,嘗試了DataFrame,np.loadtxt等,都沒有成功,其中主要遇到的問題是:

  • 如何讀取完整的大文件,而不會出現(xiàn)內(nèi)存不足memery error等問題
  • 將讀取出來的文件,保存為npy文件
  • 根據(jù)詞找到對應(yīng)的向量

解決辦法

嘗試使用的代碼:

代碼1:
try:
lines=np.loadtxt(filepath)
catch:
感覺這塊不會寫了咦,,,
  print(ValueError)
但這樣的話,它就不會繼續(xù)循環(huán)去讀上邊的txt了呢
代碼2:
lines=[]
with open(filepath) as f:
  for line in f:
    lines.append(line)
np.save(filepath,lines)
代碼3
 
def readEmbedFile(embedFile):
#   embedId = {}
#   input = open(embedFile,'r',encoding="utf-8")
#   lines = []
#   a=0
#   for line in input:
#     lines.append(line)
#     a=a+1
#     print(a)
#   nwords = len(lines) - 1
#   splits = lines[1].strip().split(' ') # 因為第一行是統(tǒng)計信息,所以用第二行
#   dim = len(splits) - 1
#   embeddings=[]
#   # embeddings = [[0 for col in range(dim)] for row in range(nwords)]
#   b=0
#   for lineId in range(len(lines)):
#     b=b+1
#     print(b)
#     splits = lines[lineId].split(' ')
#     if len(splits) > 2:
#       # embedId賦值
#       embedId[splits[0]] = lineId
#       # embeddings賦值
#       emb = [float(splits[i]) for i in range(1, 300)]
#       embeddings.append(emb)
#   return embedId, embeddings
代碼4:
def load_txt(filename):
  lines=[]
  vec_dict={}
  with open(filename,r) as f:
    for line in f:
    list=line.strip()
    lines.append(line)
  for i, line in emuate(lines):
    if i=0:
      continue
    line=line.split(" ")
    wordID=line[0]
    wordvec=[float line[i] for i in range(1,300)]
  vec_dict[wordId]=np.array(wordvec)  
 
  return vec_dict

具體內(nèi)存不足主要的原因是:

我的虛擬機中確實內(nèi)存不太夠,后來使用實驗室32G的主機后,可以得到idvec,而得不到向量的,報的錯還是memory error.
另一個原因,是需要把詞向量轉(zhuǎn)換為float形式,在python中str 占的內(nèi)存>float類型,如代碼所示:

print("str",sys.getsizeof(""))
print("float",sys.getsizeof(1.1))
print("int",sys.getsizeof(1))
print("list",sys.getsizeof([]))
print("tuple",sys.getsizeof(()))
print("dic",sys.getsizeof([]))
str 49
float 24
int 28
list 64
tuple 48
dic 64

在我的電腦,64位操作系統(tǒng),64位的python, 所占內(nèi)存大小排序為:

dic=list>str>tuple>int>float

讀取時候可以用np.load().item就可以復(fù)原原來的字典,主要參照下述文件:

然后通過python的字典操作就可以遍歷得到每個詞的詞向量了,dic[vocab]

心得

距離完全解決項目的問題還有5~6的大關(guān)卡,但靜下心來,一步步地做總會突破的呀!

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python爬蟲之模擬知乎登錄的方法教程

    Python爬蟲之模擬知乎登錄的方法教程

    在爬蟲過程中,有些頁面在登錄之前是被禁止抓取的,這個時候就需要模擬登陸了,下面這篇文章主要給大家介紹了利用Python爬蟲模擬知乎登錄的方法教程,文中介紹的非常詳細(xì),需要的朋友可以參考借鑒,下面來一起看看吧。
    2017-05-05
  • Pytorch之卷積層的使用詳解

    Pytorch之卷積層的使用詳解

    今天小編就為大家分享一篇Pytorch之卷積層的使用詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12
  • Python變量的作用域詳解

    Python變量的作用域詳解

    這篇文章主要為大家介紹了Python變量的作用域,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2021-12-12
  • 使用 Python 清理收藏夾里已失效的網(wǎng)站

    使用 Python 清理收藏夾里已失效的網(wǎng)站

    這篇文章主要介紹了用 Python 清理收藏夾里已失效的網(wǎng)站,本文通過截圖實例代碼的形式給大家介紹的非常詳細(xì),具有一定的參考借鑒價值,需要的朋友可以參考下
    2019-12-12
  • python 將Excel轉(zhuǎn)Word的示例

    python 將Excel轉(zhuǎn)Word的示例

    這篇文章主要介紹了python 將Excel轉(zhuǎn)Word的示例,幫助大家更好的理解和學(xué)習(xí)使用python,感興趣的朋友可以了解下
    2021-03-03
  • 解決python tkinter界面卡死的問題

    解決python tkinter界面卡死的問題

    今天小編就為大家分享一篇解決python tkinter界面卡死的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-07-07
  • python使用openpyxl讀取合并單元格的值

    python使用openpyxl讀取合并單元格的值

    本文主要介紹了python使用openpyxl讀取合并單元格的值,文中通過示例代碼介紹的非常詳細(xì),具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2021-07-07
  • Python?Prometheus接口揭秘數(shù)據(jù)科學(xué)新技巧

    Python?Prometheus接口揭秘數(shù)據(jù)科學(xué)新技巧

    本篇文章將分享Prometheus?API的基本概念到PromQL查詢語言的應(yīng)用,再到如何通過Python與Prometheus?API進(jìn)行無縫交互,通過豐富的示例代碼和詳細(xì)的講解,將解鎖使用Python進(jìn)行實時監(jiān)控的奇妙世界,為讀者打開更廣闊的數(shù)據(jù)分析視野
    2024-01-01
  • Flask實現(xiàn)異步執(zhí)行任務(wù)

    Flask實現(xiàn)異步執(zhí)行任務(wù)

    在一些開發(fā)中,可能會遇到需要長時間處理的任務(wù),此時就需要使用異步的方式來實現(xiàn),本文就介紹了Flask實現(xiàn)異步執(zhí)行任務(wù)的方法,感興趣的可以了解一下
    2021-05-05
  • Windows11使用Cpython?編譯文件報錯?error:?Unable?to?find?vcvarsall.bat?完美解決方法

    Windows11使用Cpython?編譯文件報錯?error:?Unable?to?find?vcvars

    這篇文章主要介紹了Windows11使用Cpython編譯文件報錯error:Unable?to find?vcvarsall.bat完美解決方法,本文通過圖文并茂的形式給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2023-05-05

最新評論

平谷区| 芦山县| 林口县| 丰都县| 江阴市| 玛曲县| 宜都市| 永年县| 阳春市| 尼勒克县| 上林县| 开封市| 扶沟县| 天峻县| 乡宁县| 乌拉特中旗| 修文县| 镇康县| 金堂县| 岳阳市| 顺昌县| 西丰县| 樟树市| 交口县| 银川市| 来宾市| 安溪县| 克东县| 弥勒县| 庆安县| 宣汉县| 榆社县| 惠水县| 沭阳县| 佛山市| 周至县| 固阳县| 枣阳市| 和田县| 焉耆| 如东县|