最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python基于textdistance實(shí)現(xiàn)計(jì)算文本相似度

 更新時(shí)間:2024年03月10日 09:27:23   作者:小龍?jiān)谏綎|  
textdistance是Python的第三方庫(kù),用于計(jì)算文本之間的相似度或距離,本文主要為大家詳細(xì)介紹了如何使用textdistance實(shí)現(xiàn)計(jì)算文本相似度,需要的可以了解下

textdistance是Python的第三方庫(kù),用于計(jì)算文本之間的相似度或距離。它提供了30+個(gè)算法,簡(jiǎn)單易用。

安裝

pip install textdistance

# 使用擴(kuò)展庫(kù),提高性能
pip install "textdistance[extras]"

使用

import textdistance

# 計(jì)算編輯距離
distance = textdistance.levenshtein.distance("如何更換花唄綁定銀行卡", "花唄更改綁定銀行卡")
print("編輯距離:", distance)

# 計(jì)算余弦相似度
similarity = textdistance.cosine.similarity("如何更換花唄綁定銀行卡", "花唄更改綁定銀行卡")
print("余弦相似度:", similarity)

# 計(jì)算 Jaccard 系數(shù)
coefficient = textdistance.jaccard("如何更換花唄綁定銀行卡", "花唄更改綁定銀行卡")
print("Jaccard 系數(shù):", coefficient)

# 計(jì)算 Hamming 距離
distance = textdistance.hamming.distance("如何更換花唄綁定銀行卡", "花唄更改綁定銀行卡")
print("Hamming 距離:", distance)

結(jié)果:

編輯距離: 5
余弦相似度: 0.8040302522073697
Jaccard 系數(shù): 0.6666666666666666
Hamming 距離: 10

應(yīng)用場(chǎng)景

拼寫(xiě)檢查

在拼寫(xiě)檢查中,可以使用編輯距離等算法來(lái)比較單詞之間的相似度,從而找出可能的正確拼寫(xiě)。

import textdistance

# 拼寫(xiě)檢查
word = "發(fā)憤圖強(qiáng)"
possible_spellings = ["發(fā)奮圖強(qiáng)", "發(fā)奮圖", "發(fā)憤圖"]

for spelling in possible_spellings:
    distance = textdistance.levenshtein.distance(word, spelling)
    if distance <= 1:
        print("可能的正確拼寫(xiě):", spelling)

結(jié)果

可能的正確拼寫(xiě): 發(fā)奮圖強(qiáng)
可能的正確拼寫(xiě): 發(fā)憤圖

文檔相似度計(jì)算

在信息檢索和推薦系統(tǒng)中,經(jīng)常需要計(jì)算文檔之間的相似度,以便為用戶提供相關(guān)的信息或推薦內(nèi)容。

import textdistance

# 文檔相似度計(jì)算
doc1 = "Python is a programming language"
doc2 = "Python is used for web development"
doc3 = "Java is a programming language"

similarity1 = textdistance.cosine.similarity(doc1, doc2)
similarity2 = textdistance.cosine.similarity(doc1, doc3)

print("文檔1和文檔2的余弦相似度:", similarity1)
print("文檔1和文檔3的余弦相似度:", similarity2)

結(jié)果

文檔1和文檔2的余弦相似度: 0.6063390625908325
文檔1和文檔3的余弦相似度: 0.8391463916782737

數(shù)據(jù)清洗

在數(shù)據(jù)清洗過(guò)程中,可以使用 Hamming 距離等算法來(lái)比較數(shù)據(jù)條目之間的相似度,從而找出相似但不完全相同的數(shù)據(jù)。

import textdistance

# 數(shù)據(jù)清洗
data = ["配偶", "原配", "元配", "老婆", "夫人", "愛(ài)人"]

for i in range(len(data)):
    for j in range(i+1, len(data)):
        distance = textdistance.hamming.distance(data[i], data[j])
        if distance <= 1:
            print("相似但不完全相同的數(shù)據(jù):", data[i], data[j])

結(jié)果:

相似但不完全相同的數(shù)據(jù): 原配 元配
相似但不完全相同的數(shù)據(jù): 夫人 愛(ài)人

import textdistance

# 姓名匹配
name1 = "李建國(guó)"
name2 = "張建國(guó)"
name3 = "王愛(ài)國(guó)"

coefficient1 = textdistance.jaccard.normalized_similarity(name1, name2)
coefficient2 = textdistance.jaccard.normalized_similarity(name1, name3)

print("姓名1和姓名2的Jaccard系數(shù):", coefficient1)
print("姓名1和姓名3的Jaccard系數(shù):", coefficient2)

結(jié)果

姓名1和姓名2的Jaccard系數(shù): 0.5
姓名1和姓名3的Jaccard系數(shù): 0.19999999999999996

textdistance 提供了豐富多樣的文本比較算法和距離度量方法,可以滿足各種不同的文本比較需求。

相關(guān)鏈接

源碼

到此這篇關(guān)于Python基于textdistance實(shí)現(xiàn)計(jì)算文本相似度的文章就介紹到這了,更多相關(guān)Python textdistance計(jì)算文本相似度內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • Pycharm 解決自動(dòng)格式化沖突的設(shè)置操作

    Pycharm 解決自動(dòng)格式化沖突的設(shè)置操作

    這篇文章主要介紹了Pycharm 解決自動(dòng)格式化沖突的設(shè)置操作,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2021-01-01
  • Python密碼學(xué)ROT13算法教程

    Python密碼學(xué)ROT13算法教程

    這篇文章主要為大家介紹了Python密碼學(xué)ROT13算法的教程詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2022-05-05
  • python協(xié)程異步IO中asyncio的使用

    python協(xié)程異步IO中asyncio的使用

    這篇文章主要介紹了python異步編程之a(chǎn)syncio的使用,python中異步IO操作是通過(guò)asyncio來(lái)實(shí)現(xiàn)的,為了更加詳細(xì)說(shuō)明asyncio,我們先從協(xié)程的最基礎(chǔ)開(kāi)始講解
    2023-12-12
  • 最新評(píng)論

    顺昌县| 金塔县| 迁安市| 克什克腾旗| 呈贡县| 杭锦旗| 衡南县| 年辖:市辖区| 漯河市| 长子县| 闽清县| 永嘉县| 赤壁市| 潼南县| 株洲县| 贡嘎县| 兰考县| 蒙山县| 九寨沟县| 广宁县| 鹿邑县| 来安县| 平邑县| 如东县| 峨边| 安岳县| 伊川县| 岫岩| 南郑县| 库尔勒市| 宣威市| 柳河县| 温宿县| 师宗县| 阿拉善右旗| 黑山县| 子长县| 平度市| 承德县| 马边| 开化县|