最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

使用Python算法實現從字符串中提取重復子串

 更新時間:2025年10月22日 09:37:04   作者:東方佑  
在文本處理和數據分析中,經常需要從字符串中提取重復出現的子串,本文將解析一個高效的Python算法,用于從給定字符串中提取長度超過3的重復子串,需要的朋友可以參考下

算法概述

該算法包含兩個核心函數:

  • replace_text() - 預處理字符串,替換低頻字符
  • compute_sub_string_list() - 提取重復子串

1. 預處理函數:replace_text()

def replace_text(copy_text):
    replace_char = ""
    # 統(tǒng)計字符頻率
    for char, count in Counter(list(copy_text)).items():
        if count == 1:  # 只出現一次的字符
            if replace_char == "":
                replace_char = char  # 選擇第一個低頻字符作為替換字符
            else:
                # 用替換字符替換其他低頻字符
                copy_text = copy_text.replace(char, replace_char)
    
    if replace_char != "":
        # 分割字符串并篩選長度>3的子串
        return [sub for sub, _ in Counter(copy_text.split(replace_char)).items() 
                if len(sub) > 3]
    else:
        return [copy_text]  # 沒有低頻字符時返回整個字符串

功能說明

  • 找出所有只出現一次的字符
  • 使用第一個低頻字符替換其他低頻字符
  • 用替換字符分割字符串
  • 返回長度超過3的子串列表

2. 主處理函數:compute_sub_string_list()

def compute_sub_string_list(text1):
    text_list = replace_text(text1)  # 預處理
    new_text_list = []

    for one_text in text_list:
        if len(one_text) == 4:
            # 處理長度為4的子串
            if one_text in new_text_list:
                continue
            if text1.count(one_text) > 1:
                new_text_list.append(one_text)
        else:
            # 處理長度>4的子串
            max_count = 0
            max_str = ""
            while len(one_text) > 4:
                sub_str = one_text[:3]
                up_str_count = 0
                up_str = ""
                
                # 擴展子串并檢查重復性
                for char in one_text[3:]:
                    sub_str += char
                    if sub_str in new_text_list:
                        continue
                    str_count = text1.count(sub_str)
                    if str_count > 1:
                        if up_str_count <= str_count:
                            up_str_count = str_count
                            up_str = sub_str
                    else:
                        break  # 停止擴展
                
                # 更新最佳子串
                if up_str:
                    if up_str_count > max_count:
                        max_count = up_str_count
                        max_str = up_str
                
                # 滑動窗口
                one_text = one_text[1:]
            
            if max_str:
                new_text_list.append(max_str)
    
    return new_text_list

功能說明

  • 對預處理后的每個子串進行處理
  • 對于長度為4的子串直接檢查重復性
  • 對于更長子串使用滑動窗口 技術:
    1. 從3字符前綴開始擴展
    2. 記錄出現次數最多的有效子串
    3. 滑動窗口繼續(xù)查找
  • 返回所有符合條件的重復子串

算法優(yōu)勢

  1. 高效預處理:通過替換低頻字符優(yōu)化后續(xù)處理
  2. 智能子串擴展:動態(tài)擴展子串直到不再重復
  3. 滑動窗口 技術:高效遍歷所有可能子串
  4. 頻率優(yōu)先:優(yōu)先選擇出現次數最多的子串

使用示例

if __name__ == '__main__':
    text = "abracadabraabracadabra"
    result = compute_sub_string_list(text)
    print("重復子串:", result)
    # 輸出: ['abra', 'racad', 'acada', 'cadab', 'adabr']

應用場景

  • 文本模式識別
  • DNA序列分析
  • 代碼重復檢測
  • 自然語言處理中的短語提取
  • 數據壓縮算法

這個算法通過巧妙的預處理和滑動窗口 技術,高效地從字符串中提取有意義的重復模式,特別適合處理包含重復模式的長文本數據。

def replace_text(copy_text):
    replace_text = ""
    for i in Counter(list(copy_text)).items():
        if i[1] == 1:
            if replace_text == "":
                replace_text = i[0]
            else:
                copy_text = copy_text.replace(i[0], replace_text)
    if replace_text != "":

        return [i[0] for i in Counter(copy_text.split(replace_text)).items() if len(i[0]) > 3]
    else:
        return [copy_text]


def compute_sub_string_list(text1):
    copy_text = text1
    text_list = replace_text(copy_text)

    new_text_list = []

    for one_text in text_list:
        if len(one_text) == 4:
            if one_text in new_text_list:
                continue
            if text1.count(one_text) > 1:
                new_text_list.append(one_text)
        else:
            max_count = 0
            max_str = ""
            while True:

                sub_str = one_text[:3]
                up_str_count = 0
                up_str = ""

                for s in one_text[3:]:
                    sub_str += s
                    if sub_str in new_text_list:
                        continue
                    str_count = text1.count(sub_str)
                    if str_count > 1:
                        if up_str_count <= str_count:
                            up_str_count = str_count
                            up_str = sub_str
                    else:
                        break
                if up_str:
                    if up_str_count > max_count:
                        max_count = up_str_count
                        max_str = up_str
                if len(one_text) > 4:

                    one_text = one_text[1:]
                else:
                    break
            new_text_list.append(max_str)
    return new_text_list


if __name__ == '__main__':
    print()

以上就是使用Python算法實現從字符串中提取重復子串的詳細內容,更多關于Python算法字符串提取重復子串的資料請關注腳本之家其它相關文章!

相關文章

  • Flask實現定制日志并輸出到文件

    Flask實現定制日志并輸出到文件

    這篇文章主要為大家學習介紹了Flask如何實現定制日志并輸出到文件,文中的示例代碼簡介易懂,感興趣的小伙伴快跟隨小編一起學習一下吧
    2023-07-07
  • pytorch簡介

    pytorch簡介

    Pytorch是torch的python版本,是由Facebook開源的神經網絡框架,專門針對 GPU 加速的深度神經網絡(DNN)編程。這篇文章給大家介紹pytorch的相關知識,感興趣的朋友一起看看吧
    2020-11-11
  • Django項目中用JS實現加載子頁面并傳值的方法

    Django項目中用JS實現加載子頁面并傳值的方法

    今天小編就為大家分享一篇Django項目中用JS實現加載子頁面并傳值的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-05-05
  • Python中解包操作的性能實測與最佳實踐

    Python中解包操作的性能實測與最佳實踐

    這篇文章主要為大家詳細介紹了Python中解包操作的性能實測與最佳實踐,文中的示例代碼講解詳細,感興趣的小伙伴可以跟隨小編一起學習一下
    2025-04-04
  • 使用Python中tkinter庫簡單gui界面制作及打包成exe的操作方法(二)

    使用Python中tkinter庫簡單gui界面制作及打包成exe的操作方法(二)

    這篇文章主要介紹了使用Python中tkinter庫簡單gui界面制作及打包成exe的操作方法(二),本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-10-10
  • 基于Python實現人像雪景小程序

    基于Python實現人像雪景小程序

    這篇文章主要介紹了通過Python實現的人像雪景小程序,小程序還會自動生成每一幀雪花飄落的圖片,跟GIF動態(tài)雪花人像圖,還不用自己錄制視頻看效果。感興趣的可以跟隨小編一起學習一下
    2021-12-12
  • Python使用DrissionPage實現自動化處理的簡單入門指南

    Python使用DrissionPage實現自動化處理的簡單入門指南

    在Python自動化領域,Selenium和Requests是兩個常用工具,DrissionPage巧妙結合了兩者優(yōu)勢,本文將帶你從零開始,用10分鐘掌握DrissionPage的核心用法,希望對大家有所幫助
    2026-01-01
  • numpy中np.sort返回索引的具體使用

    numpy中np.sort返回索引的具體使用

    本文主要介紹了使用numpy中np.sort函數返回索引的詳細解釋和使用方法,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2023-07-07
  • Python中使用haystack實現django全文檢索搜索引擎功能

    Python中使用haystack實現django全文檢索搜索引擎功能

    django是python語言的一個web框架,功能強大。配合一些插件可為web網站很方便地添加搜索功能。下面通過本文給大家分享Python中使用haystack實現django全文檢索搜索引擎功能,感興趣的朋友一起看看吧
    2017-08-08
  • 使用Python的datetime庫處理時間(RPA流程)

    使用Python的datetime庫處理時間(RPA流程)

    datetime 是 Python 處理日期和時間的標準庫。這篇文章主要介紹了使用Python的datetime庫處理時間(RPA流程),需要的朋友可以參考下
    2019-11-11

最新評論

天柱县| 白朗县| 湘乡市| 西平县| 大姚县| 台中县| 荔波县| 灵丘县| 盘山县| 三门县| 华蓥市| 阳曲县| 灵丘县| 太原市| 怀柔区| 华安县| 广元市| 北京市| 平乡县| 岫岩| 景东| 洪泽县| 车致| 泸州市| 麻城市| 海丰县| 纳雍县| 武城县| 宁陵县| 连江县| 泽州县| 昭觉县| 黄梅县| 武山县| 叙永县| 襄汾县| 全州县| 麻城市| 广元市| 轮台县| 黑龙江省|