最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python針對(duì)不同文本長(zhǎng)度的處理方案總結(jié)與對(duì)比

 更新時(shí)間:2025年02月23日 10:29:34   作者:大霸王龍  
這篇文章主要為大家詳細(xì)介紹了Python如何針對(duì)不同文本長(zhǎng)度的處理方案,結(jié)合層次化編碼和檢索優(yōu)化策略,感興趣的小伙伴可以參考一下

直接上代碼+注釋

有意嘗試可交流

效果正在驗(yàn)證中。

1.短文本處理(<500tokens)

from sentence_transformers import SentenceTransformer
model = SentenceTransformer('all-MiniLM-L6-v2')  # 384維小型模型

def process_short(text):
    """直接全文本編碼"""
    return model.encode(text, convert_to_tensor=True)

# 示例
short_text = "自然語(yǔ)言處理的基礎(chǔ)概念"  # 長(zhǎng)度約15 tokens
vector = process_short(short_text)

2. 中長(zhǎng)文本處理 (500-2000 tokens)

from langchain_text_splitters import RecursiveCharacterTextSplitter

def process_medium(text):
    """重疊分塊策略"""
    splitter = RecursiveCharacterTextSplitter(
        chunk_size=500,
        chunk_overlap=50,
        separators=["\n\n", "\n", "。", "!", "?"]
    )
    chunks = splitter.split_text(text)
    return [model.encode(chunk) for chunk in chunks]

# 示例
medium_text = "機(jī)器學(xué)習(xí)發(fā)展歷史...(約1500字)"  # 約1800 tokens
chunk_vectors = process_medium(medium_text)

3. 長(zhǎng)文本處理 (2000-20000 tokens)

import spacy

def process_long(text):
    """語(yǔ)義分塊+摘要增強(qiáng)"""
    # 加載語(yǔ)義分割模型
    nlp = spacy.load("zh_core_web_sm") 
    doc = nlp(text)
    
    # 按段落分割
    chunks = [sent.text for sent in doc.sents]
    
    # 生成章節(jié)摘要
    summary_model = SentenceTransformer('uer/sbert-base-chinese-nli')
    summaries = [summary_model.encode(chunk[:200]) for chunk in chunks]
    
    return chunks, summaries

# 示例
long_text = "人工智能技術(shù)白皮書(shū)...(約2萬(wàn)字)"  # 約20000 tokens
text_chunks, summary_vecs = process_long(long_text)

4. 超長(zhǎng)文本處理 (20000-200000 tokens)

import faiss
import numpy as np

class HierarchicalIndex:
    def __init__(self):
        # 兩級(jí)索引結(jié)構(gòu)
        self.summary_index = faiss.IndexFlatL2(384)
        self.chunk_index = faiss.IndexIVFPQ(
            faiss.IndexFlatL2(384), 384, 100, 16, 8
        )
        self.metadata = []

    def add_document(self, text):
        # 生成段落級(jí)摘要
        chunks, summaries = process_long(text)
        
        # 構(gòu)建索引
        summary_vecs = np.array(summaries).astype('float32')
        chunk_vecs = np.array([model.encode(c) for c in chunks]).astype('float32')
        
        self.summary_index.add(summary_vecs)
        self.chunk_index.add(chunk_vecs)
        self.metadata.extend(chunks)

    def search(self, query, k=5):
        # 先檢索摘要層
        query_vec = model.encode(query).astype('float32')
        _, sum_indices = self.summary_index.search(np.array([query_vec]), 10)
        
        # 精搜相關(guān)塊
        target_chunks = [self.chunk_index.reconstruct(i) for i in sum_indices]
        target_chunks = np.array(target_chunks).astype('float32')
        _, chunk_indices = self.chunk_index.search(target_chunks, k)
        
        return [self.metadata[i] for i in chunk_indices]

# 使用示例
hindex = HierarchicalIndex()
hindex.add_document("某領(lǐng)域技術(shù)文檔...(約15萬(wàn)字)")  # 約200000 tokens
results = hindex.search("深度學(xué)習(xí)在醫(yī)療影像的應(yīng)用")

5. 海量文本處理 (>200000 tokens)

import dask.dataframe as dd
from dask.distributed import Client

def process_extreme(file_path):
    """分布式處理方案"""
    client = Client(n_workers=4)  # 啟動(dòng)Dask集群
    
    # 分塊讀取
    df = dd.read_parquet(file_path, chunksize=100000)  
    
    # 并行編碼
    df['vector'] = df['text'].map_partitions(
        lambda s: s.apply(model.encode),
        meta=('vector', object)
    )
    
    # 構(gòu)建分布式索引
    df.to_parquet("encoded_data.parquet", engine="pyarrow")
    
# 示例(處理100萬(wàn)條文本)
process_extreme("massive_data.parquet")

性能優(yōu)化對(duì)照表=

文本長(zhǎng)度處理策略索引類型響應(yīng)時(shí)間內(nèi)存消耗
<500直接編碼FlatIndex<10ms1MB
2000重疊分塊IVF+PQ50-100ms50MB
20000語(yǔ)義分塊+摘要索引二級(jí)索引200-500ms300MB
200000層次化索引IVFOPQ+ProductQuant1-2s2GB
>200000分布式處理分片索引10s+集群資源

關(guān)鍵處理技術(shù)

  • 滑動(dòng)窗口:通過(guò)chunk_overlap保留上下文連續(xù)性
  • 語(yǔ)義分塊:使用spacy進(jìn)行句子邊界檢測(cè)
  • 層次化索引:摘要層加速粗篩,塊層保證精度
  • 量化壓縮:PQ算法減少內(nèi)存占用(精度損失

以上就是Python針對(duì)不同文本長(zhǎng)度的處理方案總結(jié)與對(duì)比的詳細(xì)內(nèi)容,更多關(guān)于Python文本處理的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • python實(shí)現(xiàn)的web監(jiān)控系統(tǒng)

    python實(shí)現(xiàn)的web監(jiān)控系統(tǒng)

    這篇文章主要介紹了python實(shí)現(xiàn)的web監(jiān)控系統(tǒng),幫助大家更好的理解和學(xué)習(xí)使用python,感興趣的朋友可以了解下
    2021-04-04
  • Python3中的json模塊使用詳解

    Python3中的json模塊使用詳解

    這篇文章主要介紹了Python3中的json模塊使用詳解,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2018-05-05
  • python獲取指定時(shí)間差的時(shí)間實(shí)例詳解

    python獲取指定時(shí)間差的時(shí)間實(shí)例詳解

    這篇文章主要介紹了python獲取指定時(shí)間差的時(shí)間實(shí)例詳解的相關(guān)資料,需要的朋友可以參考下
    2017-04-04
  • Python實(shí)現(xiàn)的IP端口掃描工具類示例

    Python實(shí)現(xiàn)的IP端口掃描工具類示例

    這篇文章主要介紹了Python實(shí)現(xiàn)的IP端口掃描工具類,結(jié)合實(shí)例形式分析了Python基于socket模塊與多線程操作實(shí)現(xiàn)IP端口掃描的相關(guān)操作技巧,需要的朋友可以參考下
    2019-02-02
  • python自動(dòng)化之如何利用allure生成測(cè)試報(bào)告

    python自動(dòng)化之如何利用allure生成測(cè)試報(bào)告

    這篇文章主要給大家介紹了關(guān)于python自動(dòng)化之如何利用allure生成測(cè)試報(bào)告的相關(guān)資料,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2021-05-05
  • 解決keras加入lambda層時(shí)shape的問(wèn)題

    解決keras加入lambda層時(shí)shape的問(wèn)題

    這篇文章主要介紹了解決keras加入lambda層時(shí)shape的問(wèn)題,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-06-06
  • Python獲取航線信息并且制作成圖的講解

    Python獲取航線信息并且制作成圖的講解

    今天小編就為大家分享一篇關(guān)于Python獲取航線信息并且制作成圖的講解,小編覺(jué)得內(nèi)容挺不錯(cuò)的,現(xiàn)在分享給大家,具有很好的參考價(jià)值,需要的朋友一起跟隨小編來(lái)看看吧
    2019-01-01
  • Django利用Cookie實(shí)現(xiàn)反爬蟲(chóng)的例子

    Django利用Cookie實(shí)現(xiàn)反爬蟲(chóng)的例子

    這篇文章主要介紹了Django利用Cookie實(shí)現(xiàn)反爬蟲(chóng),本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-04-04
  • Python plt.boxplot函數(shù)及其參數(shù)使用小結(jié)

    Python plt.boxplot函數(shù)及其參數(shù)使用小結(jié)

    plt.boxplot函數(shù)用于繪制箱線圖,本文介紹了Python plt.boxplot函數(shù)及其參數(shù)使用小結(jié),文中通過(guò)示例代碼介紹的非常詳細(xì),需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2024-02-02
  • Python3刪除排序數(shù)組中重復(fù)項(xiàng)的方法分析

    Python3刪除排序數(shù)組中重復(fù)項(xiàng)的方法分析

    這篇文章主要介紹了Python3刪除排序數(shù)組中重復(fù)項(xiàng)的方法,結(jié)合實(shí)例形式分析了Python3刪除排序數(shù)組重復(fù)項(xiàng)的原理、相關(guān)遍歷及刪除操作技巧,需要的朋友可以參考下
    2019-01-01

最新評(píng)論

德清县| 达州市| 托里县| 宜春市| 甘洛县| 独山县| 田林县| 阿克陶县| 聊城市| 中山市| 博乐市| 屯门区| 湟源县| 麦盖提县| 普定县| 横峰县| 高邮市| 东乡| 乌什县| 博罗县| 临汾市| 峨眉山市| 尤溪县| 水富县| 达孜县| 建平县| 安龙县| 平陆县| 中方县| 宿松县| 大同市| 景谷| 东至县| 清镇市| 天津市| 曲阳县| 大宁县| 启东市| 扶绥县| 洛隆县| 成安县|