最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

一文分享5個Python文本處理的高效操作

 更新時間:2025年07月17日 08:22:42   作者:Python_trys  
在數(shù)據(jù)科學和自然語言處理領(lǐng)域,文本分析是一項基礎(chǔ)而重要的技能,本文將介紹5個Python中高效處理文本的操作,希望對大家有一定的幫助

前言

在數(shù)據(jù)科學和自然語言處理領(lǐng)域,文本分析是一項基礎(chǔ)而重要的技能。Python憑借其豐富的庫生態(tài)系統(tǒng),成為文本分析的首選工具。本文將介紹5個Python中高效處理文本的操作,幫助您快速入門文本分析。

1. 文本清洗:去除無用字符

文本數(shù)據(jù)通常包含各種噪音,如HTML標簽、特殊符號等,清洗是第一步。

import re

def clean_text(text):
    # 去除HTML標簽
    text = re.sub(r'<[^>]+>', '', text)
    # 去除特殊字符和數(shù)字
    text = re.sub(r'[^a-zA-Z\s]', '', text)
    # 轉(zhuǎn)換為小寫
    text = text.lower()
    # 去除多余空格
    text = ' '.join(text.split())
    return text

sample_text = "<p>This is a sample text! 123</p>"
print(clean_text(sample_text))  # 輸出: this is a sample text

2. 分詞處理:NLTK與jieba庫

分詞是文本分析的基礎(chǔ),英文可以使用NLTK,中文推薦使用jieba。

# 英文分詞
import nltk
nltk.download('punkt')  # 第一次使用需要下載數(shù)據(jù)

from nltk.tokenize import word_tokenize
text = "Natural language processing is fascinating."
tokens = word_tokenize(text)
print(tokens)  # 輸出: ['Natural', 'language', 'processing', 'is', 'fascinating', '.']

# 中文分詞
import jieba
text_chinese = "自然語言處理非常有趣"
tokens_chinese = jieba.lcut(text_chinese)
print(tokens_chinese)  # 輸出: ['自然語言', '處理', '非常', '有趣']

3. 停用詞去除

停用詞對分析意義不大,去除它們可以提高效率。

from nltk.corpus import stopwords
nltk.download('stopwords')  # 第一次使用需要下載數(shù)據(jù)

stop_words = set(stopwords.words('english'))
filtered_tokens = [word for word in tokens if word.lower() not in stop_words]
print(filtered_tokens)  # 輸出: ['Natural', 'language', 'processing', 'fascinating', '.']

# 中文停用詞示例
stopwords_chinese = {"的", "是", "在", "非常"}
filtered_chinese = [word for word in tokens_chinese if word not in stopwords_chinese]
print(filtered_chinese)  # 輸出: ['自然語言', '處理', '有趣']

4. 詞頻統(tǒng)計與詞云生成

分析文本中的關(guān)鍵詞可以通過詞頻統(tǒng)計和可視化來實現(xiàn)。

from collections import Counter
from wordcloud import WordCloud
import matplotlib.pyplot as plt

# 詞頻統(tǒng)計
word_counts = Counter(filtered_tokens)
print(word_counts.most_common(3))  # 輸出: [('Natural', 1), ('language', 1), ('processing', 1)]

# 生成詞云
text_for_wordcloud = " ".join(filtered_tokens)
wordcloud = WordCloud(width=800, height=400).generate(text_for_wordcloud)

plt.figure(figsize=(10, 5))
plt.imshow(wordcloud, interpolation='bilinear')
plt.axis("off")
plt.show()

5. 情感分析:TextBlob應(yīng)用

快速評估文本情感傾向可以使用TextBlob庫。

from textblob import TextBlob
nltk.download('averaged_perceptron_tagger')  # 第一次使用需要下載數(shù)據(jù)

feedback = "I love this product. It's amazing!"
analysis = TextBlob(feedback)
print(f"情感極性: {analysis.sentiment.polarity}")  # 范圍從-1到1
print(f"主觀性: {analysis.sentiment.subjectivity}")  # 范圍從0到1

# 中文情感分析示例(需要先翻譯或使用中文專用庫)
chinese_feedback = "這個產(chǎn)品太糟糕了,我非常失望"
# 實際應(yīng)用中應(yīng)使用SnowNLP等中文庫

進階技巧:TF-IDF向量化

對于更高級的文本分析,可以將文本轉(zhuǎn)換為數(shù)值特征。

from sklearn.feature_extraction.text import TfidfVectorizer

documents = [
    "Python is a popular programming language",
    "Java is another programming language",
    "Python and Java are both object-oriented"
]

vectorizer = TfidfVectorizer()
X = vectorizer.fit_transform(documents)
print(vectorizer.get_feature_names_out())  # 輸出特征詞
print(X.shape)  # 文檔-詞矩陣形狀

結(jié)語

本文介紹了Python中5個實用的文本分析操作,從基礎(chǔ)清洗到情感分析。掌握這些技能后,您可以進一步探索更復(fù)雜的NLP任務(wù),如文本分類、命名實體識別等。Python的文本分析生態(tài)系統(tǒng)非常豐富,值得深入學習。

到此這篇關(guān)于一文分享5個Python文本處理的高效操作的文章就介紹到這了,更多相關(guān)Python文本處理內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • 利用python和ffmpeg 批量將其他圖片轉(zhuǎn)換為.yuv格式的方法

    利用python和ffmpeg 批量將其他圖片轉(zhuǎn)換為.yuv格式的方法

    今天小編就為大家分享一篇利用python和ffmpeg 批量將其他圖片轉(zhuǎn)換為.yuv格式的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01
  • pytorch 實現(xiàn)張量tensor,圖片,CPU,GPU,數(shù)組等的轉(zhuǎn)換

    pytorch 實現(xiàn)張量tensor,圖片,CPU,GPU,數(shù)組等的轉(zhuǎn)換

    今天小編就為大家分享一篇pytorch 實現(xiàn)張量tensor,圖片,CPU,GPU,數(shù)組等的轉(zhuǎn)換,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01
  • Python編程實現(xiàn)超炫動態(tài)排序圖

    Python編程實現(xiàn)超炫動態(tài)排序圖

    這篇文章主要介紹了Python編程實現(xiàn)超炫動態(tài)排序圖的示例解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步
    2021-10-10
  • linux安裝python3.7全過程

    linux安裝python3.7全過程

    本文介紹了在Linux系統(tǒng)上安裝Python3.7.2的具體步驟,包括使用wget下載安裝包、解壓安裝包、配置環(huán)境、編譯安裝、建立軟鏈接以及測試等內(nèi)容,詳細描述了每一步驟的操作方法和注意事項
    2026-05-05
  • python?kornia計算機視覺庫實現(xiàn)圖像變化

    python?kornia計算機視覺庫實現(xiàn)圖像變化

    這篇文章主要為大家介紹了python?kornia計算機視覺庫實現(xiàn)圖像變化算法示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2024-01-01
  • Selenium及python實現(xiàn)滾動操作多種方法

    Selenium及python實現(xiàn)滾動操作多種方法

    這篇文章主要介紹了Selenium及python實現(xiàn)滾動操作多種方法,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-07-07
  • Python用requests模塊實現(xiàn)動態(tài)網(wǎng)頁爬蟲

    Python用requests模塊實現(xiàn)動態(tài)網(wǎng)頁爬蟲

    大家好,本篇文章主要講的是Python用requests模塊實現(xiàn)動態(tài)網(wǎng)頁爬蟲,感興趣的同學趕快來看一看吧,對你有幫助的話記得收藏一下
    2022-02-02
  • 如何驗證python安裝成功

    如何驗證python安裝成功

    在本篇文章中小編給大家整理的是關(guān)于python安裝成功檢驗方法,需要的朋友們可以參考下。
    2020-07-07
  • 使用python生成楊輝三角形的示例代碼

    使用python生成楊輝三角形的示例代碼

    這篇文章主要介紹了使用python生成楊輝三角形的示例代碼,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-08-08
  • Python中實現(xiàn)3D模型動態(tài)加載的4種方法

    Python中實現(xiàn)3D模型動態(tài)加載的4種方法

    本文討論了Python中實現(xiàn)3D模型動態(tài)加載的方法,包括PyOpenGL、Panda3D和ModernGL等,詳細介紹了基于PyOpenGL的渲染管線和模型加載;利用VPython的場景構(gòu)建和對象管理;基于ModernGL的高效GPU加速方案;四種方法綜合對比與未來優(yōu)化方向等場景,需要的朋友可以參考下
    2026-04-04

最新評論

侯马市| 北京市| 沙田区| 武汉市| 磐石市| 金华市| 昂仁县| 揭东县| 岫岩| 临泉县| 板桥市| 毕节市| 上犹县| 图们市| 南投县| 福建省| 余干县| 时尚| 枝江市| 延庆县| 绩溪县| 会宁县| 阳春市| 蓬莱市| 淄博市| 小金县| 浑源县| 庆安县| 大丰市| 黄梅县| 仁寿县| 长武县| 扶绥县| 望都县| 南和县| 彩票| 巧家县| 夹江县| 甘谷县| 河西区| 永宁县|