Python中re模塊結(jié)合正則表達(dá)式的實(shí)際應(yīng)用案例
前言
在 Python 中,re 模塊是用于處理正則表達(dá)式的標(biāo)準(zhǔn)庫。它非常適合用于文本清洗、提取和整理任務(wù)。下面是一些常見的使用 re 包結(jié)合正則表達(dá)式進(jìn)行文本清洗的方法示例。
re模塊常用函數(shù)
| 函數(shù) | 功能 |
|---|---|
| re.match() | 從字符串開頭開始匹配 |
| re.search() | 在整個(gè)字符串中查找第一個(gè)匹配項(xiàng) |
| re.findall() | 找出所有匹配的內(nèi)容,返回列表 |
| re.sub() | 替換匹配內(nèi)容 |
| re.split() | 根據(jù)正則表達(dá)式分割字符串 |
一、查看文本中是否包含 A 或 B 字符串
import re
text = "這是一個(gè)測試字符串,包含apple和banana。"
# 查看是否包含 'apple' 或 'banana'
if re.search(r'apple|banana', text):
print("包含 apple 或 banana")
else:
print("不包含")
說明:
r'apple|banana' 是一個(gè)正則表達(dá)式,表示匹配 “apple” 或者 “banana”
re.search():只要在字符串中有匹配項(xiàng)就返回 True(或匹配對(duì)象)二、替換多個(gè)關(guān)鍵詞為統(tǒng)一格式
text = "訪問網(wǎng)址 www.google.com 或 http://www.baidu.com 獲取信息" cleaned_text = re.sub(r'www\.|http://', '', text) print(cleaned_text) # 輸出: 訪問網(wǎng)址 google.com 或 baidu.com 獲取信息
三、提取所有數(shù)字
text = "電話號(hào)碼是1234567890,郵編是100000" numbers = re.findall(r'\d+', text) print(numbers) # 輸出: ['1234567890', '100000']
四、去除標(biāo)點(diǎn)符號(hào)
import string
text = "你好!這是一段,含有很多標(biāo)點(diǎn)?"
pattern = f"[{re.escape(string.punctuation)}]"
cleaned_text = re.sub(pattern, "", text)
print(cleaned_text)
# 輸出: 你好這是一段含有很多標(biāo)點(diǎn)五、提取中文字符
text = "Hello 你好,世界123"
chinese_chars = re.findall(r'[\u4e00-\u9fa5]+', text)
print(''.join(chinese_chars))
# 輸出: 你好世界六、刪除空白字符(空格、換行、制表符等)
text = " 這是一個(gè)\t帶有很多\n空白的文本 " cleaned_text = re.sub(r'\s+', ' ', text).strip() print(cleaned_text) # 輸出: 這是一個(gè) 帶有很多 空白的文本
七、提取郵箱地址
深色版本 text = "聯(lián)系我 at example@example.com 或 support@domain.co.cn" emails = re.findall(r'[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+\.[a-zA-Z0-9-.]+', text) print(emails) # 輸出: ['example@example.com', 'support@domain.co.cn']
八、提取 URL 地址
text = "訪問 https://example.com 或 http://www.google.com" urls = re.findall(r'https?://(?:www\.)?\S+', text) print(urls) # 輸出: ['https://example.com', 'http://www.google.com']
九、保留字母、數(shù)字、中文,刪除其他字符
text = "這!is a 123_測試-text..." cleaned_text = re.sub(r'[^\u4e00-\u9fa5a-zA-Z0-9]', '', text) print(cleaned_text) # 輸出: 這is a 123測試text
十、分詞前預(yù)處理(小寫 + 去除特殊字符)
text = "Hello World! 你好,World!" cleaned_text = re.sub(r'[^\w\s]|_', '', text).lower() print(cleaned_text) # 輸出: hello world 你好world
十一、提取手機(jī)號(hào)碼方法(11位數(shù)字)
1.提前手機(jī)號(hào)碼
示例目標(biāo): 將如 13812345678 格式手機(jī)號(hào)提取出來,并格式化為 138-1234-5678。
實(shí)現(xiàn)代碼:
import re
text = "我的電話是13812345678,請(qǐng)?jiān)诠ぷ鲿r(shí)間撥打。另一個(gè)號(hào)碼是13987654321"
# 提取所有11位手機(jī)號(hào)
phone_numbers = re.findall(r'1\d{10}', text)
# 格式化為 138-1234-5678 樣式
formatted_numbers = [re.sub(r'(\d{3})(\d{4})(\d{4})', r'\1-\2-\3', num) for num in phone_numbers]
print(formatted_numbers)
# 輸出: ['138-1234-5678', '139-8765-4321']2.從包含干擾字符的字符串中提取手機(jī)號(hào)并清理
有時(shí)候手機(jī)號(hào)中可能夾雜著空格、短橫線等字符,比如 "138 1234 5678" 或 "139-1234-5678"。 示例代碼:
text = "聯(lián)系方式:138 1234 5678 或 139-1234-5678"
# 去除非數(shù)字字符后提取11位手機(jī)號(hào)
cleaned_numbers = re.findall(r'1\d{10}', re.sub(r'\D', '', text))
# 再格式化輸出
formatted_numbers = [re.sub(r'(\d{3})(\d{4})(\d{4})', r'\1-\2-\3', num) for num in cleaned_numbers]
print(formatted_numbers)
# 輸出: ['138-1234-5678', '139-1234-5678']4.添加國家區(qū)號(hào)并統(tǒng)一格式
如果你需要加上國家區(qū)號(hào) +86:
formatted_with_code = ['+86 ' + num for num in formatted_numbers] print(formatted_with_code) # 輸出: ['+86 138-1234-5678', '+86 139-1234-5678']
5.封裝成函數(shù)
def format_chinese_phone(text):
# 清理非數(shù)字內(nèi)容
cleaned = re.sub(r'\D', '', text)
# 提取手機(jī)號(hào)
phones = re.findall(r'1\d{10}', cleaned)
# 格式化
return [re.sub(r'(\d{3})(\d{4})(\d{4})', r'\1-\2-\3', p) for p in phones]
# 使用示例
text = "我的聯(lián)系電話是:138 1234 5678 和 139-8765-4321"
print(format_chinese_phone(text))
# 輸出: ['138-1234-5678', '139-8765-4321']6.正則說明
| 正則表達(dá)式 | 含義 |
|---|---|
| \d | 匹配任意數(shù)字 |
| \D | 匹配非數(shù)字 |
| {n} | 精確匹配 n 次 |
| r'(\d{3})(\d{4})(\d{4})' | 分組提取前3位、中間4位、后4位 |
| \1-\2-\3 | 替換為帶連字符的格式 |
總結(jié)
到此這篇關(guān)于Python中re模塊結(jié)合正則表達(dá)式實(shí)際應(yīng)用案例的文章就介紹到這了,更多相關(guān)Python re模塊正則表達(dá)式內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python實(shí)現(xiàn)隊(duì)列的方法示例小結(jié)【數(shù)組,鏈表】
這篇文章主要介紹了Python實(shí)現(xiàn)隊(duì)列的方法,結(jié)合實(shí)例形式分析了Python基于數(shù)組和鏈表實(shí)現(xiàn)隊(duì)列的相關(guān)操作技巧與相關(guān)注意事項(xiàng),需要的朋友可以參考下2020-02-02
PyCharm使用之配置SSH Interpreter的方法步驟
這篇文章主要介紹了PyCharm使用之配置SSH Interpreter的方法步驟,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2019-12-12
利用Python實(shí)現(xiàn)K-Means聚類的方法實(shí)例(案例:用戶分類)
k-means是發(fā)現(xiàn)給定數(shù)據(jù)集的k個(gè)簇的算法,也就是將數(shù)據(jù)集聚合為k類的算法,下面這篇文章主要給大家介紹了關(guān)于利用Python實(shí)現(xiàn)K-Means聚類的相關(guān)資料,需要的朋友可以參考下2022-05-05
Python DataFrame實(shí)現(xiàn)固定周期內(nèi)統(tǒng)計(jì)每列的非零值
在數(shù)據(jù)處理中,使用DataFrame統(tǒng)計(jì)固定周期內(nèi)每列的非零值數(shù)量是一種常見需求,通過將數(shù)據(jù)分組并使用計(jì)數(shù)函數(shù),可以方便地實(shí)現(xiàn)此目標(biāo),具體方法包括首先計(jì)算每列的0值個(gè)數(shù),然后通過總數(shù)減去0值個(gè)數(shù)得到非零值的數(shù)量2024-09-09
python-opencv獲取二值圖像輪廓及中心點(diǎn)坐標(biāo)的代碼
今天小編就為大家分享一篇python-opencv獲取二值圖像輪廓及中心點(diǎn)坐標(biāo)的代碼,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2019-08-08
python基礎(chǔ)之Numpy庫中array用法總結(jié)
NumPy(Numerical Python的縮寫)是一個(gè)開源的Python科學(xué)計(jì)算庫,使用NumPy就可以很自然地使用數(shù)組和矩陣,這篇文章主要給大家介紹了關(guān)于python基礎(chǔ)之Numpy庫中array用法的相關(guān)資料,需要的朋友可以參考下2021-08-08
Python實(shí)現(xiàn)讀取txt文件并畫三維圖簡單代碼示例
這篇文章主要介紹了Python實(shí)現(xiàn)讀取txt文件并畫三維圖簡單代碼示例,具有一定借鑒價(jià)值,需要的朋友可以參考下。2017-12-12
快速進(jìn)修Python指南之網(wǎng)絡(luò)編程及并發(fā)編程
這篇文章主要為大家介紹了Java開發(fā)者如何快速進(jìn)修Python指南之網(wǎng)絡(luò)編程及并發(fā)編程實(shí)例解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-12-12
python實(shí)現(xiàn)excel讀寫數(shù)據(jù)
這篇文章主要為大家詳細(xì)介紹了python操作EXCEL讀數(shù)據(jù)、寫數(shù)據(jù)的實(shí)例源碼,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2018-04-04

