Python如何將大TXT文件分割成4KB小文件
處理大文本文件是程序員經(jīng)常遇到的挑戰(zhàn)。特別是當(dāng)我們需要把一個(gè)幾百M(fèi)B甚至幾個(gè)GB的TXT文件分割成小塊時(shí),手動(dòng)操作顯然不現(xiàn)實(shí)。今天我們就來(lái)聊聊如何用Python自動(dòng)完成這個(gè)任務(wù),特別是如何精確控制每個(gè)分割文件的大小為4KB。
為什么需要分割TXT文件
在實(shí)際開發(fā)中,我們可能會(huì)遇到這些情況:
- 某些老舊系統(tǒng)只能處理小體積文本文件
- 需要將日志文件分割后上傳到云存儲(chǔ)
- 進(jìn)行分布式處理時(shí)需要將數(shù)據(jù)分片
- 調(diào)試時(shí)需要用小文件快速測(cè)試
4KB是個(gè)很常用的分割尺寸,因?yàn)樗檬呛芏嘞到y(tǒng)默認(rèn)的內(nèi)存頁(yè)大小,處理起來(lái)效率很高。那么問(wèn)題來(lái)了:怎么用Python實(shí)現(xiàn)這個(gè)需求呢?
基礎(chǔ)版:按行分割
我們先來(lái)看一個(gè)最簡(jiǎn)單的實(shí)現(xiàn)方式:
def split_by_line(input_file, output_prefix, chunk_size=4000):
with open(input_file, 'r', encoding='utf-8') as f:
file_count = 1
current_size = 0
output_file = None
for line in f:
line_size = len(line.encode('utf-8'))
if current_size + line_size > chunk_size:
if output_file:
output_file.close()
output_file = open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8')
file_count += 1
current_size = 0
if not output_file:
output_file = open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8')
file_count += 1
output_file.write(line)
current_size += line_size
if output_file:
output_file.close()
這個(gè)腳本可以按行分割文件,盡量保證每個(gè)文件不超過(guò)指定大小。但是有個(gè)問(wèn)題:它不能精確控制文件大小正好是4KB,特別是當(dāng)某一行特別長(zhǎng)時(shí),單個(gè)文件可能會(huì)超過(guò)限制。
進(jìn)階版:精確控制文件大小
要實(shí)現(xiàn)更精確的控制,我們需要按字節(jié)而不是按行來(lái)處理:
def split_by_size(input_file, output_prefix, chunk_size=4096):
with open(input_file, 'rb') as f:
file_count = 1
while True:
chunk = f.read(chunk_size)
if not chunk:
break
with open(f"{output_prefix}_{file_count}.txt", 'wb') as out_file:
out_file.write(chunk)
file_count += 1
注意! 這里我們用二進(jìn)制模式(‘rb’)打開文件,這樣可以精確控制讀取的字節(jié)數(shù)。但是這樣可能會(huì)在UTF-8編碼的中文文件中出現(xiàn)亂碼,因?yàn)橐粋€(gè)中文字符可能被從中間截?cái)唷?/p>
完美解決方案:支持UTF-8編碼
為了解決中文亂碼問(wèn)題,我們需要更智能的處理方式:
def split_utf8_safely(input_file, output_prefix, chunk_size=4096):
buffer = ""
file_count = 1
current_size = 0
with open(input_file, 'r', encoding='utf-8') as f:
while True:
char = f.read(1)
if not char:
if buffer:
with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
out_file.write(buffer)
break
char_size = len(char.encode('utf-8'))
if current_size + char_size > chunk_size:
with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
out_file.write(buffer)
file_count += 1
buffer = ""
current_size = 0
buffer += char
current_size += char_size
這個(gè)方法逐個(gè)字符讀取文件,確保不會(huì)截?cái)喽嘧止?jié)字符。雖然速度會(huì)慢一些,但能保證分割后的文件都能正常顯示中文內(nèi)容。
性能優(yōu)化:使用緩沖區(qū)
處理大文件時(shí),逐個(gè)字符讀取效率太低。我們可以用緩沖區(qū)來(lái)提升性能:
def split_with_buffer(input_file, output_prefix, chunk_size=4096, buffer_size=1024):
buffer = ""
file_count = 1
current_size = 0
with open(input_file, 'r', encoding='utf-8') as f:
while True:
chunk = f.read(buffer_size)
if not chunk:
if buffer:
with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
out_file.write(buffer)
break
buffer += chunk
while len(buffer.encode('utf-8')) >= chunk_size:
# 找到不超過(guò)chunk_size的最大子串
split_pos = 0
for i in range(1, len(buffer)+1):
if len(buffer[:i].encode('utf-8')) <= chunk_size:
split_pos = i
else:
break
with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
out_file.write(buffer[:split_pos])
file_count += 1
buffer = buffer[split_pos:]
current_size = 0
處理特殊情況
實(shí)際應(yīng)用中我們還需要考慮一些特殊情況:
- 文件頭處理:如果需要保留原文件的頭信息到每個(gè)分割文件
- 行完整性:某些場(chǎng)景下需要保持行的完整性
- 內(nèi)存限制:處理超大文件時(shí)的內(nèi)存優(yōu)化
- 進(jìn)度顯示:添加進(jìn)度條讓長(zhǎng)時(shí)間運(yùn)行的任務(wù)更友好
這里給出一個(gè)保留文件頭的實(shí)現(xiàn)示例:
def split_with_header(input_file, output_prefix, chunk_size=4096, header_lines=1):
# 先讀取文件頭
with open(input_file, 'r', encoding='utf-8') as f:
header = [next(f) for _ in range(header_lines)]
buffer = ""
file_count = 1
current_size = len(''.join(header).encode('utf-8'))
with open(input_file, 'r', encoding='utf-8') as f:
# 跳過(guò)已經(jīng)讀取的文件頭
for _ in range(header_lines):
next(f)
while True:
char = f.read(1)
if not char:
if buffer:
with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
out_file.writelines(header)
out_file.write(buffer)
break
char_size = len(char.encode('utf-8'))
if current_size + char_size > chunk_size:
with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
out_file.writelines(header)
out_file.write(buffer)
file_count += 1
buffer = ""
current_size = len(''.join(header).encode('utf-8'))
buffer += char
current_size += char_size
總結(jié)
我們介紹了多種Python分割TXT文件的方法:
簡(jiǎn)單的按行分割適合行結(jié)構(gòu)明顯的文件
按字節(jié)分割效率最高但不支持UTF-8
帶UTF-8支持的版本適合中文文本
緩沖區(qū)的版本在性能和準(zhǔn)確性之間取得平衡
特殊需求如保留文件頭需要額外處理
記??! 選擇哪種方法取決于你的具體需求。如果是處理GB級(jí)別的大文件,建議使用緩沖區(qū)方案并考慮內(nèi)存映射等高級(jí)技術(shù)。希望這篇指南能幫你解決文件分割的問(wèn)題!
到此這篇關(guān)于Python如何將大TXT文件分割成4KB小文件的文章就介紹到這了,更多相關(guān)Python大文件分割內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
python 數(shù)據(jù)庫(kù)查詢返回list或tuple實(shí)例
這篇文章主要介紹了python 數(shù)據(jù)庫(kù)查詢返回list或tuple實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2020-05-05
python?Helium自動(dòng)化庫(kù)的功能特性探索
這篇文章主要為大家介紹了python?Helium自動(dòng)化庫(kù)的功能特性探索,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2024-02-02
在Python的Django框架中編寫錯(cuò)誤提示頁(yè)面
這篇文章主要介紹了在Python的Django框架中編寫錯(cuò)誤提示頁(yè)面,包括傳統(tǒng)的404頁(yè)面和設(shè)置連接中斷警告等,需要的朋友可以參考下2015-07-07
Python?UserWarning:?Glyph?missing?from?font(s)?DejaVu?
這篇文章主要介紹了Python?UserWarning:?Glyph?missing?from?font(s)?DejaVu?Sans警告及解決方法,文中通過(guò)代碼介紹的非常詳細(xì),需要的朋友可以參考下2026-01-01
python實(shí)現(xiàn)三種隨機(jī)請(qǐng)求頭方式
這篇文章主要介紹了python實(shí)現(xiàn)三種隨機(jī)請(qǐng)求頭方式,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2021-01-01
基于Pyinstaller打包Python程序并壓縮文件大小
這篇文章主要介紹了基于Pyinstaller打包Python程序并壓縮文件大小,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-05-05
Python動(dòng)態(tài)規(guī)劃實(shí)現(xiàn)虛擬機(jī)部署的算法思想
這篇文章主要介紹了Python動(dòng)態(tài)規(guī)劃實(shí)現(xiàn)虛擬機(jī)部署的算法思想,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2021-07-07
使用Python自制GUI版時(shí)間戳轉(zhuǎn)換器
在日常開發(fā)工作中,我們經(jīng)常需要處理時(shí)間戳的轉(zhuǎn)換問(wèn)題,本文將和大家分享一個(gè)使用Python和Tkinter開發(fā)的時(shí)間戳轉(zhuǎn)換器GUI應(yīng)用,有需要的可以了解下2025-08-08

