最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

使用Python處理數(shù)據(jù)集的技巧分享

 更新時(shí)間:2024年12月27日 08:44:59   作者:engchina  
這篇文章會(huì)從加載數(shù)據(jù)開始,一步步教大家如何格式化數(shù)據(jù)、保存數(shù)據(jù),最后還會(huì)教大家如何加載處理后的數(shù)據(jù),感興趣的小伙伴可以跟隨小編一起學(xué)習(xí)一下

1. 導(dǎo)入需要的庫

首先,我們需要導(dǎo)入一些Python庫,這些庫會(huì)幫助我們處理數(shù)據(jù)。代碼如下:

import jsonlines
import itertools
import pandas as pd
from pprint import pprint

import datasets
from datasets import load_dataset

解釋:

jsonlines: 用來處理JSON Lines格式的文件。

itertools: 提供了一些高效的循環(huán)工具。

pandas: 用來處理表格數(shù)據(jù),比如Excel或CSV文件。

pprint: 用來美化打印數(shù)據(jù),讓數(shù)據(jù)看起來更整齊。

datasets: 一個(gè)專門用來加載和處理數(shù)據(jù)集的庫。

2. 加載預(yù)訓(xùn)練數(shù)據(jù)集

接下來,我們要加載一個(gè)預(yù)訓(xùn)練的數(shù)據(jù)集。這里我們使用 allenai/c4 數(shù)據(jù)集,它是一個(gè)英文文本數(shù)據(jù)集。

pretrained_dataset = load_dataset("allenai/c4", "en", split="train", streaming=True)

解釋:

load_dataset: 用來加載數(shù)據(jù)集。

"allenai/c4": 數(shù)據(jù)集的名稱。

"en": 表示我們只加載英文部分。

split="train": 表示我們只加載訓(xùn)練集。

streaming=True: 表示以流式方式加載數(shù)據(jù),適合處理大數(shù)據(jù)集。

3. 查看數(shù)據(jù)集的前5個(gè)樣本

我們可以用以下代碼查看數(shù)據(jù)集的前5個(gè)樣本:

n = 5
print("Pretrained dataset:")
top_n = itertools.islice(pretrained_dataset, n)
for i in top_n:
  print(i)

解釋:

n = 5: 表示我們要查看5個(gè)樣本。

itertools.islice: 用來從數(shù)據(jù)集中取出前5個(gè)樣本。

for i in top_n:: 遍歷這5個(gè)樣本并打印出來。

4. 加載公司微調(diào)數(shù)據(jù)集

假設(shè)我們有一個(gè)名為 lamini_docs.jsonl 的文件,里面存儲(chǔ)了一些問題和答案。我們可以用以下代碼加載這個(gè)文件:

filename = "lamini_docs.jsonl"
instruction_dataset_df = pd.read_json(filename, lines=True)
instruction_dataset_df

解釋:

pd.read_json: 用來讀取JSON Lines格式的文件,并將其轉(zhuǎn)換為表格形式(DataFrame)。

instruction_dataset_df: 打印表格內(nèi)容。

5. 格式化數(shù)據(jù)

我們可以把問題和答案拼接成一個(gè)字符串,方便后續(xù)處理:

examples = instruction_dataset_df.to_dict()
text = examples["question"][0] + examples["answer"][0]
text

解釋:

to_dict(): 把表格數(shù)據(jù)轉(zhuǎn)換成字典格式。

examples["question"][0]: 獲取第一個(gè)問題的內(nèi)容。

examples["answer"][0]: 獲取第一個(gè)答案的內(nèi)容。

text: 把問題和答案拼接成一個(gè)字符串。

6. 使用模板格式化數(shù)據(jù)

我們可以使用模板來格式化問題和答案,讓它們看起來更整齊:

prompt_template_qa = """### Question:
{question}

### Answer:
{answer}"""

question = examples["question"][0]
answer = examples["answer"][0]

text_with_prompt_template = prompt_template_qa.format(question=question, answer=answer)
text_with_prompt_template

解釋:

prompt_template_qa: 定義了一個(gè)模板,包含“Question”和“Answer”兩部分。

format: 把問題和答案插入到模板中。

7. 生成微調(diào)數(shù)據(jù)集

我們可以把所有的問答對(duì)都格式化,并保存到一個(gè)列表中:

num_examples = len(examples["question"])
finetuning_dataset_text_only = []
finetuning_dataset_question_answer = []
for i in range(num_examples):
  question = examples["question"][i]
  answer = examples["answer"][i]

  text_with_prompt_template_qa = prompt_template_qa.format(question=question, answer=answer)
  finetuning_dataset_text_only.append({"text": text_with_prompt_template_qa})

  text_with_prompt_template_q = prompt_template_q.format(question=question)
  finetuning_dataset_question_answer.append({"question": text_with_prompt_template_q, "answer": answer})

解釋:

num_examples: 獲取問題的數(shù)量。

finetuning_dataset_text_only: 存儲(chǔ)格式化后的文本。

finetuning_dataset_question_answer: 存儲(chǔ)格式化后的問題和答案。

8. 保存處理后的數(shù)據(jù)

我們可以把處理后的數(shù)據(jù)保存到一個(gè)新的文件中:

with jsonlines.open(f'lamini_docs_processed.jsonl', 'w') as writer:
    writer.write_all(finetuning_dataset_question_answer)

解釋:

jsonlines.open: 打開一個(gè)文件,準(zhǔn)備寫入數(shù)據(jù)。

writer.write_all: 把所有的數(shù)據(jù)寫入文件。

9. 加載處理后的數(shù)據(jù)

最后,我們可以加載剛剛保存的數(shù)據(jù)集:

finetuning_dataset_name = "lamini/lamini_docs"
finetuning_dataset = load_dataset(finetuning_dataset_name)
print(finetuning_dataset)

解釋:

load_dataset: 加載指定名稱的數(shù)據(jù)集。

print(finetuning_dataset): 打印加載的數(shù)據(jù)集。

總結(jié)

通過這篇文章,我們學(xué)習(xí)了如何用Python加載、處理和保存數(shù)據(jù)集。我們從簡單的數(shù)據(jù)加載開始,逐步學(xué)習(xí)了如何格式化數(shù)據(jù)、保存數(shù)據(jù),最后還學(xué)會(huì)了如何加載處理后的數(shù)據(jù)。

到此這篇關(guān)于使用Python處理數(shù)據(jù)集的技巧分享的文章就介紹到這了,更多相關(guān)Python處理數(shù)據(jù)集內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python文本進(jìn)度條實(shí)例

    python文本進(jìn)度條實(shí)例

    這篇文章主要為大家介紹了python文本進(jìn)度條,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2021-12-12
  • 利用Python+requests批量檢測(cè)網(wǎng)站是否可訪問的實(shí)戰(zhàn)指南

    利用Python+requests批量檢測(cè)網(wǎng)站是否可訪問的實(shí)戰(zhàn)指南

    在日常開發(fā)、運(yùn)維、測(cè)試和數(shù)據(jù)采集中,我們經(jīng)常需要判斷一批網(wǎng)站或接口是否能夠正常訪問,如果一個(gè)一個(gè)用瀏覽器打開,不僅效率低,而且很難記錄結(jié)果,使用 Python 的 requests 庫,就可以把這個(gè)過程自動(dòng)化,本文會(huì)用一個(gè)完整案例演示,需要的朋友可以參考下
    2026-05-05
  • Ruby使用eventmachine為HTTP服務(wù)器添加文件下載功能

    Ruby使用eventmachine為HTTP服務(wù)器添加文件下載功能

    這篇文章主要介紹了Ruby使用eventmachine為HTTP服務(wù)器添加文件下載功能的實(shí)例,同時(shí)作者也分享了Windows上eventmachine安裝報(bào)錯(cuò)問題的解決方法,需要的朋友可以參考下
    2016-04-04
  • 6種將Python代碼打包成exe應(yīng)用的方式

    6種將Python代碼打包成exe應(yīng)用的方式

    這篇文章主要給大家介紹了關(guān)于6種將Python代碼打包成exe應(yīng)用的方式,對(duì)于很多python的初學(xué)者來說,很希望將自己用python寫的.py文件生成exe直接在電腦上運(yùn)行,需要的朋友可以參考下
    2023-08-08
  • Python實(shí)現(xiàn)DDos攻擊實(shí)例詳解

    Python實(shí)現(xiàn)DDos攻擊實(shí)例詳解

    這篇文章主要給大家介紹了關(guān)于Python實(shí)現(xiàn)DDos攻擊的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-02-02
  • python opencv 找出圖像中的最大輪廓并填充(生成mask)

    python opencv 找出圖像中的最大輪廓并填充(生成mask)

    這篇文章主要介紹了python opencv 找出圖像中的最大輪廓并填充(生成mask),文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-03-03
  • python接口自動(dòng)化之正則用例參數(shù)化的示例詳解

    python接口自動(dòng)化之正則用例參數(shù)化的示例詳解

    這篇文章主要介紹了python接口自動(dòng)化之正則用例參數(shù)化,它是一個(gè)特殊的字符序列,它能幫助你方便的檢查一個(gè)字符串是否與某種模式匹配,本文給大家介紹的非常詳細(xì),需要的朋友可以參考下
    2022-07-07
  • Python中的單行、多行、中文注釋方法

    Python中的單行、多行、中文注釋方法

    今天小編就為大家分享一篇Python中的單行、多行、中文注釋方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-07-07
  • 詳解Python如何實(shí)現(xiàn)尾遞歸優(yōu)化

    詳解Python如何實(shí)現(xiàn)尾遞歸優(yōu)化

    尾遞歸是函數(shù)返回最后一個(gè)操作是遞歸調(diào)用,則該函數(shù)是尾遞歸。本文將介紹Python是如何實(shí)現(xiàn)尾遞歸優(yōu)化的,感興趣的小伙伴可以跟隨小編一起學(xué)習(xí)一下
    2022-05-05
  • python判斷是否漢字的5種方法實(shí)例

    python判斷是否漢字的5種方法實(shí)例

    這篇文章主要給大家介紹了關(guān)于python判斷是否漢字的5種方法,文中通過實(shí)例代碼將判斷的幾種方法介紹的非常詳細(xì),對(duì)大家學(xué)習(xí)或者使用python具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2023-06-06

最新評(píng)論

长阳| 敦煌市| 北海市| 明溪县| 乡城县| 静宁县| 新余市| 和静县| 宁蒗| 文安县| 通化县| 青冈县| 龙井市| 凌云县| 乳山市| 泗洪县| 郯城县| 陈巴尔虎旗| 哈尔滨市| 城步| 南部县| 濮阳市| 苏尼特右旗| 军事| 靖州| 苍溪县| 三门县| 聊城市| 庄河市| 高碑店市| 繁昌县| 水城县| 固阳县| 永福县| 枣强县| 彭阳县| 亳州市| 东乡族自治县| 芜湖县| 和龙市| 镇宁|