最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Windows11下Ollama部署Qwen2.5大模型的實戰(zhàn)指南

  發(fā)布時間:2026-03-18 15:30:10   作者:程序員七平   我要評論
本文旨在記錄 如何在Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實現(xiàn) API 調(diào)用,無需顯卡也能跑”、能夠確保隱私安全,有需要的小伙伴可以跟隨小編一起了解一下

0、前言

本文旨在記錄 Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實現(xiàn) API 調(diào)用。無需顯卡也能跑”、能夠確保“隱私安全”。

可以在在安裝和部署中了解與學(xué)習(xí)以下內(nèi)容:

  • Ollama 的作用和安裝使用;
  • Modelfile 的作用和配置;
  • ModelScope 的作用;
  • Notebook 的作用;
  • 上述內(nèi)容怎樣結(jié)合使用實現(xiàn)部署大模型,部署成功后怎樣通過API訪問。

1、環(huán)境與準備

  • Win11:Windows 11 專業(yè)版25H2
  • CPU:Intel(R) Core(TM) i7-8750H CPU @ 2.20GHz (2.21 GHz)
  • 內(nèi)存:16.0 GB
  • 顯卡:GTX1050Ti(很雞肋,筆者在實踐過程中,暫時沒用到顯卡)
  • Ollama: 0.17.7
  • 大模型
    • qwen2.5-3b-instruct-q4_k_m
    • qwen2.5-7b-instruct-q4_k_m

前置依賴檢查

  • PowerShell (Win11 自帶)
  • Git (可選,用于下載)
  • Python (僅用于 ModelScope CLI,若只用瀏覽器下載可不裝)

2、核心概念速覽

2.1、模型文件名qwen2.5-3b-instruct-q4_k_m.gguf的含義?

文件名通常長這樣:qwen2.5-3b-instruct-q4_k_m.gguf。

instruct 表示這是經(jīng)過指令微調(diào)的版本,適合對話;如果是 base 版本,則適合做續(xù)寫或二次微調(diào),不適合直接對話。

1) q + 數(shù)字:代表每個參數(shù)用多少 bit 存儲。

  • 數(shù)字越小 = 文件越小 = 速度越快 = 稍微變笨一點。
  • 數(shù)字越大 = 文件越大 = 速度越慢 = 越聰明。
  • 黃金標準:目前業(yè)界公認 4-bit (q4) 是性價比最高的,智商損失微乎其微,但體積減半。

2)k:代表使用了 K-quants 量化技術(shù)(一種更先進的壓縮算法,比老式的 q4_0 更聰明)。

3)m / s / l:代表 Small (小), Medium (中), Large (大)。

  • q4_k_s:更小一點,稍微笨一點點。
  • q4_k_m標準版,平衡最好(首選)。
  • q4_k_l:更大一點,稍微聰明一點點(但顯存占用也高)。

2.2、Modelfile 的基本結(jié)構(gòu)及含義

FROM <model>
SYSTEM <system_prompt>
PARAMETER <name> <value>
TEMPLATE <template>
ADAPTER <path>
PROJECTOR <path>
MESSAGE <role> <content>
LICENSE <text>

含義解釋:

FROM <model>: 指定基礎(chǔ)模型(必選)。
SYSTEM <system_prompt>: 設(shè)置系統(tǒng)提示詞(定義人設(shè))。
PARAMETER <name> <value>: 設(shè)置推理參數(shù)(如溫度、上下文長度)。
TEMPLATE <template>: 定義對話模板格式。
ADAPTER <path>: 加載 LoRA 適配器文件(用于微調(diào)模型)。
PROJECTOR <path>: 加載多模態(tài)投影器(用于讓模型看懂圖片)。
MESSAGE <role> <content>: 預(yù)設(shè)對話示例(Few-shot prompting)。
LICENSE <text>: 聲明模型的許可證信息。

一般用到的是:

FROM llama3              # 1. 選基座
SYSTEM "你是個詩人"       # 2. 定人設(shè)
PARAMETER temperature 0.8 # 3. 調(diào)參數(shù)

2.3、Notebook是什么

雖然本文主要講本地部署,但如果本地資源不足(如顯存不夠),可以使用 ModelScope Notebook 在云端免費體驗大模型,無需本地硬件。

ModelScope Notebook 是一款云端機器學(xué)習(xí)開發(fā)IDE工具,提供交互式編程環(huán)境,為用戶提供了開箱可用的限時免費算力額度,實現(xiàn)ModelScope模型開發(fā)環(huán)境與CPU/GPU等多樣化計算資源的無縫連接。

2.4、運行大模型的通俗理解

把運行大模型想象成“搬家”。

  • 量化等級(Quantization)= 家具的打包壓縮程度
  • 推理框架 = 運輸工具的選擇
  • 上下文長度(Context Length)= 這次要搬多少東西(記憶量)

3、實戰(zhàn)部署:安裝與運行

3.1、安裝 Ollama

Ollama 是一個開源的、專為本地運行大型語言模型(LLM)設(shè)計的工具平臺,就像是“大模型的 Docker”。

官網(wǎng)下載后安裝:

# 查看版本號
ollama -v
ollama version is 0.17.7

3.2、方式一:一鍵拉?。ü俜酵扑]),Ollama界面/命令行拉取

通過Ollama拉去的鏡像不用創(chuàng)建下面的Modelfile。

# 下載并運行模型
ollama run qwen2.5:3b

3.3、方式二:自定義導(dǎo)入 (進階),下載gguf文件自行配置

1)從ModelScope下載gguf文件

通過modelscope來進行瀏覽器下載模型,用Qwen2.5-3B-Instruct-GGUF演示(實際上我部署的就是這個)。

進入模型文件頁,找到類似 qwen2.5-3b-instruct-q4_k_m.gguf 的文件,下載該文件。

2)編寫Modelfile文件

ModelfileOllama用來實現(xiàn)大模型推理的自定義參數(shù)文件,類似于Dockerfile

如果你只是簡單對話,Ollama 官方庫里的默認模板通常已經(jīng)適配好了 Qwen 系列,手動指定 TEMPLATE 僅在需要特殊對話格式或微調(diào)時才必要。具體可以見文末【4.3、Modelfile 的基本結(jié)構(gòu)及含義】

新建文件,命名為Modelfile,內(nèi)容如下:

FROM "G:\AI\Modelfiles\qwen2.5-3b\qwen2.5-3b-instruct-q4_k_m.gguf"

TEMPLATE """{{- if .Messages }}
{{- range $i, $_ := .Messages }}
{{- $last := eq (len (slice $.Messages $i)) 1 }}
{{- if eq .Role "user" }}<|im_start|>user
{{ .Content }}<|im_end|>
{{ else if eq .Role "assistant" }}<|im_start|>assistant
{{ .Content }}<|im_end|>
{{ else if eq .Role "system" }}<|im_start|>system
{{ .Content }}<|im_end|>
{{ end }}
{{- if $last }}<|im_start|>assistant
{{ end }}
{{- end }}
{{- else }}
{{- if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
{{ end }}"""

PARAMETER stop <|im_end|>
PARAMETER stop <|im_start|>

PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
PARAMETER repeat_penalty 1.05

LICENSE """https://huggingface.co/Qwen/Qwen2.5-3B-Instruct/blob/main/LICENSE"""

最簡單版(自問自答幾乎沒法用)

FROM "F:\\Downloads\qwen2.5-3b-instruct-q4_k_m.gguf"

3)創(chuàng)建模型

打開Powershell,找到剛才的Modelfile文件的路徑,執(zhí)行以下命令:

# 把 GGUF 文件打包成 Ollama 模型
ollama create qwen2.5:3b -f Modelfile
# 或者用絕對路徑
ollama create qwen2.5:3b -f G:\AI\Modelfiles\qwen2.5-3b\Modelfile

4)運行模型

Ollama 默認會自動檢測并使用GPU。Ollama 為了優(yōu)化資源,默認會在 5 分鐘 無活動后卸載模型;當再次發(fā)起請求時,如果模型已卸載,Ollama 會重新加載該模型到顯存/內(nèi)存中,然后處理請求。這會導(dǎo)致首次請求有額外的延遲(加載時間)。

ollama run qwen2.5:3b

查看大模型狀態(tài):

  • SIZE: 占用內(nèi)存大小
  • PROCESSOR100% CPU: 表示模型完全在中央處理器上運行,沒有使用顯卡(GPU)加速。我的顯卡的顯存只有4GB。
  • CONTEXT:上下文窗口大小。當前會話保留的“記憶”長度(Token 數(shù)量)。這個數(shù)字越大,占用的內(nèi)存也越大。
  • UNTIL (自動卸載倒計時):表示如果接下來沒有任何人使用該模型,Ollama 將在 2 分鐘后 自動把它從內(nèi)存中卸載,以釋放資源。

5)示例:Qwen2.5-7B的配置

文件名:qwen2.5-7b-instruct-q4_k_m.gguf

FROM ./qwen2.5-7b-instruct-q4_k_m.gguf
TEMPLATE """{{- if .System }}
<|im_start|>system
{{ .System }}<|im_end|>
{{- end }}
<|im_start|>user
{{ .Prompt }}<|im_end|>
<|im_start|>assistant
"""
PARAMETER stop <|im_end|>
PARAMETER stop <|im_start|>
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
SYSTEM "你是一個有幫助的AI助手。"

4、通過API訪問大模型

4.1、啟動服務(wù)

# 運行命令查看端口
ollama serve
# 返回信息:Error: listen tcp 127.0.0.1:11434: bind: Only one usage of each socket address (protocol/network address/port) is normally permitted.

默認 Ollama 只接受本機連接,拒絕局域網(wǎng) IP(192.168.x.x),需要讓 Ollama 暴露在網(wǎng)絡(luò)上,Windows環(huán)境下按照下圖配置即可。

4.2、Powershell中測試接口

# Windows Powershell
curl http://192.168.2.111:11434/api/generate -d "{\"model\": \"qwen2.5:3b\", \"prompt\": \"hello\"}"
curl http://192.168.31.87:11434/api/tags

4.3、后臺方式運行技巧

Start-Process ollama -ArgumentList "run","qwen2.5:3b" -WindowStyle Hidden

5、常用命令速查表

Ollama相關(guān)文檔

# 查看幫助
ollama -h
# 查看本地已下載的模型
ollama list
# 下載并運行模型
ollama run qwen2.5:3b
# ollama run <模型名> <提示詞>,單次問答
ollama run qwen2.5:3b "你好,請介紹一下你自己"
# 刪除模型
ollama rm <模型名>
# 啟動后臺服務(wù)
ollama serve
# 查看模型詳情
ollama show <模型名>
# 查看正在運行的模型
ollama ps
ollama stop qwen2.5:3b

6、附錄與參考資料

ModelScope Pip 安裝詳解

# 安裝python
python -V
Python 3.11.9
# 安裝魔搭
pip install modelscope
# 下載完整模型庫
modelscope download --model Qwen/Qwen2.5-3B-Instruct-GGUF
# 下載單個文件到指定本地文件夾(以下載README.md到當前路徑下“dir”目錄為例)
modelscope download --model Qwen/Qwen2.5-3B-Instruct-GGUF README.md --local_dir ./dir

以上就是Windows11下Ollama部署Qwen2.5大模型的實戰(zhàn)指南的詳細內(nèi)容,更多關(guān)于Ollama部署Qwen2.5的資料請關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

最新評論

宜兰县| 宁陕县| 将乐县| 安平县| 临城县| 平谷区| 南丰县| 灵武市| 龙泉市| 永福县| 岗巴县| 通城县| 孝感市| 晋江市| 河东区| 北宁市| 合川市| 泗水县| 宁晋县| 青阳县| 盘锦市| 兴安县| 呈贡县| 隆林| 古丈县| 栾城县| 南丰县| 苏尼特左旗| 盘山县| 宜阳县| 建昌县| 嘉黎县| 永善县| 西昌市| 吉安市| 沅陵县| 洪洞县| 郯城县| 霍山县| 库尔勒市| 广德县|