Windows11下Ollama部署Qwen2.5大模型的實戰(zhàn)指南
0、前言
本文旨在記錄 Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實現(xiàn) API 調(diào)用。無需顯卡也能跑”、能夠確保“隱私安全”。
可以在在安裝和部署中了解與學(xué)習(xí)以下內(nèi)容:
Ollama的作用和安裝使用;Modelfile的作用和配置;ModelScope的作用;Notebook的作用;- 上述內(nèi)容怎樣結(jié)合使用實現(xiàn)部署大模型,部署成功后怎樣通過API訪問。
1、環(huán)境與準備
- Win11:Windows 11 專業(yè)版25H2
- CPU:Intel(R) Core(TM) i7-8750H CPU @ 2.20GHz (2.21 GHz)
- 內(nèi)存:16.0 GB
- 顯卡:GTX1050Ti(很雞肋,筆者在實踐過程中,暫時沒用到顯卡)
- Ollama: 0.17.7
- 大模型:
- qwen2.5-3b-instruct-q4_k_m
- qwen2.5-7b-instruct-q4_k_m
前置依賴檢查
PowerShell(Win11 自帶)Git(可選,用于下載)Python(僅用于ModelScope CLI,若只用瀏覽器下載可不裝)
2、核心概念速覽
2.1、模型文件名qwen2.5-3b-instruct-q4_k_m.gguf的含義?
文件名通常長這樣:qwen2.5-3b-instruct-q4_k_m.gguf。
instruct 表示這是經(jīng)過指令微調(diào)的版本,適合對話;如果是 base 版本,則適合做續(xù)寫或二次微調(diào),不適合直接對話。
1) q + 數(shù)字:代表每個參數(shù)用多少 bit 存儲。
- 數(shù)字越小 = 文件越小 = 速度越快 = 稍微變笨一點。
- 數(shù)字越大 = 文件越大 = 速度越慢 = 越聰明。
- 黃金標準:目前業(yè)界公認 4-bit (
q4) 是性價比最高的,智商損失微乎其微,但體積減半。
2)k:代表使用了 K-quants 量化技術(shù)(一種更先進的壓縮算法,比老式的 q4_0 更聰明)。
3)m / s / l:代表 Small (小), Medium (中), Large (大)。
q4_k_s:更小一點,稍微笨一點點。q4_k_m:標準版,平衡最好(首選)。q4_k_l:更大一點,稍微聰明一點點(但顯存占用也高)。
2.2、Modelfile 的基本結(jié)構(gòu)及含義
FROM <model> SYSTEM <system_prompt> PARAMETER <name> <value> TEMPLATE <template> ADAPTER <path> PROJECTOR <path> MESSAGE <role> <content> LICENSE <text>
含義解釋:
FROM <model>: 指定基礎(chǔ)模型(必選)。 SYSTEM <system_prompt>: 設(shè)置系統(tǒng)提示詞(定義人設(shè))。 PARAMETER <name> <value>: 設(shè)置推理參數(shù)(如溫度、上下文長度)。 TEMPLATE <template>: 定義對話模板格式。 ADAPTER <path>: 加載 LoRA 適配器文件(用于微調(diào)模型)。 PROJECTOR <path>: 加載多模態(tài)投影器(用于讓模型看懂圖片)。 MESSAGE <role> <content>: 預(yù)設(shè)對話示例(Few-shot prompting)。 LICENSE <text>: 聲明模型的許可證信息。
一般用到的是:
FROM llama3 # 1. 選基座 SYSTEM "你是個詩人" # 2. 定人設(shè) PARAMETER temperature 0.8 # 3. 調(diào)參數(shù)
2.3、Notebook是什么
雖然本文主要講本地部署,但如果本地資源不足(如顯存不夠),可以使用 ModelScope Notebook 在云端免費體驗大模型,無需本地硬件。
ModelScope Notebook 是一款云端機器學(xué)習(xí)開發(fā)IDE工具,提供交互式編程環(huán)境,為用戶提供了開箱可用的限時免費算力額度,實現(xiàn)ModelScope模型開發(fā)環(huán)境與CPU/GPU等多樣化計算資源的無縫連接。
2.4、運行大模型的通俗理解
把運行大模型想象成“搬家”。
- 量化等級(Quantization)= 家具的打包壓縮程度
- 推理框架 = 運輸工具的選擇
- 上下文長度(Context Length)= 這次要搬多少東西(記憶量)
3、實戰(zhàn)部署:安裝與運行
3.1、安裝 Ollama
Ollama 是一個開源的、專為本地運行大型語言模型(LLM)設(shè)計的工具平臺,就像是“大模型的 Docker”。

官網(wǎng)下載后安裝:
# 查看版本號 ollama -v ollama version is 0.17.7
3.2、方式一:一鍵拉?。ü俜酵扑]),Ollama界面/命令行拉取
通過Ollama拉去的鏡像不用創(chuàng)建下面的Modelfile。
# 下載并運行模型 ollama run qwen2.5:3b


3.3、方式二:自定義導(dǎo)入 (進階),下載gguf文件自行配置
1)從ModelScope下載gguf文件

通過modelscope來進行瀏覽器下載模型,用Qwen2.5-3B-Instruct-GGUF演示(實際上我部署的就是這個)。

進入模型文件頁,找到類似 qwen2.5-3b-instruct-q4_k_m.gguf 的文件,下載該文件。
2)編寫Modelfile文件
Modelfile是Ollama用來實現(xiàn)大模型推理的自定義參數(shù)文件,類似于Dockerfile。
如果你只是簡單對話,Ollama 官方庫里的默認模板通常已經(jīng)適配好了 Qwen 系列,手動指定 TEMPLATE 僅在需要特殊對話格式或微調(diào)時才必要。具體可以見文末【4.3、Modelfile 的基本結(jié)構(gòu)及含義】
新建文件,命名為Modelfile,內(nèi)容如下:
FROM "G:\AI\Modelfiles\qwen2.5-3b\qwen2.5-3b-instruct-q4_k_m.gguf"
TEMPLATE """{{- if .Messages }}
{{- range $i, $_ := .Messages }}
{{- $last := eq (len (slice $.Messages $i)) 1 }}
{{- if eq .Role "user" }}<|im_start|>user
{{ .Content }}<|im_end|>
{{ else if eq .Role "assistant" }}<|im_start|>assistant
{{ .Content }}<|im_end|>
{{ else if eq .Role "system" }}<|im_start|>system
{{ .Content }}<|im_end|>
{{ end }}
{{- if $last }}<|im_start|>assistant
{{ end }}
{{- end }}
{{- else }}
{{- if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
{{ end }}"""
PARAMETER stop <|im_end|>
PARAMETER stop <|im_start|>
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
PARAMETER repeat_penalty 1.05
LICENSE """https://huggingface.co/Qwen/Qwen2.5-3B-Instruct/blob/main/LICENSE"""
最簡單版(自問自答幾乎沒法用)
FROM "F:\\Downloads\qwen2.5-3b-instruct-q4_k_m.gguf"
3)創(chuàng)建模型
打開Powershell,找到剛才的Modelfile文件的路徑,執(zhí)行以下命令:
# 把 GGUF 文件打包成 Ollama 模型 ollama create qwen2.5:3b -f Modelfile # 或者用絕對路徑 ollama create qwen2.5:3b -f G:\AI\Modelfiles\qwen2.5-3b\Modelfile

4)運行模型
Ollama 默認會自動檢測并使用GPU。Ollama 為了優(yōu)化資源,默認會在 5 分鐘 無活動后卸載模型;當再次發(fā)起請求時,如果模型已卸載,Ollama 會重新加載該模型到顯存/內(nèi)存中,然后處理請求。這會導(dǎo)致首次請求有額外的延遲(加載時間)。
ollama run qwen2.5:3b

查看大模型狀態(tài):
SIZE: 占用內(nèi)存大小PROCESSOR:100% CPU: 表示模型完全在中央處理器上運行,沒有使用顯卡(GPU)加速。我的顯卡的顯存只有4GB。CONTEXT:上下文窗口大小。當前會話保留的“記憶”長度(Token 數(shù)量)。這個數(shù)字越大,占用的內(nèi)存也越大。UNTIL(自動卸載倒計時):表示如果接下來沒有任何人使用該模型,Ollama 將在 2 分鐘后 自動把它從內(nèi)存中卸載,以釋放資源。

5)示例:Qwen2.5-7B的配置
文件名:qwen2.5-7b-instruct-q4_k_m.gguf
FROM ./qwen2.5-7b-instruct-q4_k_m.gguf
TEMPLATE """{{- if .System }}
<|im_start|>system
{{ .System }}<|im_end|>
{{- end }}
<|im_start|>user
{{ .Prompt }}<|im_end|>
<|im_start|>assistant
"""
PARAMETER stop <|im_end|>
PARAMETER stop <|im_start|>
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
SYSTEM "你是一個有幫助的AI助手。"4、通過API訪問大模型
4.1、啟動服務(wù)
# 運行命令查看端口 ollama serve # 返回信息:Error: listen tcp 127.0.0.1:11434: bind: Only one usage of each socket address (protocol/network address/port) is normally permitted.
默認 Ollama 只接受本機連接,拒絕局域網(wǎng) IP(192.168.x.x),需要讓 Ollama 暴露在網(wǎng)絡(luò)上,Windows環(huán)境下按照下圖配置即可。

4.2、Powershell中測試接口
# Windows Powershell
curl http://192.168.2.111:11434/api/generate -d "{\"model\": \"qwen2.5:3b\", \"prompt\": \"hello\"}"
curl http://192.168.31.87:11434/api/tags4.3、后臺方式運行技巧
Start-Process ollama -ArgumentList "run","qwen2.5:3b" -WindowStyle Hidden
5、常用命令速查表
Ollama相關(guān)文檔
# 查看幫助 ollama -h # 查看本地已下載的模型 ollama list # 下載并運行模型 ollama run qwen2.5:3b # ollama run <模型名> <提示詞>,單次問答 ollama run qwen2.5:3b "你好,請介紹一下你自己" # 刪除模型 ollama rm <模型名> # 啟動后臺服務(wù) ollama serve # 查看模型詳情 ollama show <模型名> # 查看正在運行的模型 ollama ps ollama stop qwen2.5:3b
6、附錄與參考資料
ModelScope Pip 安裝詳解
# 安裝python python -V Python 3.11.9 # 安裝魔搭 pip install modelscope # 下載完整模型庫 modelscope download --model Qwen/Qwen2.5-3B-Instruct-GGUF # 下載單個文件到指定本地文件夾(以下載README.md到當前路徑下“dir”目錄為例) modelscope download --model Qwen/Qwen2.5-3B-Instruct-GGUF README.md --local_dir ./dir
以上就是Windows11下Ollama部署Qwen2.5大模型的實戰(zhàn)指南的詳細內(nèi)容,更多關(guān)于Ollama部署Qwen2.5的資料請關(guān)注腳本之家其它相關(guān)文章!
相關(guān)文章
本文主要介紹如何在 Windows 系統(tǒng)快速部署 Ollama 開源大語言模型運行工具,并安裝 Open WebUI 結(jié)合 cpolar 內(nèi)網(wǎng)穿透軟件,實現(xiàn)在公網(wǎng)環(huán)境也能訪問你在本地內(nèi)網(wǎng)搭建的 llam2026-04-07
Windows系統(tǒng)使用Ollama部署本地大模型的實現(xiàn)步驟
本文主要介紹了在Ollama平臺下載和安裝AI模型的方法,包括點擊按鈕安裝和使用指令下載兩種方式,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價2026-04-29



