openclaw使用llama.cpp本地大模型部署完整步驟
前言
本教程基于實(shí)際操作整理,適用于 Windows WSL2 環(huán)境
全程使用 openclaw 幫我搭建大模型

一、環(huán)境準(zhǔn)備
1. 硬件要求
| 顯卡 | 推薦模型 | 顯存占用 |
|---|---|---|
| GTX 1050 Ti (4GB) | Qwen2.5-3B Q4 | ~2.5GB |
| RTX 4060 (8GB) | Qwen2.5-7B Q4 | ~5GB |
| RTX 4090 (24GB) | Qwen2.5-32B Q4 | ~20GB |
2. 安裝編譯工具(WSL Ubuntu)
sudo apt update sudo apt install -y cmake build-essential
二、下載和編譯 llama.cpp
1. 克隆源碼
mkdir -p ~/llama.cpp cd ~/llama.cpp git clone --depth 1 https://github.com/ggerganov/llama.cpp.git src
2. 編譯
cd ~/llama.cpp/src mkdir build && cd build cmake .. -DCMAKE_BUILD_TYPE=Release make -j$(nproc) llama-cli llama-server
編譯完成后,可執(zhí)行文件在 ~/llama.cpp/src/build/bin/ 目錄下。
三、下載模型
1. 創(chuàng)建模型目錄
mkdir -p ~/llama.cpp/models
2. 下載 GGUF 模型(使用國(guó)內(nèi)鏡像加速)
Qwen2.5-3B(適合 4GB 顯存):
curl -L -o ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ "https://hf-mirror.com/Qwen/Qwen2.5-3B-Instruct-GGUF/resolve/main/qwen2.5-3b-instruct-q4_k_m.gguf"
Qwen2.5-7B(適合 8GB 顯存):
curl -L -o ~/llama.cpp/models/qwen2.5-7b-instruct-q4_k_m.gguf \ "https://hf-mirror.com/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf"
四、運(yùn)行模型
方式一:命令行交互模式
cd ~/llama.cpp/src/build/bin ./llama-cli -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ -c 4096 \ --no-display-prompt
參數(shù)說(shuō)明:
-m模型路徑-c上下文長(zhǎng)度(默認(rèn) 512,建議 4096)-nglGPU 層數(shù)(純 CPU 可不加)
方式二:?jiǎn)?dòng) API 服務(wù)
cd ~/llama.cpp/src/build/bin ./llama-server \ -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ --host 0.0.0.0 \ --port 8080 \ -c 4096
服務(wù)啟動(dòng)后訪問(wèn):http://localhost:8080
五、API 調(diào)用方法
API 信息
| 項(xiàng)目 | 值 |
|---|---|
| 地址 | http://localhost:8080 |
| API Key | 不需要(或隨意填寫(xiě)) |
| 兼容格式 | OpenAI API |
端點(diǎn)列表
| 端點(diǎn) | 說(shuō)明 |
|---|---|
POST /v1/chat/completions | 聊天補(bǔ)全 |
POST /v1/completions | 文本補(bǔ)全 |
GET /health | 健康檢查 |
GET / | Web 聊天界面 |
調(diào)用示例
curl
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen2.5-3b",
"messages": [
{"role": "system", "content": "你是一個(gè)有幫助的助手。"},
{"role": "user", "content": "你好,介紹一下你自己"}
],
"temperature": 0.7,
"max_tokens": 512
}'Python(OpenAI SDK)
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8080/v1",
api_key="not-needed"
)
response = client.chat.completions.create(
model="qwen2.5-3b",
messages=[
{"role": "system", "content": "你是一個(gè)有幫助的助手。"},
{"role": "user", "content": "你好"}
],
temperature=0.7,
max_tokens=512
)
print(response.choices[0].message.content)Node.js
const response = await fetch('http://localhost:8080/v1/chat/completions', {
method: 'POST',
headers: { 'Content-Type': 'application/json' },
body: JSON.stringify({
model: 'qwen2.5-3b',
messages: [{ role: 'user', content: '你好' }]
})
});
const data = await response.json();
console.log(data.choices[0].message.content);六、常用參數(shù)說(shuō)明
服務(wù)端參數(shù)(llama-server)
| 參數(shù) | 說(shuō)明 | 示例 |
|---|---|---|
-m | 模型路徑 | -m model.gguf |
--host | 監(jiān)聽(tīng)地址 | --host 0.0.0.0 |
--port | 端口 | --port 8080 |
-c | 上下文長(zhǎng)度 | -c 4096 |
-ngl | GPU 層數(shù) | -ngl 99(全部放 GPU) |
-np | 并行請(qǐng)求數(shù) | -np 4 |
--api-key | 設(shè)置 API Key | --api-key your-key |
API 請(qǐng)求參數(shù)
| 參數(shù) | 說(shuō)明 | 默認(rèn)值 |
|---|---|---|
temperature | 隨機(jī)性(0-2) | 0.7 |
max_tokens | 最大生成長(zhǎng)度 | 模型上限 |
top_p | 核采樣 | 1.0 |
stream | 流式輸出 | false |
stop | 停止詞 | [] |
七、常見(jiàn)問(wèn)題
Q1: 報(bào)錯(cuò) “CUDA out of memory”
減少 -ngl 數(shù)值,讓部分層用 CPU 計(jì)算:
./llama-server -m model.gguf -ngl 20 # 只放 20 層到 GPU
Q2: 中文亂碼
PowerShell 執(zhí)行:
chcp 65001
Q3: 如何后臺(tái)運(yùn)行服務(wù)?
nohup ./llama-server -m model.gguf --host 0.0.0.0 --port 8080 > server.log 2>&1 &
Q4: 如何設(shè)置 API Key 認(rèn)證?
./llama-server -m model.gguf --api-key "your-secret-key"
調(diào)用時(shí)需要帶上:
curl -H "Authorization: Bearer your-secret-key" ...
Q5: 從其他設(shè)備訪問(wèn)
- 查看 WSL IP:
hostname -I - 使用該 IP 訪問(wèn),如
http://172.x.x.x:8080
八、推薦模型
| 模型 | 大小 | 適合場(chǎng)景 |
|---|---|---|
| Qwen2.5-3B-Instruct Q4 | ~2GB | 輕量對(duì)話、低配設(shè)備 |
| Qwen2.5-7B-Instruct Q4 | ~4.5GB | 通用對(duì)話、代碼 |
| Qwen2.5-14B-Instruct Q4 | ~9GB | 復(fù)雜推理 |
| DeepSeek-R1-Distill-Qwen-7B Q4 | ~4.5GB | 數(shù)學(xué)、邏輯推理 |
| Mistral-7B-v0.3 Q5 | ~5GB | 英文、代碼 |
下載地址: https://hf-mirror.com(國(guó)內(nèi)鏡像)
九、文件結(jié)構(gòu)
~/llama.cpp/
├── src/ # llama.cpp 源碼
│ └── build/
│ └── bin/
│ ├── llama-cli # 命令行工具
│ └── llama-server # API 服務(wù)
└── models/ # 模型存放目錄
└── qwen2.5-3b-instruct-q4_k_m.gguf十、快速啟動(dòng)腳本
創(chuàng)建 start-server.sh:
#!/bin/bash cd ~/llama.cpp/src/build/bin ./llama-server \ -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ --host 0.0.0.0 \ --port 8080 \ -c 4096 \ -np 4
賦予執(zhí)行權(quán)限:
chmod +x start-server.sh ./start-server.sh
基于 llama.cpp b7917 + Qwen2.5-3B-Instruct
總結(jié)
到此這篇關(guān)于openclaw使用llama.cpp本地大模型部署完整步驟的文章就介紹到這了,更多相關(guān)openclaw使用llama.cpp本地大模型內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!
相關(guān)文章

一文教你OpenClaw Docker 部署并調(diào)用本地Qwen3.5 9B模型
本文詳細(xì)介紹了在 Ubuntu 24.04 系統(tǒng)上通過(guò) Docker 部署 Ollama 并運(yùn)行 Qwen3.5-9B的完整流程,同時(shí)對(duì)接 OpenClaw 實(shí)現(xiàn) Web 交互,文中通過(guò)示例代碼介紹的非常詳細(xì),需要的2026-03-12
Windows本地部署OpenClaw并連接Ollama模型的完整指南
本文檔基于實(shí)際部署經(jīng)驗(yàn)編寫(xiě),旨在幫助大家在 Windows 系統(tǒng)上從零開(kāi)始搭建 OpenClaw,并連接本地 Ollama 模型(如 Qwen2.5 或 Qwen3),使其具備完整的智能體能力,有需要的2026-03-10
OpenClaw+Ollama+Qwen3.5:cloud/Qwen3:0.6b部署本地離線部署AI大模型(無(wú)需GPU)
無(wú)需GPU、無(wú)需云端API,在Windows10/11電腦上,手把手教你部署Ollama+Qwen3.5:cloud(主力模型)+Qwen3:0.6b(輕量備選)+OpenClaw,實(shí)現(xiàn)本地離線運(yùn)行私人AI,感興趣的可以2026-03-10
OpenClaw是本地優(yōu)先、開(kāi)源、可自主執(zhí)行任務(wù)的 AI 智能體框架,不是單純的聊天機(jī)器人,也不是大模型本身,而是把大模型變成能“真干活”的數(shù)字員工,這篇文章主要介紹了OpenC2026-03-06
OpenClaw使用Ollama本地模型的實(shí)現(xiàn)(支持工具調(diào)用))
Ollama 是一個(gè)本地 LLM 運(yùn)行時(shí),可以輕松在你的機(jī)器上運(yùn)行開(kāi)源模型,OpenClaw 通過(guò) Ollama 的 OpenAI 兼容 API 進(jìn)行集成,下面就來(lái)詳細(xì)的介紹一下,感興趣的可以了解一下2026-03-06






