最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

openclaw使用llama.cpp本地大模型部署完整步驟

  發(fā)布時(shí)間:2026-04-15 11:29:04   作者:Honmaple   我要評(píng)論
llama.cpp 是當(dāng)前開(kāi)源大模型本地化部署領(lǐng)域最具代表性和實(shí)用價(jià)值的輕量級(jí)推理框架之一,其核心設(shè)計(jì)理念是極致精簡(jiǎn)、跨平臺(tái)兼容、零依賴(lài)運(yùn)行,這篇文章主要介紹了openclaw使用llama.cpp本地大模型部署的相關(guān)資料,文中通過(guò)圖文及代碼介紹的非常詳細(xì),需要的朋友可以參考下

前言

本教程基于實(shí)際操作整理,適用于 Windows WSL2 環(huán)境

全程使用 openclaw 幫我搭建大模型

一、環(huán)境準(zhǔn)備

1. 硬件要求

顯卡推薦模型顯存占用
GTX 1050 Ti (4GB)Qwen2.5-3B Q4~2.5GB
RTX 4060 (8GB)Qwen2.5-7B Q4~5GB
RTX 4090 (24GB)Qwen2.5-32B Q4~20GB

2. 安裝編譯工具(WSL Ubuntu)

sudo apt update
sudo apt install -y cmake build-essential

二、下載和編譯 llama.cpp

1. 克隆源碼

mkdir -p ~/llama.cpp
cd ~/llama.cpp
git clone --depth 1 https://github.com/ggerganov/llama.cpp.git src

2. 編譯

cd ~/llama.cpp/src
mkdir build && cd build
cmake .. -DCMAKE_BUILD_TYPE=Release
make -j$(nproc) llama-cli llama-server

編譯完成后,可執(zhí)行文件在 ~/llama.cpp/src/build/bin/ 目錄下。

三、下載模型

1. 創(chuàng)建模型目錄

mkdir -p ~/llama.cpp/models

2. 下載 GGUF 模型(使用國(guó)內(nèi)鏡像加速)

Qwen2.5-3B(適合 4GB 顯存):

curl -L -o ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \
  "https://hf-mirror.com/Qwen/Qwen2.5-3B-Instruct-GGUF/resolve/main/qwen2.5-3b-instruct-q4_k_m.gguf"

Qwen2.5-7B(適合 8GB 顯存):

curl -L -o ~/llama.cpp/models/qwen2.5-7b-instruct-q4_k_m.gguf \
  "https://hf-mirror.com/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf"

四、運(yùn)行模型

方式一:命令行交互模式

cd ~/llama.cpp/src/build/bin
./llama-cli -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \
  -c 4096 \
  --no-display-prompt

參數(shù)說(shuō)明:

  • -m 模型路徑
  • -c 上下文長(zhǎng)度(默認(rèn) 512,建議 4096)
  • -ngl GPU 層數(shù)(純 CPU 可不加)

方式二:?jiǎn)?dòng) API 服務(wù)

cd ~/llama.cpp/src/build/bin
./llama-server \
  -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \
  --host 0.0.0.0 \
  --port 8080 \
  -c 4096

服務(wù)啟動(dòng)后訪問(wèn):http://localhost:8080

五、API 調(diào)用方法

API 信息

項(xiàng)目
地址http://localhost:8080
API Key不需要(或隨意填寫(xiě))
兼容格式OpenAI API

端點(diǎn)列表

端點(diǎn)說(shuō)明
POST /v1/chat/completions聊天補(bǔ)全
POST /v1/completions文本補(bǔ)全
GET /health健康檢查
GET /Web 聊天界面

調(diào)用示例

curl

curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5-3b",
    "messages": [
      {"role": "system", "content": "你是一個(gè)有幫助的助手。"},
      {"role": "user", "content": "你好,介紹一下你自己"}
    ],
    "temperature": 0.7,
    "max_tokens": 512
  }'

Python(OpenAI SDK)

from openai import OpenAI
client = OpenAI(
    base_url="http://localhost:8080/v1",
    api_key="not-needed"
)
response = client.chat.completions.create(
    model="qwen2.5-3b",
    messages=[
        {"role": "system", "content": "你是一個(gè)有幫助的助手。"},
        {"role": "user", "content": "你好"}
    ],
    temperature=0.7,
    max_tokens=512
)
print(response.choices[0].message.content)

Node.js

const response = await fetch('http://localhost:8080/v1/chat/completions', {
  method: 'POST',
  headers: { 'Content-Type': 'application/json' },
  body: JSON.stringify({
    model: 'qwen2.5-3b',
    messages: [{ role: 'user', content: '你好' }]
  })
});
const data = await response.json();
console.log(data.choices[0].message.content);

六、常用參數(shù)說(shuō)明

服務(wù)端參數(shù)(llama-server)

參數(shù)說(shuō)明示例
-m模型路徑-m model.gguf
--host監(jiān)聽(tīng)地址--host 0.0.0.0
--port端口--port 8080
-c上下文長(zhǎng)度-c 4096
-nglGPU 層數(shù)-ngl 99(全部放 GPU)
-np并行請(qǐng)求數(shù)-np 4
--api-key設(shè)置 API Key--api-key your-key

API 請(qǐng)求參數(shù)

參數(shù)說(shuō)明默認(rèn)值
temperature隨機(jī)性(0-2)0.7
max_tokens最大生成長(zhǎng)度模型上限
top_p核采樣1.0
stream流式輸出false
stop停止詞[]

七、常見(jiàn)問(wèn)題

Q1: 報(bào)錯(cuò) “CUDA out of memory”

減少 -ngl 數(shù)值,讓部分層用 CPU 計(jì)算:

./llama-server -m model.gguf -ngl 20  # 只放 20 層到 GPU

Q2: 中文亂碼

PowerShell 執(zhí)行:

chcp 65001

Q3: 如何后臺(tái)運(yùn)行服務(wù)?

nohup ./llama-server -m model.gguf --host 0.0.0.0 --port 8080 > server.log 2>&1 &

Q4: 如何設(shè)置 API Key 認(rèn)證?

./llama-server -m model.gguf --api-key "your-secret-key"

調(diào)用時(shí)需要帶上:

curl -H "Authorization: Bearer your-secret-key" ...

Q5: 從其他設(shè)備訪問(wèn)

  1. 查看 WSL IP:hostname -I
  2. 使用該 IP 訪問(wèn),如 http://172.x.x.x:8080

八、推薦模型

模型大小適合場(chǎng)景
Qwen2.5-3B-Instruct Q4~2GB輕量對(duì)話、低配設(shè)備
Qwen2.5-7B-Instruct Q4~4.5GB通用對(duì)話、代碼
Qwen2.5-14B-Instruct Q4~9GB復(fù)雜推理
DeepSeek-R1-Distill-Qwen-7B Q4~4.5GB數(shù)學(xué)、邏輯推理
Mistral-7B-v0.3 Q5~5GB英文、代碼

下載地址: https://hf-mirror.com(國(guó)內(nèi)鏡像)

九、文件結(jié)構(gòu)

~/llama.cpp/
├── src/                    # llama.cpp 源碼
│   └── build/
│       └── bin/
│           ├── llama-cli       # 命令行工具
│           └── llama-server    # API 服務(wù)
└── models/                 # 模型存放目錄
    └── qwen2.5-3b-instruct-q4_k_m.gguf

十、快速啟動(dòng)腳本

創(chuàng)建 start-server.sh

#!/bin/bash
cd ~/llama.cpp/src/build/bin
./llama-server \
  -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \
  --host 0.0.0.0 \
  --port 8080 \
  -c 4096 \
  -np 4

賦予執(zhí)行權(quán)限:

chmod +x start-server.sh
./start-server.sh

基于 llama.cpp b7917 + Qwen2.5-3B-Instruct

總結(jié)

到此這篇關(guān)于openclaw使用llama.cpp本地大模型部署完整步驟的文章就介紹到這了,更多相關(guān)openclaw使用llama.cpp本地大模型內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!

相關(guān)文章

最新評(píng)論

开封县| 通化市| 呼和浩特市| 凤庆县| 内江市| 米泉市| 南丹县| 湘乡市| 祁东县| 汝城县| 娄底市| 舞钢市| 罗田县| 长岛县| 禹城市| 石狮市| 泉州市| 宁河县| 新龙县| 同江市| 五原县| 墨脱县| 雷州市| 奈曼旗| 黄陵县| 临江市| 布尔津县| 高邮市| 罗平县| 延吉市| 郎溪县| 左云县| 和政县| 郁南县| 普兰店市| 南昌市| 聂拉木县| 黄大仙区| 弋阳县| 东丽区| 昂仁县|