Ollama本地大模型安裝配置的完整流程教學(xué)
Ollama介紹和特性
Ollama是一個輕量級、易于使用的大模型管理和部署工具,主要用于簡化大模型的運(yùn)行和交互。并且為開發(fā)者和用戶提供了快速加載、管理和調(diào)用多種主流大模型的能力,同時支持本地化部署各類大模型。
核心特點(diǎn):
- ? 輕量化設(shè)計(jì):Ollama體積小巧,安裝簡單,適合個人開發(fā)者和小型團(tuán)隊(duì)
- ? 多模型支持:支持多種主流大模型,如Llama系列、Qwen系列、Deepseek系列等
- ? 資源優(yōu)化:通過量化技術(shù)降低模型顯存占用,減少對高性能GPU的依賴
- ? 易用性:提供命令行工具和圖形化界面,方便用戶操作
- ? 擴(kuò)展性強(qiáng):可以與其他工具(如 Kubernetes、Docker)結(jié)合,實(shí)現(xiàn)分布式部署和管理
Ollama與其它工具對比
Ollama
官網(wǎng):https://ollama.com/
安裝簡單,提供 CLI 和 WebUI,適合初學(xué)者和開發(fā)者。支持量化技術(shù)降低內(nèi)存占用,適合普通硬件、支持 Linux、macOS 和 Windows、支持大部分主流模型。但是 Ollama 并發(fā)性能不如 vLLM。
vLLM
官網(wǎng):https://vllm.ai/
vLLM 是一個高效的大模型推理和服務(wù)引擎,在多 GPU 環(huán)境下性能表現(xiàn)優(yōu)異,更適合大規(guī)模在線推理服務(wù)。但是 vLLM 的部署復(fù)雜度較高,需要一定的技術(shù)基礎(chǔ),主要面向 Linux,跨平臺支持有限。
LocalAI
官網(wǎng):https://localai.io/
LocalAI 和 Ollama 相似,是一個輕量級的本地大模型服務(wù)框架,開箱即用,無需復(fù)雜配置。但是性能優(yōu)化不如 vLLM 和 Ollama,并且功能較少,比如不支持多線程加速等。
Ollama安裝部署
Linux 手動安裝 Ollama
下載并安裝 Ollama:
curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o ollama-linux-amd64.tgz sudo tar -C /usr -xzf ollama-linux-amd64.tgz
創(chuàng)建 Ollama 專用用戶:
sudo useradd -r -s /bin/false -U -m -d /usr/share/ollama ollama sudo usermod -a -G ollama $(whoami)
創(chuàng)建 Ollama 模型存儲目錄:
mkdir /data/ollama/models chown -R ollama.ollama /data/ollama/
創(chuàng)建 Ollama 啟動 Service:
[Unit] Description=Ollama Service After=network-online.target [Service] ExecStart=/usr/bin/ollama serve User=ollama Group=ollama Restart=always RestartSec=3 Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_MODELS=/data/ollama/models" [Install] WantedBy=default.target
將上述配置保存到 /etc/systemd/system/ollama.service
啟動 Ollama 服務(wù):
systemctl daemon-reload systemctl enable --now ollama
查看啟動狀態(tài):
systemctl status ollama
預(yù)期輸出:
● ollama.service - Ollama Service Loaded: loaded (/etc/systemd/system/ollama.service; enabled; vendor preset: disabled) Active: active (running) since ...
測試端口:
curl 127.0.0.1:11434
預(yù)期輸出:
Ollama is running
Ollama 常用命令詳解
下載模型
ollama pull deepseek-r1:1.5b
輸出示例:
pulling manifest
pulling aabd4debf0c8... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 GB
pulling 369ca498f347... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 387 B
pulling 6e4c38e1172f... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 KB
pulling f4d24e9138dd... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 148 B
pulling a85fe2a2e58e... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 487 B
verifying sha256 digest
writing manifest
success
查看本地模型列表
ollama list
輸出示例:
NAME ID SIZE MODIFIED
deepseek-r1:1.5b a42b25d8c10a 1.1 GB 3 minutes ago
phi:latest e2fd6321a5fe 1.6 GB 27 minutes ago
查看模型詳情
ollama show deepseek-r1:1.5b
輸出示例:
architecture qwen2
parameters 1.8B
context length 131072
embedding length 1536
quantization Q4_K_M
Parameters
stop "<|begin▁of▁sentence|>"
stop "<|end▁of▁sentence|>"
stop "<|User|>"
stop "<|Assistant|>"
License
MIT License
Copyright (c) 2023 DeepSeek
啟動一個模型并進(jìn)入交互模式
ollama run phi
交互示例:
>>> who are you?
I am Phi, a large language model trained by Microsoft. I'm here to help you with any questions or tasks you have. What can I assist you with today?
查看當(dāng)前正在運(yùn)行的模型
ollama ps
輸出示例:
NAME ID SIZE PROCESSOR UNTIL
phi:latest e2fd6321a5fe 5.4 GB 100% GPU 4 minutes from now
deepseek-r1:1.5b a42b25d8c10a 2.0 GB 100% GPU About a minute from now
停止一個運(yùn)行中的模型
ollama stop phi:latest
停止后再次查看:
ollama ps
輸出示例:
NAME ID SIZE PROCESSOR UNTIL
deepseek-r1:1.5b a42b25d8c10a 2.0 GB 100% GPU 17 seconds from now
刪除一個本地模型
ollama rm phi:latest
輸出示例:
deleted 'phi:latest'
刪除后再次查看:
ollama list
輸出示例:
NAME ID SIZE MODIFIED
deepseek-r1:1.5b a42b25d8c10a 1.1 GB 42 hours ago
Ollama WebUI 部署
注意:Ollama WebUI 需要使用 Docker 啟動,如果服務(wù)器沒有安裝 Docker,需要先安裝 Docker。
創(chuàng)建數(shù)據(jù)目錄:
mkdir -p /data/ollama/webui
直接使用 docker 部署即可:
docker run -d -p 3000:8080 -e ENABLE_OPENAI_API=false -e OLLAMA_BASE_URL=http://[OLLAMA_HOST]:11434 -e HF_HUB_OFFLINE=1 -v /data/ollama/models:/root/.ollama -v /data/ollama/webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
啟動后通過宿主機(jī)的 3000 端口訪問即可。
Ollama 服務(wù)端常用配置
啟動 Ollama 服務(wù)端:
ollama serve
使用自定義端口啟動:
OLLAMA_HOST=0.0.0.0:11435 ollama serve
常用環(huán)境變量:
| 環(huán)境變量 | 說明 | 默認(rèn)值 |
|---|---|---|
OLLAMA_DEBUG | 啟用調(diào)試模式,設(shè)置為 1 表示開啟 | - |
OLLAMA_HOST | 指定 Ollama 服務(wù)綁定的 IP 地址和端口 | 127.0.0.1:11434 |
OLLAMA_KEEP_ALIVE | 設(shè)置模型在內(nèi)存中保持加載的時間 | 5m |
OLLAMA_MAX_LOADED_MODELS | 限制每塊 GPU 上同時加載的最大模型數(shù)量 | - |
OLLAMA_MAX_QUEUE | 設(shè)置請求隊(duì)列的最大長度,超過限制新請求會被拒絕 | - |
OLLAMA_MODELS | 指定模型文件存儲的目錄路徑 | ~/.ollama/models |
OLLAMA_NUM_PARALLEL | 限制同時處理的最大并行請求數(shù) | - |
OLLAMA_NOPRUNE | 禁用啟動時模型清理操作 | - |
OLLAMA_ORIGINS | 指定允許跨域訪問的來源列表(逗號分隔) | - |
OLLAMA_SCHED_SPREAD | 強(qiáng)制將模型調(diào)度到所有可用 GPU 上,均勻分布 | - |
OLLAMA_FLASH_ATTENTION | 啟用 Flash Attention 技術(shù),硬件不支持可能報(bào)錯 | - |
OLLAMA_KV_CACHE_TYPE | 指定 K/V 緩存的量化類型 | f16 |
OLLAMA_GPU_OVERHEAD | 預(yù)留顯存,防止其他進(jìn)程因顯存不足而崩潰 | - |
OLLAMA_LOAD_TIMEOUT | 設(shè)置模型加載的最大超時時間(分鐘) | 5m |
限制使用指定GPU
默認(rèn)情況下,Ollama 可以使用所有可用 GPU 進(jìn)行模型推理。如果需要限制 Ollama 只能使用特定的 GPU,可以通過 CUDA_VISIBLE_DEVICES 環(huán)境變量進(jìn)行控制。
例如,限制 Ollama 只能使用 0 和 1 兩個 GPU,編輯 /etc/systemd/system/ollama.service:
[Unit] Description=Ollama Service After=network-online.target [Service] ExecStart=/usr/bin/ollama serve User=ollama Group=ollama Restart=always RestartSec=3 Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_MODELS=/data/ollama/models" Environment="CUDA_VISIBLE_DEVICES=0,1" [Install] WantedBy=default.target
修改完成后,重新加載配置并重啟 Ollama 服務(wù):
systemctl daemon-reload systemctl restart ollama
進(jìn)階說明
如果你的系統(tǒng)中搭載了多張英偉達(dá)顯卡,且希望限制 Ollama 僅使用其中部分顯卡,可將 CUDA_VISIBLE_DEVICES 設(shè)置為以逗號分隔的顯卡列表。
- 使用數(shù)字編號:可以直接使用數(shù)字編號作為顯卡標(biāo)識,但編號順序可能會發(fā)生變化
- 使用 UUID(推薦):使用 UUID 更為可靠,不會因硬件變更而改變
查看顯卡的 UUID:
nvidia-smi -L
強(qiáng)制使用 CPU 運(yùn)算:如果想忽略顯卡并強(qiáng)制 Ollama 使用 CPU 運(yùn)算,可輸入無效的顯卡編號,例如:
Environment="CUDA_VISIBLE_DEVICES=-1"
到此這篇關(guān)于Ollama本地大模型安裝配置的完整流程教學(xué)的文章就介紹到這了,更多相關(guān)Ollama本地大模型安裝配置內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!
相關(guān)文章

Python + Ollama 本地跑大模型:零成本搭建你的私有 AI 助手
文章介紹Ollama本地AI助手的安裝方法,從環(huán)境準(zhǔn)備、快速上手到實(shí)戰(zhàn)項(xiàng)目,并探討了其核心優(yōu)勢,包括零成本、零數(shù)據(jù)風(fēng)險、零門檻和零妥協(xié),通過使用Ollama,用戶可以在本地運(yùn)行大2026-04-09
三種快速安裝下載OLLAMA的方法小結(jié)(任何版本都適用)
本文主要介紹了三種快速下載OLLAMA的方法小結(jié),文中通過圖文步驟介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2026-03-31
ollama本地部署DeepSeek教程的實(shí)現(xiàn)
本文主要介紹如何使用ollama本地部署deepseek大模型,以及使用WebUI工具界面進(jìn)行交互,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需2026-03-31
Docker部署Ollama搭建本地AI開發(fā)環(huán)境
本文介紹如何通過Docker+Ollama搭建本地AI開發(fā)環(huán)境,解決云端API調(diào)用成本高、延遲大的問題,幫助開發(fā)者快速實(shí)現(xiàn)本地AI應(yīng)用開發(fā),無需擔(dān)心API調(diào)用限制和費(fèi)用問題,感興趣的可2026-03-30
Windows11下Ollama部署Qwen2.5大模型的實(shí)戰(zhàn)指南
本文旨在記錄 如何在Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實(shí)現(xiàn) API 調(diào)用,無需顯卡也能跑”、能夠確保隱私安全,有需要的小伙伴可以跟隨小編一起了解2026-03-18
與 Ollama 模型交互是使用大語言模型(LLM)進(jìn)行對話、生成文本或執(zhí)行任務(wù)的核心功能,Ollama 提供兩種主要交互方式:通過命令行界面(CLI)的交互式終端和通過 REST API 的2026-03-09
Ollama 提供了多種方式與模型進(jìn)行交互,其中最常見的就是通過命令行進(jìn)行推理操作2026-03-09







