最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Ollama本地大模型安裝配置的完整流程教學(xué)

  發(fā)布時間:2026-04-12 11:03:23   作者:大崔的Linux導(dǎo)航   我要評論
Ollama是一個輕量級、易于使用的大模型管理和部署工具,主要用于簡化大模型的運(yùn)行和交互,并且為開發(fā)者和用戶提供了快速加載,管理和調(diào)用多種主流大模型的能力,下面我們就來看看Ollama本地大模型安裝配置的完整教程吧

Ollama介紹和特性

Ollama是一個輕量級、易于使用的大模型管理和部署工具,主要用于簡化大模型的運(yùn)行和交互。并且為開發(fā)者和用戶提供了快速加載、管理和調(diào)用多種主流大模型的能力,同時支持本地化部署各類大模型。

核心特點(diǎn):

  • ? 輕量化設(shè)計(jì):Ollama體積小巧,安裝簡單,適合個人開發(fā)者和小型團(tuán)隊(duì)
  • ? 多模型支持:支持多種主流大模型,如Llama系列、Qwen系列、Deepseek系列等
  • ? 資源優(yōu)化:通過量化技術(shù)降低模型顯存占用,減少對高性能GPU的依賴
  • ? 易用性:提供命令行工具和圖形化界面,方便用戶操作
  • ? 擴(kuò)展性強(qiáng):可以與其他工具(如 Kubernetes、Docker)結(jié)合,實(shí)現(xiàn)分布式部署和管理

Ollama與其它工具對比

Ollama

官網(wǎng):https://ollama.com/

安裝簡單,提供 CLI 和 WebUI,適合初學(xué)者和開發(fā)者。支持量化技術(shù)降低內(nèi)存占用,適合普通硬件、支持 Linux、macOS 和 Windows、支持大部分主流模型。但是 Ollama 并發(fā)性能不如 vLLM。

vLLM

官網(wǎng):https://vllm.ai/

vLLM 是一個高效的大模型推理和服務(wù)引擎,在多 GPU 環(huán)境下性能表現(xiàn)優(yōu)異,更適合大規(guī)模在線推理服務(wù)。但是 vLLM 的部署復(fù)雜度較高,需要一定的技術(shù)基礎(chǔ),主要面向 Linux,跨平臺支持有限。

LocalAI

官網(wǎng):https://localai.io/

LocalAI 和 Ollama 相似,是一個輕量級的本地大模型服務(wù)框架,開箱即用,無需復(fù)雜配置。但是性能優(yōu)化不如 vLLM 和 Ollama,并且功能較少,比如不支持多線程加速等。

Ollama安裝部署

Linux 手動安裝 Ollama

下載并安裝 Ollama:

curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o ollama-linux-amd64.tgz
sudo tar -C /usr -xzf ollama-linux-amd64.tgz

創(chuàng)建 Ollama 專用用戶:

sudo useradd -r -s /bin/false -U -m -d /usr/share/ollama ollama
sudo usermod -a -G ollama $(whoami)

創(chuàng)建 Ollama 模型存儲目錄:

mkdir /data/ollama/models
chown -R ollama.ollama /data/ollama/

創(chuàng)建 Ollama 啟動 Service:

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_MODELS=/data/ollama/models"

[Install]
WantedBy=default.target

將上述配置保存到 /etc/systemd/system/ollama.service

啟動 Ollama 服務(wù):

systemctl daemon-reload
systemctl enable --now ollama

查看啟動狀態(tài):

systemctl status ollama

預(yù)期輸出:

● ollama.service - Ollama Service
   Loaded: loaded (/etc/systemd/system/ollama.service; enabled; vendor preset: disabled)
   Active: active (running) since ...

測試端口:

curl 127.0.0.1:11434

預(yù)期輸出:

Ollama is running

Ollama 常用命令詳解

下載模型

ollama pull deepseek-r1:1.5b

輸出示例:

pulling manifest
pulling aabd4debf0c8... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 GB
pulling 369ca498f347... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 387 B
pulling 6e4c38e1172f... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 KB
pulling f4d24e9138dd... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 148 B
pulling a85fe2a2e58e... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 487 B
verifying sha256 digest
writing manifest
success

查看本地模型列表

ollama list

輸出示例:

NAME               ID            SIZE    MODIFIED
deepseek-r1:1.5b   a42b25d8c10a 1.1 GB  3 minutes ago
phi:latest         e2fd6321a5fe 1.6 GB  27 minutes ago

查看模型詳情

ollama show deepseek-r1:1.5b

輸出示例:

  architecture        qwen2
  parameters          1.8B
  context length      131072
  embedding length    1536
  quantization        Q4_K_M

Parameters
  stop "<|begin▁of▁sentence|>"
  stop "<|end▁of▁sentence|>"
  stop "<|User|>"
  stop "<|Assistant|>"

License
  MIT License
  Copyright (c) 2023 DeepSeek

啟動一個模型并進(jìn)入交互模式

ollama run phi

交互示例:

>>> who are you?
I am Phi, a large language model trained by Microsoft. I'm here to help you with any questions or tasks you have. What can I assist you with today?

查看當(dāng)前正在運(yùn)行的模型

ollama ps

輸出示例:

NAME               ID            SIZE    PROCESSOR   UNTIL
phi:latest         e2fd6321a5fe 5.4 GB  100% GPU   4 minutes from now
deepseek-r1:1.5b   a42b25d8c10a 2.0 GB  100% GPU   About a minute from now

停止一個運(yùn)行中的模型

ollama stop phi:latest

停止后再次查看:

ollama ps

輸出示例:

NAME               ID            SIZE    PROCESSOR   UNTIL
deepseek-r1:1.5b   a42b25d8c10a 2.0 GB  100% GPU   17 seconds from now

刪除一個本地模型

ollama rm phi:latest

輸出示例:

deleted 'phi:latest'

刪除后再次查看:

ollama list

輸出示例:

NAME               ID            SIZE    MODIFIED
deepseek-r1:1.5b   a42b25d8c10a 1.1 GB  42 hours ago

Ollama WebUI 部署

注意:Ollama WebUI 需要使用 Docker 啟動,如果服務(wù)器沒有安裝 Docker,需要先安裝 Docker。

創(chuàng)建數(shù)據(jù)目錄:

mkdir -p /data/ollama/webui

直接使用 docker 部署即可:

docker run -d -p 3000:8080 -e ENABLE_OPENAI_API=false -e OLLAMA_BASE_URL=http://[OLLAMA_HOST]:11434 -e HF_HUB_OFFLINE=1 -v /data/ollama/models:/root/.ollama -v /data/ollama/webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

啟動后通過宿主機(jī)的 3000 端口訪問即可。

Ollama 服務(wù)端常用配置

啟動 Ollama 服務(wù)端:

ollama serve

使用自定義端口啟動:

OLLAMA_HOST=0.0.0.0:11435 ollama serve

常用環(huán)境變量:

環(huán)境變量說明默認(rèn)值
OLLAMA_DEBUG啟用調(diào)試模式,設(shè)置為 1 表示開啟-
OLLAMA_HOST指定 Ollama 服務(wù)綁定的 IP 地址和端口127.0.0.1:11434
OLLAMA_KEEP_ALIVE設(shè)置模型在內(nèi)存中保持加載的時間5m
OLLAMA_MAX_LOADED_MODELS限制每塊 GPU 上同時加載的最大模型數(shù)量-
OLLAMA_MAX_QUEUE設(shè)置請求隊(duì)列的最大長度,超過限制新請求會被拒絕-
OLLAMA_MODELS指定模型文件存儲的目錄路徑~/.ollama/models
OLLAMA_NUM_PARALLEL限制同時處理的最大并行請求數(shù)-
OLLAMA_NOPRUNE禁用啟動時模型清理操作-
OLLAMA_ORIGINS指定允許跨域訪問的來源列表(逗號分隔)-
OLLAMA_SCHED_SPREAD強(qiáng)制將模型調(diào)度到所有可用 GPU 上,均勻分布-
OLLAMA_FLASH_ATTENTION啟用 Flash Attention 技術(shù),硬件不支持可能報(bào)錯-
OLLAMA_KV_CACHE_TYPE指定 K/V 緩存的量化類型f16
OLLAMA_GPU_OVERHEAD預(yù)留顯存,防止其他進(jìn)程因顯存不足而崩潰-
OLLAMA_LOAD_TIMEOUT設(shè)置模型加載的最大超時時間(分鐘)5m

限制使用指定GPU

默認(rèn)情況下,Ollama 可以使用所有可用 GPU 進(jìn)行模型推理。如果需要限制 Ollama 只能使用特定的 GPU,可以通過 CUDA_VISIBLE_DEVICES 環(huán)境變量進(jìn)行控制。

例如,限制 Ollama 只能使用 01 兩個 GPU,編輯 /etc/systemd/system/ollama.service

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_MODELS=/data/ollama/models"
Environment="CUDA_VISIBLE_DEVICES=0,1"

[Install]
WantedBy=default.target

修改完成后,重新加載配置并重啟 Ollama 服務(wù):

systemctl daemon-reload
systemctl restart ollama

進(jìn)階說明

如果你的系統(tǒng)中搭載了多張英偉達(dá)顯卡,且希望限制 Ollama 僅使用其中部分顯卡,可將 CUDA_VISIBLE_DEVICES 設(shè)置為以逗號分隔的顯卡列表。

  • 使用數(shù)字編號:可以直接使用數(shù)字編號作為顯卡標(biāo)識,但編號順序可能會發(fā)生變化
  • 使用 UUID(推薦):使用 UUID 更為可靠,不會因硬件變更而改變

查看顯卡的 UUID:

nvidia-smi -L

強(qiáng)制使用 CPU 運(yùn)算:如果想忽略顯卡并強(qiáng)制 Ollama 使用 CPU 運(yùn)算,可輸入無效的顯卡編號,例如:

Environment="CUDA_VISIBLE_DEVICES=-1"

到此這篇關(guān)于Ollama本地大模型安裝配置的完整流程教學(xué)的文章就介紹到這了,更多相關(guān)Ollama本地大模型安裝配置內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!

相關(guān)文章

  • Python + Ollama 本地跑大模型:零成本搭建你的私有 AI 助手

    文章介紹Ollama本地AI助手的安裝方法,從環(huán)境準(zhǔn)備、快速上手到實(shí)戰(zhàn)項(xiàng)目,并探討了其核心優(yōu)勢,包括零成本、零數(shù)據(jù)風(fēng)險、零門檻和零妥協(xié),通過使用Ollama,用戶可以在本地運(yùn)行大
    2026-04-09
  • 三種快速安裝下載OLLAMA的方法小結(jié)(任何版本都適用)

    本文主要介紹了三種快速下載OLLAMA的方法小結(jié),文中通過圖文步驟介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2026-03-31
  • ollama本地部署DeepSeek教程的實(shí)現(xiàn)

    本文主要介紹如何使用ollama本地部署deepseek大模型,以及使用WebUI工具界面進(jìn)行交互,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需
    2026-03-31
  • Docker部署Ollama搭建本地AI開發(fā)環(huán)境

    本文介紹如何通過Docker+Ollama搭建本地AI開發(fā)環(huán)境,解決云端API調(diào)用成本高、延遲大的問題,幫助開發(fā)者快速實(shí)現(xiàn)本地AI應(yīng)用開發(fā),無需擔(dān)心API調(diào)用限制和費(fèi)用問題,感興趣的可
    2026-03-30
  • Windows11下Ollama部署Qwen2.5大模型的實(shí)戰(zhàn)指南

    本文旨在記錄 如何在Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實(shí)現(xiàn) API 調(diào)用,無需顯卡也能跑”、能夠確保隱私安全,有需要的小伙伴可以跟隨小編一起了解
    2026-03-18
  • Ollama 模型交互的三種方式介紹

    與 Ollama 模型交互是使用大語言模型(LLM)進(jìn)行對話、生成文本或執(zhí)行任務(wù)的核心功能,Ollama 提供兩種主要交互方式:通過命令行界面(CLI)的交互式終端和通過 REST API 的
    2026-03-09
  • Ollama 模型交互基礎(chǔ)篇

    Ollama 提供了多種方式與模型進(jìn)行交互,其中最常見的就是通過命令行進(jìn)行推理操作
    2026-03-09

最新評論

周至县| 错那县| 萍乡市| 淳安县| 白朗县| 东明县| 凤凰县| 曲阳县| 沛县| 射阳县| 乳山市| 南溪县| 乐都县| 开封县| 铁力市| 乐亭县| 噶尔县| 奉节县| 桂阳县| 宜良县| 舟山市| 阜城县| 青田县| 墨江| 昌邑市| 山东省| 马尔康县| 昆明市| 沈丘县| 浏阳市| 兰考县| 怀安县| 焦作市| 婺源县| 尉犁县| 蒙山县| 桐柏县| 尤溪县| 凉山| 滕州市| 三原县|